谷歌最近干了一件挺绝的事:它不用看你的银行流水,也不用搜你的资产证明,光靠数你家楼下有几家咖啡馆、几个公交站和几栋高层住宅,就能精准预测你这个社区的平均收入水平。
最骚的操作是,谷歌的研究人员自始至终压根没告诉过 AI 到底什么叫“富裕”,什么叫“贫穷”。
这个模型叫 S2Vec,是谷歌 Earth AI 计划下的最新成果。
它的工作原理非常优雅:把一个区域内所有的建筑物、道路、公园和店铺,全部转化为分层的矢量图像。比如一个网格里有三家咖啡馆和一个公园,就会被映射成特定的像素值。接着,AI 就像计算机视觉模型看照片一样,去“阅读”这幅城市地图。
它的训练过程才是真正的精髓所在——掩码自编码(Masked Autoencoding)。
简单来说,谷歌把一张城市地图挖掉一块,让 AI 做“完形填空”。当模型看到一丛高层住宅紧挨着地铁站,但中间空了一块时,它就会理直气壮地预测:这里应该放一家生鲜超市。
把这种完形填空在全世界的地图上重复做上几亿次,AI 居然自己悟出了人类城市规划的“深层空间语法”。根本不需要人类专家去标注“这里是金融区”或者“那里是郊区住宅”,模型仅凭建筑与设施的相对几何位置,就自己推断出了城市组织的内在规律。
这套训练最终会为地球上的每一个坐标生成一串数字,也就是“空间嵌入”(Embedding)。这串数字就像是地块的数学指纹。把这个指纹丢给后续任务,S2Vec 就能直接估算出这个区域的人口密度、中位数收入,甚至碳排放量。
在完全没见过的全新区域(零样本地理外推)预测上,S2Vec 的表现碾压了一众传统模型。它不仅在社会经济预测上击败了 GEOCLIP,甚至追平或超越了纯看卫星图的 RS-MaMMUT 模型。
这里有一个非常关键的认知差:过去做遥感预测,大家极度依赖卫星照片,但卫星照片其实有硬伤。
卫星视角只能看到屋顶、绿化和地貌,它不知道屋顶下面到底藏着什么。而 S2Vec 用的地图矢量数据,虽然看不到树叶,但它清清楚楚地知道这个屋顶底下有三家咖啡馆、一家药房和一个公交站。不仅更新速度快、处理成本低,对人类社会经济活动的捕捉颗粒度也远超卫星。
当然,只看矢量地图也有短板,它测不出植被覆盖率和地形。于是谷歌把 S2Vec 和卫星图像模型进行融合,组成了强强联手的多模态预测,直接刷新了地学预测的上限。
目前,谷歌的 Earth AI 已经在暗中组建了一套“三体人级别”的遥感矩阵:
PDFM:负责预测人口动态;
RS-MaMMUT:负责解读卫星遥感视觉;
S2Vec:负责剖析人类建构的物理环境。
这三个基础模型一旦叠加在一起,系统读懂一个社区的速度和深度,已经完全超越了在当地生活了十年的老住户。
以前大家选房子、聊社区,总觉得自己在追求“独特的生活方式”或者“中产的气质”。现在看来,在算法眼里,我们那些看似随性的生活选择,不过是极其规律且平庸的几何像素点罢了。
只要你在地铁口旁边连续开出三家精品独立咖啡馆,算法甚至都不用问你的工资,就会在后台悄悄把这块土地的中位数收入调高几个档次。
