众力资讯网

模型认得出地标,却走不完一条路——城市空间智能的真相可能比我们想的更残酷 刚看到

模型认得出地标,却走不完一条路——城市空间智能的真相可能比我们想的更残酷
刚看到上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学和牛津大学联合发布的论文《UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City》。
论文直达:
核心观点一句话概括:现在的多模态大模型能认出城市街景里的每一栋楼,但让它真正走完一条路——短途还行,路一长,成功率直接归零。
研究团队把香港真实三维地理数据做成了一个可以连续行走的城市沙盒。模型从第一人称看街景、查地图、过天桥,也会撞墙、遇到封路和移动行人。结果很有意思:10个模型的视觉识别准确率75.0%到93.8%,认出地标不算难。短程导航最高成功率75.0%,路线一拉长,全部跌到0%到3.8%。
最扎心的对比来自Gemini-3.1-Pro:视觉识别82.5%,方向理解却只有23.3%,甚至低于随机猜测。能认出来那是啥,但一转视角就分不清它在左边还是右边。
长程任务里更离谱。各模型52.5%到81.3%的轨迹结束时比起点更接近目标,可完整到达率只有0%到3.8%。找对了大方向,走对了一段,最后还是卡在半路。封路和移动行人测试更惨——路网遵循率90%以上,封路遵守率只有10.0%到46.7%,碰撞率高达76.3%到90.0%。看见变化了,动作跟不上。
最近上海交通大学动作不小。今年6月,上海交大新增“具身智能”本科专业,2026年起招生,配套开设具身智能拔尖英才试点班。7月与灵心巧手共建具身灵巧操作联合实验室,8月又启动与酷哇科技的通用具身智能联合实验室。香港中文大学也在今年5月成立了全港首个全端具身智能实验室。
这些投入都在回答同一个问题:AI怎么才能真正走进物理世界?UrbanGround给出的答案可能让人不安——现在的模型连在数字孪生城市里完整走完一条路都做不到。
一点想法:视觉识别和空间推理之间,可能隔着一道目前谁也没跨过去的墙。会认路不等于会走路,答对问题不等于能把路走完。如果大模型连在仿真城市里持续导航都做不到,那具身智能进入真实世界的路,可能比我们想象的还要长得多。