为什么机器人突然都在谈“具身智能”,中间到底跳过了什么?
2025年,具身智能从实验室走向工厂、仓储、巡检和服务场景,已经不只是概念展示,中国工业机器人2024年新增装机量达到29.5万台,运行存量超过200万台,这些真实设备正在成为新一轮智能升级的基础。
(信源:新华社,2025年12月30日)
很多人看机器人新闻,会觉得技术路线像坐电梯,控制理论还没看明白,SLAM突然被大模型盖过去,VLA又站到了聚光灯下,仿佛中间少了好几章,其实并不是跳跃,而是过去几十年积累的东西终于开始接上了。
控制理论关心的是,机械臂怎样保持稳定,怎样根据位置、速度和受力完成动作,SLAM关心的是,机器人看不清世界时,怎样判断自己在哪里,周围有什么,深度学习则把一部分决定权交给数据,让机器自己寻找有用的特征。
这几条路线表面上争得很热闹,底层却在做同一件事,那就是从复杂现实里挑出真正影响行动的信息。
工程师不会把房间里的每个灰尘都写进程序,机器人也没必要记住每一块墙砖的纹理,它只需要知道哪里能走,哪里会撞,哪个物体值得抓。
这件事听起来像记忆,其实更像遗忘,猫看到桌子,留下的不是完整画面,而是能不能跳上去,会不会摔下来,附近有没有食物,人类也是这样活着的,我们的大脑每天接收海量信号,却只把少数内容带进下一秒。
所以控制理论是在把世界压缩成动力学,SLAM是在把残缺观测压缩成地图和位置。
视觉网络是在把像素压缩成物体和动作,大模型则把语言、图片和视频里的经验压缩成一种跨任务的常识,这几代技术不是互相推翻,更像是不断换一种方式回答同一个问题。
大模型进入机器人之后,最诱人的地方并不是它会听懂一句指令,而是它能带着人类积累的先验进入陌生环境,机器人不必从零认识杯子,也不用重新学习门通常可以推开,这些经验让它看起来突然聪明了很多,甚至有点不讲道理。
可问题也恰恰藏在这里,模型知道玻璃杯容易碎,却不知道眼前这个杯子有多滑,知道物体应该被轻轻拿起,却不一定知道轻到什么程度,语言和图像告诉它世界是什么样,身体却要承担动作带来的后果,这中间隔着的就是因果。
一个机器人真正学会拿杯子,往往不是因为多看了一万个视频,而是因为它曾经用力过猛,让杯子晃了一下,下一次调整夹爪,再下一次改变接触位置,慢慢摸清重量、摩擦力和重心,这种经验不是看来的,是用行动换来的。
我越来越觉得,具身智能的核心并不是给人工智能装上两条腿,而是让它第一次拥有了不能随便重来的现实,语言模型答错一句话,重新生成就行,机器人抓碎一个杯子,地上会留下碎片,工厂里拧错一颗螺丝,生产线可能真的会停。
这也是为什么具身智能的数据不能只理解成录像和传感器记录,真正有价值的数据应该带着完整链条,机器人做了什么,世界发生了什么,原来的判断错在哪里,下一次准备怎么改,行动、结果、误差、修正,这才是带因果的数据。
有人把VLA看成新一代技术,把传统控制和SLAM看成旧时代遗产。
我认为这种说法太像股市里的换热点,今天追大模型,明天追世界模型,后天再换一个缩写,名字可以变,物理规律不会变,机器人最终还是要处理碰撞、摩擦、延迟和安全边界。
未来真正成熟的系统,很可能不是纯手工建模,也不是把一切交给数据,而是让学习负责发现规律,让物理负责划红线,让规划负责想象后果,让控制负责把动作稳稳落下去,模型可以提出大胆方案,但现实必须有权说不。
从这个角度看,世界模型也不需要复制宇宙,它只要保留那些会影响未来行动的东西,地图不必和真实世界一模一样,潜空间也不必长得像房间,只要能帮助机器人判断下一步往哪里走,怎么拿,什么时候停,就已经足够有用。
我真正关注的分水岭,不是谁的VLA参数更多,也不只是看谁能让机器人连续完成多少个动作,而是看它犯过的错误能不能留下来,能不能改变以后对重量、距离、风险和人的理解。
如果每次失败都被清空,那它只是更大的程序,如果失败会沉淀成经验,智能才算真正开始。
人类的记忆、语言、科学和教育,本质上也在做类似的事情,我们把过去的世界压缩下来,用语言传给别人,再通过实验接受现实检验,文明之所以能进步,是因为经验可以跨越个人寿命不断累积,具身智能正在尝试让机器加入这个循环。
所以机器人从“计算一个世界”走向“在世界中计算”,看起来像机械臂接上大模型,实际上是身体、环境、目标和错误终于闭合在一起。
如果有一天,一台机器人面对从未见过的物体,自己做出一个没被训练过的动作,失败后没人替它改答案,它却能调整对世界的理解,并在第二次真的成功,那一刻才不是演示视频里的聪明,而是机器终于拥有了属于自己的经验。


