众力资讯网

最近机器人圈子里流行一个灵魂拷问: 要是只能挑一个毛病,到底是什么拦着机器人走进

最近机器人圈子里流行一个灵魂拷问:
要是只能挑一个毛病,到底是什么拦着机器人走进咱们的真实生活?
电机不够劲?电池不耐用?
都不是。
答案说出来有点扫兴,是数据,真实世界的数据。

这事来自京东全球科技探索者大会上的一场圆桌,主题就叫具身智能走出 Demo。
台下坐着的都是行内人,智元的姚卯青、智平方的张鹏、鹿明机器人的喻超、逆矩阵科技的陈博远,还有京东探索研究院的黄浩洋。
整机厂、方案商、创业公司、科研机构,凑了一桌。
Demo 这个词,圈外人可能没感觉。圈内人听了会心一笑,还带点苦。你在发布会上看到的机器人,端茶倒水叠衣服,动作行云流水。可你真把它买回家试试?你家的杯子换个颜色,它可能就僵在那儿不知所措了。
实验室里的王者,厨房里的青铜。
这就是 Demo 和真实世界的距离。

距离怎么补?
会上几位吵出了两条路线,还挺有意思。
姚卯青代表主流派,主张分层。
上层用多模态大模型,管理解指令、拆分任务、盯着过程、失败了重新规划,相当于大脑。
下层用专门的策略模型,管精细操作,相当于小脑和手。
大脑说把杯子拿过来,小脑负责别捏碎。他的理由也实在,想训练一个模型包打所有场景,理想很丰满,现实骨感得很。
逆矩阵科技的陈博远走的是另一条道,更猛。
他要直接构建真实物理世界的基座模型,一个模型吃透物理规律。他的底气来自大语言模型的老路:
当年各种垂直小模型满天飞,最后被通用基座一统江湖,物理世界凭啥例外?

谁对?
说实话,现在没人知道。
两条路都在烧钱,都在跑,这就对了。技术路线这事,从来不是吵出来的,是跑出来的。
真正让我眼前一亮的,是他们聊 GPT-6 Astra 的那段。
Astra 发布后,圈内一阵骚动,因为语言模型开始能操控物理设备了。
有人兴奋,说具身模型的未来要被重新定义。陈博远的反应特别接地气,他真的拿 GPT-6 去操作夹爪抓水杯,结果呢,40 分钟到 1 个小时,才抓起来。
一个小时,抓一个杯子。
我家三岁侄子都比它利索。
问题出在哪?
陈博远点得透:语言模型有两个天生绕不过去的坎。一个是很多精细动作根本没法用语言描述清楚,你跟人学骑车,师傅说重心放低保持平衡,你摔了八次才懂这句话啥意思,机器也一样。
另一个更致命,语言模型一个 token 一个 token 往外蹦,聊天时延迟 100 毫秒你毫无察觉,搁在真机控制上,就是三个控制周期的滞后。
你跟机器人说躲开,它还在一个字一个字琢磨,杯子已经碎了。

所以他的结论反而更坚定了:
物理 AI 一定会有自己的基座模型,语言模型替代不了。
这一段我觉得特别难得。
行业里现在弥漫着一种大模型包治百病的迷信,动不动就是往模型里灌更多数据、堆更多参数。
能冷静承认自家信仰的技术有上限,这种诚实比什么技术突破都稀缺。
当然姚卯青也从 Astra 里咂摸出不少东西。
他说了三条启示,最扎心的一条是:真正的壁垒在数据,不在模型。高质量数据能拉开 200 到 300 天的领先周期。
200 到 300 天。在技术圈,这基本就是一代的身位。

为啥数据这么金贵?
你想啊,语言模型的数据满互联网都是,人类几千年攒下的文字随便喂。机器人呢?得在真实世界里一个动作一个动作地试,试错密度越高,对物理的理解越深。
陈博远管这个叫交互密度,是数据量和参数量之外的第三条增长轴。
说白了,机器人认识世界靠的是摔跟头,跟头摔得不够多,书读得再好也白搭。
绕到这儿,特斯拉 Cybercab 就被反复提起了。
姚卯青点破了特斯拉的精明之处:纯视觉路线,收缩产品线,全球几百万辆车天天在路上跑,数据在商业闭环里自己长出来,技术跟着慢慢逼近临界点。
技术是技术,生意是生意,能把这两件事焊在一起,让每一辆卖出去的车都在给技术打工,这才是最难的那道题。

张鹏的话给所有人泼了盆冷水,也给了个盼头。
他说 Demo 和大规模商用之间,隔着客户价值、硬件稳定性、生产体系、售后能力一整条河,现在谁都没摸到明确路径。
但他紧跟着一句:这是这一轮具身智能革命里,中美站在同一起跑线的一次机会。
这话我信。
模型能力大家你追我赶,差距有限,真正的胜负手在系统能力,在本体、模型、数据、控制、售后这一整条链。
论供应链,论制造,论场景丰富度,论快递外卖家政这些海量真实场景,中国手里的牌一点不差。

机器人走进家门那天到底啥时候来?没人能给准日子。
但有一点是清楚的,谁能率先让机器人在真实世界里摔够跟头,谁就能第一个把它送进你家。
摔跟头的速度,就是这条赛道上真正的油门。