多年来,AI 领域一直有个经典名场面:OpenAI 等巨头忙着烧钱让 Sora 逐帧生成高清画质视频,而图灵奖得主杨立坤却一直在“唱反调”——别在像素点上浪费算力了,真正的世界模型根本不需要生成画面,而是要在抽象的空间里预测未来!
早在 2022 年,杨立坤就画下了“分层世界模型”的理论蓝图。
如今,团队终于给出了第一个能“端到端训练”的落地方案。
这套架构最精妙的地方,在于它给 AI 建立了一个高效的“CEO 与打工人”分层职场体系。
以前的单层世界模型(比如 LeWorldModel)就像一个悲惨的单打独斗者:既要思考几百步之后的迷宫出口在哪,又要时刻绷紧神经,盯着眼前机器人左前腿的关节角度到底弯了 30 度还是 35 度。这种把战略规划和微观动作搅在一起的机制,就像让公司 CEO 边制定五年上市计划,边亲手去修理洗手间漏水的水龙头——规划稍微远一点,大脑立刻爆缸。
而 H-JEPA 延续了 JEPA 不生成像素的抽象预判思路,并将其升级为多层规划:
高层就像 CEO,站在遥远的未来俯瞰大局(比如一次预测 20 个环境步长),它压根不关心机器人的腿姿摆得美不美,只关注全局位置和走廊通道;
中层就像项目经理(10 个环境步长),把高层的抽象指令拆解成中期子目标;
底层则像一线打工人(5 个环境步长),专门处理具体的肌肉控制与迈步指令。
更关键的是,以前的层次模型(如 HWM)虽然分层,但所有层级都在挤着使用同一套环境特征。而 H-JEPA 让每一个层级都学习属于自己的抽象特征。在迷宫测试中,高层模型会自动过滤掉腿部抖动等低级高频噪音,只保留二维坐标。用最干货的信息,做最长远的规划。
数据展现出了压倒性的优势:在 Visual AntMaze 仿真迷宫测试中,三层结构的 H-JEPA 规划成功率高达 73.3%,而单层 LeWorldModel 仅有可怜的 18.0%。不仅成功率飙升了近 4 倍,H-JEPA 所消耗的规划算力(FLOPs)反而比单层模型更少!
不过,这项研究也顺便揭示了一个搞笑的人类社会规律:大企业病在 AI 模型里同样存在。
研究团队在模拟推物体的 Push-T 任务中发现,三层模型的表现反而不如两层模型。道理很朴素——推个盒子这种几秒钟就能搞定的简单任务,你硬安排三层管理干部分工汇报,光是层层传达子目标就产生了严重的管理内耗。
除了仿真迷宫,团队还在真实机器人录像数据集 DROID 上进行了离线测试,H-JEPA 预测的动作轨迹远远比单层模型更接近人类专家的示范。
当大语言模型在文本堆里幻觉连篇、视频大模型在像素阵里狂烧 GPU 时,杨立坤用 H-JEPA 证明了:懂得“抽象”与“分权”的脑子,才是通向真实物理世界的正道。
这套“CEO 规划方向,打工人拧螺丝”的架构,可以说是把现代管理学玩明白了。
