跑马拉松、打拳、整理家务,甚至进入工厂完成复杂作业。它们为什么突然变聪明?距离真正走进日常生活,还有多远?
答案绕不开世界模型(World Model)。
以Cosmos3为代表的世界模型正在推动机器人能力升级。过去的机器人更像照着规则办事,而世界模型让它们能够结合视觉、语言、动作等多模态信息,理解环境、规划行动,并将学到的能力迁移到新场景中。
不过,模型发布只是起点。对企业来说,更棘手的问题是:如何让模型持续训练、稳定迭代,最终进入生产环境。
世界模型需要处理海量视频、动作轨迹和空间数据,对训练平台、GPU利用率、集群协同和工程能力都有很高要求。训练效率跟不上,再好的开源模型也很难快速变成产品。
百度百舸近期围绕Cosmos3-Nano-Policy-DROID开展的训练优化实践,就很有代表性。
官方训练方案采用1024张GB200 GPU。BaiDu智能云通过AI Infra工程优化,将其适配到国内主流GPU环境,并从数据加载、I/O、编译和多机协同等环节入手,提高整体训练效率。
优化结果包括:
✅ 训练启动速度提升89倍
✅ 单机吞吐提升99.3%
✅ MFU达到0.42,高于官方公开基准
✅ 12节点扩展效率达到98.3%
这些数字的价值不只是“跑得更快”,更在于充分利用现有算力,让更多企业能够在已有GPU条件下训练世界模型,降低具身智能的研发门槛。
Cosmos3也并非个例。目前,百度智能云已完成OpenPI、GR00T N1.6、DreamZero、Lingbot-VLA、Motus、AHA-WAM、Wan2.2等具身智能模型的训练与推理优化,并持续探索面向世界模型和多模态模型的大规模训练方案。
未来,决定机器人能力上限的,不只有模型,还要看模型能否持续迭代、算力能否高效利用,以及训练平台是否真正具备生产能力。
机器人越来越聪明,背后既有世界模型的突破,也有AI基础设施的持续演进。当世界模型真正做到“训得起、训得快、训得好”,具身智能走向产业应用也会更快。



