前两天刷到一个消息,RLinf v0.3 正式发布,百度百舸同步完成适配,是国内第一家支持这个版本的云厂商。
这件事值得单独聊聊。
因为就在几天前,特斯拉Q2财报电话会上,马斯克直接开炮了整个人形机器人行业。
「你们在网上看到的那些爆火的机器人视频,大多数要么是按剧本演的,要么是后台有人远程操控。」
他说,到目前为止,全球没有任何一款人形机器人,能仅凭语音或画面指令自主完成日常任务。一款都没有。
这的确是行业内一个很普遍的现象。
当前超过90%的具身智能算法训练依赖仿真环境,但仿真里任务成功率100%的模型,一旦迁移到真机,性能普遍下降30%以上,极端场景甚至完全失效。
今年上半年有一场机器人半马赛事,赛后统计,只有四成参赛机器人实现了自主导航,其余全靠远程操控。
其实我第一次看到这些数据的时候挺吃惊的。而 RLinf + 百度百舸这套组合,恰好就是在解决这个困境,而且是十分关键的一步。
1所以为什么行业内会有这样的困境?其中有一个很核心的原因,出在当前整个研发流程是断裂的。
你可以把训练一个机器人模型想象成培养一个厨师。正常来说,一个厨师的成长路径应该是连贯的:先在厨艺学校学基础理论,然后到后厨实操练习,师傅在旁边随时指导纠正,慢慢就能独当一面了。
但现在大多数机器人团队面临的情况是,做仿真用的是一套环境和工具,训练模型用的是另一套框架,采集真机数据又要切换到第三套系统,最后部署和评测还得手动对接。每个环节之间都有巨大的工程鸿沟,全靠工程师人肉搬砖来填。
整个流程太碎了,每一步的进展都很难有效传递给下一步。
2而RLinf面对这个困境的解题思路是,从一开始就不承认鸿沟的存在。
它是由清华大学、北京中关村学院等做的开源项目,定位是全球首个面向具身智能持续进化的大规模强化学习基础设施,支持PPO、GRPO这类主流算法。
具体做法上,它提出了混合执行模式,把共享式和分离式两种资源分配方式的优点揉在一起,让GPU几乎不闲着;还搞了一套叫M2Flow的调度机制,让开发者能像写普通程序一样灵活拼训练流程,系统在背后自动做优化。
团队自己测过,在LIBERO的130个任务上,单个模型平均成功率能到98%以上,吞吐效率比基线平台高出一倍多。
开源以来,RLinf在GitHub已经攒了四千多星标,六百多次Fork,一百多位贡献者,还被Isaac Lab收进了官方训练引擎,团队和英伟达合作的项目登上了今年的GTC,也拿过EAI-100年度十大突破奖。
v0.2 版本的时候,RLinf 就已经把机器人硬件和 GPU 纳入了同一个资源调度系统,不同类型的机器人可以被自动发现和灵活分配。
到了 v0.3,数据采集、数据管理、监督微调、强化学习、模型评测、真机部署这一整条链路第一次完整打通,机器人真正能做到仿真里训练,真机上在线学习,再拿真机数据回来迭代,自己滚动着变强。
还有它的模型和算法覆盖度。v0.3 支持 DreamZero、GR00T、StarVLA 这些主流的具身基础模型,算法层面从模仿学习的 DAgger 到在线强化学习的 PPO、SAC-Flow 都有覆盖,仿真器方面接入了 Genesis、RoboVerse、IsaacLab 好几个平台。
这意味着它是想做一个通用的底层基座,不同的团队、不同的技术选型都能在上面跑起来。半年三个大版本,迭代节奏本身就说明了这个方向的需求有多旺盛。
3不过话说回来,再好的框架,没有底层算力和工程支撑,也很难真正跑起来,这也是百度百舸这次的角色。
百度百舸是百度智能云做的 AI 计算平台,在 RLinf v0.3 发布当天就完成了适配,也是国内第一家支持这个版本的云厂商。开发者在百舸上可以一键拉起 RLinf 的预制环境,比如适配 LIBERO 仿真场景的镜像,不用自己折腾环境配置。
但百舸真正的价值,在于它的 AI Infra 工程优化能力,能明显缩短模型迭代周期,把算力的性价比压榨得更彻底异步流水线、权重同步加速、显存精细管理这些听起来很底层的东西,实际上直接决定了训练效率的上限。
一个真实的例子是dVLA-RL。百度百舸团队联合上海交通大学、地瓜机器人等机构,一起做出了这套强化学习训练框架,第一次把经典的PPO算法和离散扩散VLA模型打通。
全部实验都是在百度百舸上跑的,百舸团队针对RLinf做的工程优化,明显提升了dVLA模型在强化学习阶段的训练效果。
如果说RLinf 提供的是一套完整的具身智能研发方法论和工具链,百度百舸提供的是让这套方法论高效运转的算力底座和工程优化。两者结合之后,从仿真训练到真机部署到持续迭代的整个循环才真正跑得顺畅。
目前,百舸已经服务了超过 30 家具身智能头部企业和创新中心,这个数字接下来大概率还会继续涨。
如果你在做具身智能相关的工作,很推荐去看一下 RLinf v0.3 的更新内容和百度百舸的适配方案,会很有收获。







