众力资讯网

罗福莉重磅官宣:沉默半年后,小米MiMo团队把大规模强化学习(RL)训练直接摊开直播,每步狂吞20亿tokens,探索AI自我进化的极限边界! 小米MiMo团队负责人罗福莉发文指出,他们坚信强化学习(RL)是实现模型自我改进最可扩展、最高效的路径之一。过去近半年几乎沉默,团队专注研究一个核心问题:

罗福莉重磅官宣:沉默半年后,小米MiMo团队把大规模强化学习(RL)训练直接摊开直播,每步狂吞20亿tokens,探索AI自我进化的极限边界!

小米MiMo团队负责人罗福莉发文指出,他们坚信强化学习(RL)是实现模型自我改进最可扩展、最高效的路径之一。过去近半年几乎沉默,团队专注研究一个核心问题:RL到底能扩展到什么程度。目前MiMo-V2.6正处于RL训练中期,团队在三个维度大幅扩大规模:计算量(每步约20亿tokens,由1568条prompt × 16次rollout构成,完全异步推进)、环境与工具链(多任务agentic RL,多种harness混合在一次运行中)、以及评分计算(agentic组内信用分配,结合测试用例和基于rubric的奖励)。他们将在未来几周逐步开源细节,并同步直播训练过程。AI研究者Nathan Lambert评价这是目前公开的最酷大规模RL资源之一。