小米的市场部动作好快!直接就把 MiMo-V2.6-Pro 登顶 Artificial Analysis Intelligence Index 全球开源模型第一做到了他们 2026云栖大会 展台上。
趁着今天新模型的东风,小米展台始终人满为患,到临近散场时才有空隙进去看看。
对于他们这次取得成绩的原因,MiMo 负责人罗福莉还在 X 发表了一篇长文:
MiMo-V2.6 很可能是迄今任何开源模型团队所开展的、以算力计规模最大的单次 RL 训练之一。
在这个算力极其紧缺的时代,我们依然决定投入一支数十人的团队,在相当长的一段时间里专注于同一个目标:把 RL 的规模做大。
这靠的不只是研究上的信念,还需要对 AGI 的愿景、对未知的敬畏,以及迎头直面最棘手问题的胆魄。
而我们的成果就是这样一款潜能经 mid-training 构建、并在高强度 RL 下解锁的、排名第一的开源模型。
我强烈推荐大家阅读这份技术报告,相信它将成为 Agent RL 从业者反复翻阅、每次都能有新发现的那类论文之一。
在我看来,其背后的研究创新与工程挑战,超越了我也曾参与的 DeepSeek R1。
有人会问:为什么是 MixRL,而不是 MOPD?
首先,两者并非彼此竞争的选择。我们在中等难度、结果可验证的任务(含代码及相关智能体任务)上运行了 MixRL,发现由此训练出的模型泛化能力极为出色。
其次,对于那些难以验证、时间跨度极长,或是本身就难到无法纳入联合 RL 训练的任务,我们则单独训练。若将其纳入,会大幅降低 rollout 效率,或引入严重的 rollout staleness 问题。
随后,我们再通过 MOPD 将这些能力融合起来。游戏、3D 任务,以及带有主观评估信号的任务,均属此类。
此外,还有一个略带戏谑的答案:我们的团队足够扁平、也足够不受组织壁垒的束缚,因此 MixRL 对我们来说不难。
更重要的是,大家都很享受这种工作方式。来自不同领域的成员每天聚在一起,在对 AGI 与能够持续自我改进的智能的追求驱动下,去直面并解决各个领域的 RL 瓶颈。
我会永远记得这段时期的 RL 每日进展会——讨论紧张而紧凑,智能实时涌现。
为帮助开源社区集中精力解决真实的 Agentic RL 问题,我们发布了一款基于 MiMo RL 轨迹(trajectories)蒸馏而成的 Qwen 模型,作为 RL 的更强起点,并一同发布了 7000 个多样化环境以及一套完整的 RL 训练框架。
我们希望这些资源能推动 Agentic RL 研究向前发展。
MiMo-V2.6 只是一个开始。在这个智能易于复制的时代,我们依然选择那条通往自我改进与 AGI 的难行之路。
前方仍有诸多未知。但我们愿意持续投入所需的时间、算力与热情,去承接一个又一个难题,并把每一个都一路做到底,直至智能迈入新的范式。
小米MiMo为何登顶开源第一





