众力资讯网

Cursor 开源 Mixture-of-Kittens

给万亿参数 MoE 训练提速的新方案

它瞄准的是大模型训练里最头疼的问题:MoE 架构的通信瓶颈。

现在 DeepSeek、Kimi、Qwen 等大模型大量采用 MoE:模型拥有海量专家,但每个 token 只激活少数专家。

问题是,训练时专家分布在不同 GPU 上,GPU 不仅要计算,还要频繁通信。

传统方案往往是:通信 → 计算 → 同步
大量时间浪费在等待上。

MoK 的思路是:
把「通信 + 计算」融合进一个 CUDA megakernel,让两者深度重叠。

同时支持:
✅ 前向/反向训练
✅ BF16、MXFP8 精度
✅ 确定性计算,方便调试和强化学习

效果方面,Cursor 公布数据显示:
MoE 层性能最高提升 2.37 倍
在数万 GPU 规模训练中,端到端吞吐提升 1.41 倍

未来训练超大规模 MoE 模型时,GPU 利用率可能迎来一次明显提升。

名字叫“小猫混合”,解决的却是 AI 基础设施里的“大难题”。

Cursor 这次开源的不是一个小工具,而是一块大模型训练加速拼图。