7 月 27 日晚,月之暗面把 Kimi K3 开源了。权重、技术报告、三项训练基础设施,全放了。
这件事值得写一篇长稿,不是因为 K3 跑分多高——强是预期之内,2.8 万亿参数的模型不该弱。是因为月之暗面这家公司本身,在过去两年里代表了另一种选择。
中国头部 AI 公司里,月之暗面是最后一个守住「不做开源」这条线的。DeepSeek 从 V2 起就开放权重,智谱、阿里、腾讯、字节、MiniMax 各有各的开源策略。唯独月之暗面,Kimi 始终是一个封闭的 App。产品很好,对话体验在国内是第一梯队,但外界能接触到的只有聊天框。你不知道它多大、什么架构、怎么训的、成本多少。
现在这些全打开了。不是挤牙膏式的放个权重就算「开源」,是技术报告里把架构图画清楚、把训练管线写明白、把后训练三步流程摊开,然后把让这一切能跑起来的三项基础设施也一并放出来。
这件事本身比 K3 的任何单项跑分都值得细看。
K3 的架构:不是堆参数,是换了建法
K3 是 MoE 架构,896 个专家网络,每次计算只激活其中 16 个。这个设计决定了它能把总参数量推到 2.8 万亿,但实际运行成本控制在可接受的范围。
但 K3 真正动手改的不是专家数,是注意力机制。它把两种注意力按 3:1 混合使用:KDA(Kimi Delta Attention)负责长篇内容的逐段递推,更省算力;Gated MLA 负责把完整上下文关联起来。KDA 块内计算可以并行,块间状态必须串着走,传统做法会让 GPU 大量空等。K3 的解法是把块内计算和跨块状态传递做成两条独立流水线,不同线程组各管各的,互不阻塞。
还有一个从残差连接上动的手术。传统 Transformer 每一层把自己的输出和上一层原封不动叠在一起往上送。K3 换成了 Attention Residuals:每一层做一次「回头看」,从前置所有层的输出里挑出对当前层真正有用的部分才叠进去。效果是深层网络不再"压扁"浅层的细节。
专家路由也做了一次升级。896 个专家同时工作,怎么避免某些专家忙死、某些专家闲着?K3 用了一个叫 Quantile Balancing 的算法,每训练一步都统计各专家负载,对落后者悄悄往上调一点路由概率,快速拉平。不做一次性大调整,靠高频微调维持均衡。
视觉方案也推倒重来了。业内常用做法是把现成的 SigLIP 视觉编码器通过对比预训练初始化后接入模型,K2.5 也是这么干的。K3 的 MoonViT-V2 从零开始训练,直接用 next-token prediction 驱动,不做对比预训练。效果跟 SigLIP 基线打平,但训练稳定性大幅改善,不会再出现梯度的剧烈振荡。
后训练分三步。第一步监督微调,训出一个有 agent 能力的冷启动模型。第二步最有意思:在通用推理、通用 agent、编程 agent 三个方向上,分别用低、中、高三档推理强度,训出九个专家模型。第三步用「多师在线策略蒸馏」把这九个专家的能力揉回同一个模型,让单一模型在不同场景下自动调出对应专家的行为。
这个后训练策略在成本上直接兑现了。BrowseComp 上 K3 每个任务花费 2.03 美元,拿到 91.2% 的最高分,成本是 GPT-5.6 Sol 的一半。GDPval-AA v2 上成本不到 Claude Fable 5 的四成。WebDev Arena 上拿了第一,1678 Elo,超越 Claude Fable 5 的 1634 分,成为第一个在这个榜上登顶的开源模型。
但 K3 真正的看点不是跑分。「应开尽开」的三件套:MoonEP、FlashKDA、AgentENV。
多数公司开源模型,放权重和一篇论文就够了。月之暗面多放了三样,而这三样才是 K3 能训出来的底层原因。
MoonEP 解决的是 MoE 训练的经典难题:896 个专家分布在多张 GPU 上并行训练,token 分配不均会导致某些 GPU 上的专家过载,全队等它。MoonEP 的做法是在每张 GPU 上预留「冗余专家」位置,实时统计路由情况,把可能过载的专家预先复制一份塞过去。有一个理论保证:每张 GPU 最多留 E/R 个冗余名额,就能让所有 GPU 负载完全相等。负载拉平后通信也跟着简化,token 直送目标位置,不需要中转缓冲区。
FlashKDA 是 KDA 注意力机制的高性能算子。前面提到 KDA 块内计算可并行、块间状态必须串行,FlashKDA 用 CUTLASS 把这两条线做成流水线叠加执行,不互相等待。在 H20 上,prefill 速度比 flash-linear-attention 基线提升了 1.72 到 2.22 倍。这段代码已经被 flash-linear-attention 纳为可选后端,意味着不是月之暗面自己用的私房菜,别人也能拿来加速。
AgentENV 最不像一个「开源附件」。它是月之暗面和 KVCache.ai 合作开发的大规模沙箱环境生成系统,底层用的是 Firecracker microVM,隔离级别接近真实虚拟机。agent 可以在里面挂载磁盘、跑容器甚至开新虚拟机,不会破坏宿主。沙箱可以快照、恢复、暂停、从精确状态分叉出新的独立环境。恢复延迟压到 49 毫秒,快照 133 毫秒。在训练和评估期间,AgentENV 共创建了超过 5120 万个沙箱,跨越 150 万个镜像。
一个沙箱生成系统,为什么要开源?答案可能在月之暗面技术报告的最后一段:「坚信开放权重模型的价值,能降低获取智能的门槛,推动创新,也把数据的控制权、隐私和所有权更多地留给用户」。
但更直接的解释是:AgentENV 不是月之暗面的护城河,大规模沙箱是一项行业基础设施。开源它,意味着月之暗面希望更多团队能基于同一套环境做 agent 训练和评估,让结果可复现、可对比。这是一种比「放权重」更深的开放逻辑:不是让你用我的模型,是让你用我的实验条件。
路线选择,不只一次版本发布。
回到月之暗面这家公司。过去两年,中国 AI 公司围绕「开源还是闭源」站成了两条线。DeepSeek 是开源路线的旗帜,V2、V3、V4 一路放权重。月之暗面是闭源路线的代表,把全部赌注押在产品体验上。这两家公司一度被放在一起对比,不是因为技术路线相似,恰恰是因为路线完全不同但都做得不错。
K3 的全面开源改变了这个叙事。
不是「月之暗面认输了所以开源」。K3 的跑分和成本数据说明它不需要靠开源来证明能力。更合理的解释是:月之暗面判断,在 2026 年这个时间点,开放权重比封闭产品能撬动更大的价值。开源不等于放弃产品,Kimi 的 App 仍然在,K3 的权重开放后可能会有开发者把它部署到月之暗面自己没覆盖到的场景里,而这些场景会反向给产品提供信号。
DeepSeek 是「出生就开源」,月之暗面是「选择成为开源」。两条路径从相反方向走到了同一个位置,而月之暗面这一步走得比多数人预期的更彻底——不仅开了模型,还开了造模型的生产线。
中国头部 AI 公司的开源版图,最后一个缺口在 7 月 27 日晚填上了。
KimiK3正式开源Kimi K3动了西方底线月之暗面Kimi







