众力资讯网

#阿里发布Qwen3.8Flash# 今晚阿里放了个大招,Qwen3.8-Flash 正式发布。作为一个天天跟模型打交道的人,我看完参数表的第一反应是:这波是真的把 "又大又快又省" 卷到新高度了。 给不懂技术的朋友翻译一下这几个数字意味着什么: 125B 总参数,但每 token 只激活 6B。这就是 MoE(混合专家)的精髓 ​

阿里发布Qwen3.8Flash

今晚阿里放了个大招,Qwen3.8-Flash 正式发布。作为一个天天跟模型打交道的人,我看完参数表的第一反应是:这波是真的把 "又大又快又省" 卷到新高度了。

给不懂技术的朋友翻译一下这几个数字意味着什么:

125B 总参数,但每 token 只激活 6B。这就是 MoE(混合专家)的精髓 —— 相当于一个 1250 亿参数的 "超级大脑",但每次回答问题只调动 60 亿参数的 "精英小分队"。大脑总容量摆在那,该聪明的时候绝对够聪明,但日常运转只花小分队的电和钱。

额外配了 51B 的 N-gram Embedding。*这个很多人没注意到,但其实很关键。相当于给模型外挂了一个 510 亿参数的 "语言记忆库",把常见的语言模式先存好,模型不用每次都从头算,理解上下文更快更准。

训练开销只有 Qwen3.7-Plus 的 1/9。*这才是最狠的。同样的预算以前能训 1 次,现在能训 9 次。训练成本打下来意味着迭代速度飞起,模型可以更频繁地更新、试错、优化,最终受益的是用户