众力资讯网

听说千问模型这波把计算效率卷到了新地板?

Qwen3.8-Flash 一发,大家聊得最多的是性价比。

🤔我更想聊清楚,为什么它能便宜到这个份上。

答案在架构!

这次 Qwen 端出一个和过去所有千问大模型都不一样的全新架构,代号 Next。核心逻辑一句话概括:参数放在那儿,但每次 Token 计算只让一小部分真的干活。

Transformer 参数 125B,每次激活 6B。相当于你请了一屋子专家进公司,但每次开会只叫最对口的那几位到场,计算效率因此被推到一个新的地板。

这不是"把模型做小"的思路,而是"参数规模留着、每次算的时候只调用其中很小一部分"的思路。前者牺牲能力,后者只降成本。

这个思路能落地,靠的是四件事:

1️⃣QSA稀疏注意力 + GDN混合注意力。传统注意力在长上下文中计算量爆炸,QSA让模型学会“哪些token值得看、哪些可以跳过”,1M tokens场景下实测提速8倍以上。

2️⃣门控残差信息主通道。传统Transformer只有一条通道,Qwen拆成4条独立通道并加门控,模型动态决定读写路径,训练更稳、传递更高效、梯度不易稀释。

3️⃣51B的N-gram Embedding外挂。相当于给模型配了一本“记忆指南手册”,不参与每次计算,只在需要时查表取用。拿到大参数红利,计算成本却没涨——知识量按大模型算,算力按小模型花。

4️⃣结构与训练协同优化。架构改了,训练方案同步调整,收敛效率和吞吐一起提升。训练成本砍掉90%,不是硬堆卡数,是把每份算力用得更精细。

👀以前比参数量,谁堆得高谁牛。现在行业开始比另一件事:单位算力能产出多少智能。参数堆到极致已成过去,下一阶段战场在“效率”。

而且最关键的一点:Next 架构官方明说了,是下一代 Qwen4 的雏形。

🤔Qwen3.8-Flash-Next 模型权重已经在 Hugging Face 和魔搭全面开源,等于把还在演进中的架构先端到桌上,让全球开源社区一起帮着调优、找边界、贡献 idea。

这种"演进中开源"的姿态,在大厂里其实不多见。多数公司选择的路径是"发布后再开源",端出来的都是已经定型的稳态版本;Qwen 这次是把还在长的东西先端出来。图纸摆桌上,谁都能上来画一笔。

#AI技术 #开源模型 #大模型架构 #Qwen #千问大模型