众力资讯网

阿里发布Qwen3.8Flash 大模型这行,过去比的是谁家参数大。千问这次换

阿里发布Qwen3.8Flash 大模型这行,过去比的是谁家参数大。

千问这次换了个比法:参数可以小,算力不能白烧。

Qwen3.8-Flash,激活 6B 参数。编程、智能体、专业工作、多模态几项评测,把 Opus4.6 打穿,贴着 Opus4.8 的脸。训练成本比 3.7-Plus 砍掉近九成。

把 Token 的生产成本重做了一遍:Attention、Residual、Embedding、Optimization 四处架构,同一块 GPU 塞进更多请求,吐出更多 Token。开源版 Flash-Next 是 Qwen4 结构预演,先拿出来给社区验货,跟当年 GatedDeltaNet 给 Qwen3.5 试水一个路数。

为啥总成本比单价重要?

智能体时代,一次任务几十次调用、几十万 token、工具用了一轮又一轮,失败就得重跑。模型能不能铺开用,看的不是单次报价,是做完一件事要烧多少钱。

在真实任务中,Agent工作需长输入(Input),缓存命中价格对综合成本影响大,Qwen3.8-Flash缓存命中价格低至每百万Tokens 0.1元、国际站0.016美元,千问这下真的让Agent量大管饱了。

所以这波真正的变化是行业从比谁最强,转到了比谁最划算。找最强的模型,不如找最适合自己那个。

千问把 Scaling 押在单位算力上,这大概率也是 Qwen4 的路!