众力资讯网

Qwen3.8-Flash-Next要来了,125B

传说中的Qwen3.8的新模型要来了

125B是个相当甜品的配置,只不过激活参数小,和当年的Qwen3 Next类似,实验性质
去年Qwen3 Next一度是我GPU里呆的最久的模型

看到了Attention Residual,和Ngram。
这个新架构值得期待,能在本地实践真的是太好了

不过没等到激活参数更大的120B是有点遗憾的,希望这个模型有更大上下文也能达到3.8 27B的水平

#Qwen4 #qwen38