传说中的Qwen3.8的新模型要来了
125B是个相当甜品的配置,只不过激活参数小,和当年的Qwen3 Next类似,实验性质
去年Qwen3 Next一度是我GPU里呆的最久的模型
看到了Attention Residual,和Ngram。
这个新架构值得期待,能在本地实践真的是太好了
不过没等到激活参数更大的120B是有点遗憾的,希望这个模型有更大上下文也能达到3.8 27B的水平
#Qwen4 #qwen38


传说中的Qwen3.8的新模型要来了
125B是个相当甜品的配置,只不过激活参数小,和当年的Qwen3 Next类似,实验性质
去年Qwen3 Next一度是我GPU里呆的最久的模型
看到了Attention Residual,和Ngram。
这个新架构值得期待,能在本地实践真的是太好了
不过没等到激活参数更大的120B是有点遗憾的,希望这个模型有更大上下文也能达到3.8 27B的水平
#Qwen4 #qwen38

