众力资讯网

4-bit模型反而赢了16-bit,这个压缩实验有点反常 Multiverse

4-bit模型反而赢了16-bit,这个压缩实验有点反常

Multiverse Computing最近做了个特别的实验,他们先把GPT OSS 120B压缩到60B,再把这个60B模型量化成4-bit版本,同时保留一份同架构的BF16版本做对照。
结果有点出乎意料,4-bit版本在9项测试里有7项超过BF16版本,其中长上下文推理提高了7.4分,AIME 2025数学测试提高了5.6分。
按过去的经验,模型从16-bit压到4-bit以后,虽然更省显存、更容易部署,但能力通常也会跟着下降,这次却没有完全按照这个规律走。
Multiverse Computing这次用了QAH恢复训练,让压缩后的模型继续向原始120B模型学习,尽量把压缩过程中丢掉的能力重新补回来。
所以这项研究有意思的地方,不是证明4-bit一定比16-bit强,而是说明模型压缩未必只是简单做减法,训练方法做得好,模型变小以后依然有机会把能力找回来。
如果这种方法后续被更多团队验证,量化模型的定位可能会发生变化,未来流行的AI模型,可能是一批更便宜、更高效,也更容易部署的量化模型。