众力资讯网

一次训练,全家桶到手:把500M/1.5B/3B模型嵌进同一架构,训练算力直降3

一次训练,全家桶到手:把500M/1.5B/3B模型嵌进同一架构,训练算力直降36%,还能白嫖蒸馏+加速推测解码!

康奈尔大学Nathan Godey与Yoav Artzi提出的Matryoshka Language Model Suites(套娃式语言模型套件),彻底改变了传统“每个尺寸单独训练、独立部署”的模型家族构建方式。他们将500M、1.5B、3B三个不同规模的子模型,通过可调节的宽度与深度嵌套进同一个架构,进行端到端联合训练。核心优势包括:

🌟显著降低总参数量与训练计算量(实测节省36%训练算力);
🌟在每次前向传播中,几乎零额外成本地完成从最大模型向所有更小子模型的在线蒸馏;
🌟子模型共享权重与KV cache,天然适配speculative decoding(草稿模型直接内嵌于验证模型),推理吞吐量提升14–26%;
🌟最终各尺寸模型在基准性能、验证集与域外困惑度上,均与独立训练的基线持平甚至更优。