众力资讯网

想明白了大模型蒸馏的问题,现在的原理已经是聪明地收集少量训练样本,而不是能力复制

想明白了大模型蒸馏的问题,现在的原理已经是聪明地收集少量训练样本,而不是能力复制

最近美国密集指责中国头部大模型抄袭,用的说法就是“蒸馏”。这个名词有些晦涩,到底是不是某种程度的抄袭,不好理解。

蒸馏,英文distillation。用大白话说,就是有个能力强的“教师模型”,有个能力弱的“学生模型”,通常规模也要小不少。这个学生模型本来是要自己找样本组织训练的,但现在方便了,直接让教师模型来产生海量输出就能训练了。训完了,一些看上去很强的能力,就从教师模型转移到学生模型上了,当然学生超不过教师,会有各种隐患。

最开始是图灵奖得主辛顿2015年的蒸馏论文,讲的是logit-level 蒸馏,就是模型架构也需要“兼容”,才能搞蒸馏训练。学生拿到教师的“软标签”(softmax 概率分布),学到教师对每个token的"置信度结构"。这需要访问模型内部,权重结构要兼容。

中国大模型是开源的,架构显然和美国大模型不一样,参数规模、tokenizer、训练数据管道都是自搞一套。也拿不到美国模型的最终输出概率分布,根本不可能是严格意义上的logit蒸馏。

现在新闻里说“蒸馏”,根本不是能力转移,而是收集训练样本。中国公司访问美国大模型,就有几百万、上千万个反馈。处理后会是不错的训练样本,能帮提升模型能力。但这只是训练样本中很少的一部分,绝大多数预训练、后训练都是各家公司自己组织的。从别人的模型里处理出一些训练样本,是业界公开的秘密。

概念上这叫sequence-level distillation。学生不接触教师内部,只看教师的输出序列,用这些输出做自己的监督信号。但这和logit-level 蒸馏的“全面复制”明显不一样,有个比例问题。如果学生模型绝大部分样例都是教师模型的输出序列,就几乎没有自己开发的,水平高不到哪去,名声也不好。

现在情况是,中国大模型只用一点美国大模型的输出序列引导下,主要是自己组织的训练样本、后训练绝活,能力超过美国大模型完全可能。在一些局部指标上,已经有这样的现象发生。这既不是logit-level 蒸馏,也不是10年前说的低效sequence-level distillation,技术进步了非常多。

最典型的,就是编程能力的提升。马斯克xAI最近能力提升很快,Grok 4.6是个突破。据说原因是600亿美元收购了Cursor,但全是拿SpaceX股票换的,这就是炒高股价的意义。用Cursor 开发的人每天写下约1.5 亿行代码,喂给Grok训练编程能力,这就是交易的核心逻辑。交割仅两周后,OpenAI 宣布终止向 Cursor 提供模型服务,就是怕编程能力泄露。

中国公司没这么多钱,那如何学习美国大模型的编程能力?技术有意思的地方就在这,不需要太多sequence-level distillation。要优雅得多,原理是DeepSeek R1论文提出的自学习训练,用到编程上了。

具体办法是,收集几十万个实际编程样例(这很容易),用个小模型往里随机加bug(模仿出错的人类程序员)。中国模型一开始没法改对,能力弱一些。让美国大模型来修这些bug,就留下了一些中间输出、最终输出。关键是,这种训练样本非常简单,修好了就是true,修不好就是false。这省去了麻烦的人工标注,而且这种简单样本,就能通过DeepSeek R1的自学习训练,把编程能力也训练好。

技术上,这和原始论文里的蒸馏差异非常大了。概念上,应该说就是收集样本,只是许多种收集样本手段中的一种。而美国大模型公司收集样本的手段,被很多传统公司告了。说成蒸馏,是一种宣传,暗示中国公司没什么技术,就是复制美国大模型的能力。如果说是收集样本,攻击力就不足。实际中国公司的能力非常强,技术创新得到了业界认可,核心技术绝对不是蒸馏或者收集样本,钱不多算力少会想办法是真的。中国大模型高性价比威胁美国大模型的“钱景”,是最真实。