让模型「变聪明」,比「打地基」便宜一个数量级
接着上篇。这节把模型训练拆成了两个词,我觉得是最实用的一个框架:pre-training(预训练)和 post-training(后训练)。
预训练,就是「压缩」:把互联网规模的数据(几万亿 token)加上海量算力,把人类的知识压进一套权重里。它是「预测下一个词」,所以会胡说八道、会不对齐——你问它「我该请谁吃饭」,它能给你报一堆随机名字。
后训练,就是「对齐」:告诉模型什么输出是好、什么是坏,把它从「续写机器」变成「会对话的助手」。方法一路从 SFT(监督微调)到 RLHF(偏好调优)再到 RLVR。
这里有个词是 2025 年才火起来的,叫 RLVR——「可验证奖励的强化学习」。它跟之前最大的区别是:让模型把一件事试几百上千次,然后用一个「确定性」的方式检查它做对没有(比如代码能不能跑通、测试过不过),拿到一堆对错的分布,再学习。比单纯预测下一个词,学到的多得多。
然后他给了个特别震撼的算力账:
DeepSeek V3 的预训练用了 240–250 万 H800 小时,而让它变强的 RL(DeepSeek R1)只用了 15 万小时——大约只有预训练的 5%。
也就是说,让模型「变聪明」的那一步,比「打地基」便宜一个数量级。不过他也说,现在 RL 的算力占比正在快速上升。
