众力资讯网

GRPO训练的一些要点 奖励模型质量是关键。 grpo的效果很大程度上取决于re

GRPO训练的一些要点
奖励模型质量是关键。
grpo的效果很大程度上取决于reward model的质量,这个环节千万不能马虎,我之前踩过坑,用了个训练不充分的reward model,结果grpo训练过程中策略模型学偏了,生成的内容越来越奇怪,现在我会先花足够的时间把reward model调好,确保它在各种case上的判断都比较准确。

KL约束系数的设置很重要。
太小了模型学不到东西,太大了容易跑偏,我一般会从比较小的值开始,比如0.01或0.02,然后根据训练过程中的KL divergence变化来调整。如果kl值持续很小且收敛慢,可以适当减小系数让模型更自由更新,如果kl增长过快,则增大系数加强约束。我会画个kl曲线实时监控,确保在合理范围内波动。

训练监控指标的设计。
单纯看loss下降不够,grpo训练需要更全面的监控,我会同时追踪reward score的变化、kl散度、生成文本的多样性指标、还有一些任务相关的质量指标,特别重要的是要定期在验证集上采样一些文本,人工评估生成质量是否在提升。有时候数值指标看起来不错,但生成的内容可能有subtle的问题。

学习率和优化器的选择 。
grpo对学习率比较敏感,一般要比预训练阶段小一个数量级,我通常用1e-6到5e-6之间的学习率,配合linear warmup和cosine decay。优化器方面,adamw表现比较稳定,但要注意weight decay的设置。梯度裁剪也很重要,因为policy gradient的方差比较大,容易出现梯度爆炸。我一般会设置比较保守的梯度裁剪阈值。
深度学习 强化学习 GRPO 大模型 Python 多模态 计算机 人工智能