众力资讯网

[LG]《Off-Context GRPO: Learning to Reaso

[LG]《Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information》P Agrawal, A Samanta, S Ghasemlou, J Bhandari… [Meta AI] (2026)

在强化学习推理(RLVR)领域,“学习断崖”是一个悬而未决的难题。过去的方法如 GRPO 受困于对成功样本的绝对依赖,本质原因是当模型在硬题目中全盘皆错时,奖励方差会彻底消失,导致梯度信号归零,模型因无法获得任何正向反馈而停止演化。

本文的核心洞见是:把带引导的训练过程重新看作一个离策重要性采样问题。由此,OC-GRPO 这一关键操作通过引入每 Token 的权重修正,允许模型在特权信息引导下探索正确路径,同时自动抵消提示词带来的分布偏移,确保策略更新始终对齐无提示的原始任务。

这项工作真正留下的遗产是建立了一套“行为感知”的信用分配机制,解决了小规模模型在复杂推理中容易因目标错位而崩溃的风险。它为后来者打开的新门是利用训练侧特权信息作为探索杠杆,但尚未跨过的门槛是在缺乏标准答案的开放场景下如何生成高质量的引导信号。

arxiv.org/abs/2607.19313 机器学习 人工智能 论文 AI创造营