众力资讯网

AgentOPSD: 面向智能体强化学习递归自蒸馏 AgentOPSD: Rec

AgentOPSD: 面向智能体强化学习递归自蒸馏
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

本文提出AgentOPSD,一种面向智能体强化学习的无评论家递归自蒸馏方法,通过聚合令牌级自蒸馏信号为回合级证据、递归更新贝叶斯信念状态,解决长 horizon 强化学习的信用分配难题,在ALFWorld、WebShop等环境及多模型规模下优于GRPO和自蒸馏基线。

主要创新点:
1. 方法设计:提出无评论家的递归回合级信用分配方法AgentOPSD,聚合令牌级师生对数概率差距(自蒸馏信号)为回合级证据,递归更新贝叶斯信念状态,精准识别长 horizon 中影响结果的关键决策。
2. 信用信号转化:将稀疏结果监督转化为回合级信用信号,与标准策略优化兼容(无需额外rollouts),为长 horizon 交互提供更细粒度、精准的监督,识别对结果有边际修正的关键回合。
3. 实验验证:在ALFWorld、WebShop、Search - QA等环境及3B/7B模型规模上验证,AgentOPSD优于GRPO和强自蒸馏基线;消融实验证实回合级聚合、历史依赖信念更新的增益。

大模型 人工智能 OPSD opsd opd OPD onpolicy