众力资讯网

[LG]《Exposure-Based Reinforcement Learni

[LG]《Exposure-Based Reinforcement Learning to Rank》H Oosterhuis, R Jagerman, Z Qin, X Wang [Google DeepMind & University of Amsterdam] (2026)

在排序学习(LTR)领域,利用强化学习优化非连续指标(如公平性或蒸馏损失)是一个悬而未决的难题。过去的方法受困于极大的动作空间导致的梯度高方差,本质原因是现有算法(如 PL-Rank)过度追求 CPU 计算效率而牺牲了数值稳定性,且复杂的自定义梯度逻辑难以兼容现代自动微分框架。

本文的核心洞见是:把复杂的排序梯度估算重新看作对“文档曝光分布”的单步估计。由此,通过部分边缘化技术减少采样方差,并将梯度估计隐藏在曝光分布层之后的关键操作,使开发者只需像写普通损失函数一样定义曝光分布的微分,即可实现复杂排序目标的端到端自动优化。

这项工作真正留下的遗产是证明了在 GPU 算力下,通过基准校正与曝光抽象可以同时获得超越传统算法的收敛速度与数值稳定性。它为后来者打开的新门是将 RL4LTR 转化为一种即插即用的通用工具,但尚未跨过的门槛是在极小样本量(N