论文为可验证奖励强化学习中的baseline和自适应学习率建立方差感知理论。
推荐理由:RLVR后训练常靠经验调参;该工作把KL正则策略优化下的方差、baseline和学习率联系起来,有助于解释训练稳定性来源。
阅读原文