AI@NEWS

RLVR基线与学习率理论化

论文为可验证奖励强化学习中的baseline和自适应学习率建立方差感知理论。

推荐理由:RLVR后训练常靠经验调参;该工作把KL正则策略优化下的方差、baseline和学习率联系起来,有助于解释训练稳定性来源。

阅读原文