AI@NEWS

RL正则化与KL惩罚讲解

课程讨论RL中KL惩罚、反向KL视角及RL为何比SFT更利于泛化。

推荐理由:有价值处在把KL惩罚、奖励过优化和智能体rubric控制连起来;这对应当前RL训练从对齐转向代理任务时的稳定性难题。

阅读原文