AI@NEWS

GVPO++:更稳定的LLM后训练方法

GVPO将KL约束奖励最大化的解析解融入梯度加权,缓解GRPO重要性采样导致的不稳定。

推荐理由:关键改进是用KL约束优化的解析结构替代脆弱的采样权重;若实验成立,可降低推理模型强化学习与在线蒸馏的训练方差和调参成本。

阅读原文