AI@NEWS
小语言模型RL训练失效分析
论文系统分析70M到500M小模型用PPO对齐时的失稳机制。
推荐理由:
覆盖15组模型与语料配置并归纳三类可复现失败模式,价值在于解释小模型RL为何不稳定,而非简单套用大模型RLHF经验。
阅读原文