AI@NEWS

小语言模型RL训练失效分析

论文系统分析70M到500M小模型用PPO对齐时的失稳机制。

推荐理由:覆盖15组模型与语料配置并归纳三类可复现失败模式,价值在于解释小模型RL为何不稳定,而非简单套用大模型RLHF经验。

阅读原文