AI@NEWS

小模型GRPO失败机制

18组受控实验显示GRPO未能稳定提升4B到8B网页智能体成功率。

推荐理由:这条负结果很有实用价值:在4B-8B网页智能体上,GRPO更像重塑监督模型已有行为而非新增技能;说明可验证奖励RL的收益强依赖规模、学习率和初始能力。

阅读原文