18组受控实验显示GRPO未能稳定提升4B到8B网页智能体成功率。
推荐理由:这条负结果很有实用价值:在4B-8B网页智能体上,GRPO更像重塑监督模型已有行为而非新增技能;说明可验证奖励RL的收益强依赖规模、学习率和初始能力。
阅读原文