方法隔离工具调用与自然语言摘要的学习信号,避免轨迹级奖励向不同输出片段错误广播。
推荐理由:标准GRPO把同一优势值施加给工具令牌和摘要令牌,后者噪声会污染关键调用决策;分段信用分配直击工具智能体训练脆弱性的结构性来源。
阅读原文