AI@NEWS

SLCA-GRPO修正工具调用的跨段归因

方法隔离工具调用与自然语言摘要的学习信号,避免轨迹级奖励向不同输出片段错误广播。

推荐理由:标准GRPO把同一优势值施加给工具令牌和摘要令牌,后者噪声会污染关键调用决策;分段信用分配直击工具智能体训练脆弱性的结构性来源。

阅读原文