小米定位并修复模型反复发起相同工具调用、消耗上下文且阻塞任务的问题。
推荐理由:根因是强化学习奖励只衡量最终答案,未惩罚过程低效,导致重复调用随训练规模放大;修复说明智能体训练需显式约束轨迹效率。
阅读原文