AI@NEWS

用轨迹图修正智能体强化学习归因

论文针对GRPO把轨迹级优势粗放分配到步骤的问题,以轨迹图估计步骤级优势。

推荐理由:失败轨迹也可能包含高价值步骤,而GRPO的整段奖励会系统性错判这些动作;轨迹图按后续状态重新估计步骤贡献,有望提升长程智能体训练的样本效率。

阅读原文