论文针对GRPO把轨迹级优势粗放分配到步骤的问题,以轨迹图估计步骤级优势。
推荐理由:失败轨迹也可能包含高价值步骤,而GRPO的整段奖励会系统性错判这些动作;轨迹图按后续状态重新估计步骤贡献,有望提升长程智能体训练的样本效率。
阅读原文