PGPO利用潜力引导的策略优化,为稀疏奖励下的中间动作提供更细粒度信号。
推荐理由:PGPO试图摆脱逐步优势仍受单条轨迹成败支配的问题,让失败轨迹中的有效动作也能获得区分信号;这直指多轮智能体强化学习最关键的稀疏信用分配瓶颈。
阅读原文