用检查点交接区分强化学习改善了状态到达能力,还是到达后的决策能力。
推荐理由:端到端成功率混合了“走到哪里”和“到达后怎么做”两类增益;检查点交接能控制状态分布,避免把更优探索误判为更强决策,重塑智能体RL归因。
阅读原文