根据边际收益动态调整强化学习交互长度,避免盲目扩展长程轨迹。
推荐理由:论文把最大交互步数从人工设定的单调课程改为可检测的动态前沿,在新增步骤收益递减时停止扩展;可减少智能体强化学习中的无效采样与信用分配噪声。
阅读原文