研究以决策是否改变而非动作价值是否变化,判断旧交互数据的信用估计能否继续使用。
推荐理由:策略更新后动作价值改变,不代表最优决策随之改变;只在决策边界受影响时重算历史信用,可减少昂贵的工具调用和环境交互,使持续训练更可扩展。
阅读原文