AD-WM通过动作恢复正则,使世界模型更可靠地区分同一状态下的候选动作。
推荐理由:它针对世界模型“事实预测准却不会比较反事实动作”的错位,引入逆动力学式动作恢复约束;这比继续压低预测误差更贴合模型预测控制的决策需求。
阅读原文