HyCO结合序列强化学习与全局扩散求解器,利用两者互补的误差结构。
推荐理由:序列策略前期边际遗憾较小但误差随决策链累积,扩散模型则避免链式误差却受剩余维度拖累;混合求解器按阶段利用两者优势,思路具有通用性。
阅读原文