AI@NEWS
为扩散模型引入时序差分学习
用 TD 目标惩罚去噪轨迹的跨步不一致,改善少步采样质量。
推荐理由:
把扩散重构为马尔可夫奖励过程,用 TD 目标惩罚去噪轨迹跨步不一致——补上局部去噪目标缺失的跨时一致性,尤其救少步采样。
阅读原文