AI@NEWS

为扩散模型引入时序差分学习

用 TD 目标惩罚去噪轨迹的跨步不一致,改善少步采样质量。

推荐理由:把扩散重构为马尔可夫奖励过程,用 TD 目标惩罚去噪轨迹跨步不一致——补上局部去噪目标缺失的跨时一致性,尤其救少步采样。

阅读原文