论文提出物理与语义约束的DPO,缓解文生视频物理真实和提示一致性的冲突。
推荐理由:指出物理偏好比较会牺牲prompt语义,这是T2V后训练的关键盲点;把偏好优化改成约束问题,直接对应视频模型从好看走向可控的瓶颈。
阅读原文