以多教师在策略蒸馏优化流匹配三维生成,绕开奖励设计与目标干扰。
推荐理由:方法不用单一强化学习奖励概括复杂三维几何,而由多个教师分别传递异质能力并进行在策略蒸馏;其价值在于降低多目标梯度冲突和奖励投机风险。
阅读原文