DART以局部目标分布替代单点答案监督,提升循环推理的难度泛化。
推荐理由:难题中有效解只占极小区域,单一标签会让训练信号过脆;DART在正确解附近构造分布式对抗目标,为隐藏空间迭代推理提供更平滑、更耐难度扩展的监督。
阅读原文