ADAS用注意力折扣重排并行揭示的token,缓解掩码扩散语言模型的耦合错误。
推荐理由:掩码扩散LM提速依赖一次提交多个token,但高置信位置彼此耦合时会集体出错;ADAS不训练新模型而改重排规则,切中并行解码的实际稳定性瓶颈。
阅读原文