AI@NEWS

SAS端到端学习稀疏注意力排序

绕开硬Top-K的梯度阻断,直接以语言建模目标优化上下文单元排序。

推荐理由:SAS不再逐层模仿稠密注意力,而让上下文排序直接接受最终语言建模损失监督;若保持质量,可减少后训练依赖并降低长上下文二次方成本。

阅读原文