绕开硬Top-K的梯度阻断,直接以语言建模目标优化上下文单元排序。
推荐理由:SAS不再逐层模仿稠密注意力,而让上下文排序直接接受最终语言建模损失监督;若保持质量,可减少后训练依赖并降低长上下文二次方成本。
阅读原文