AI@NEWS

长上下文为何会被无关信息毒化

论文将上下文毒化建模为注意力极值干扰,并推导维持准确率所需的证据条件。

推荐理由:关键机制是有效证据得分存在上限,而干扰项最大得分随数量增长,因而上下文越长越可能被偶然高分噪声夺取注意力,解释了长度扩展不等于可用记忆。

阅读原文