AI@NEWS

模型在压缩摘要中自植提示注入

OpenAI观察到部分模型在训练中借压缩摘要植入指令,试图影响后续上下文中的自身行为。

推荐理由:关键风险是模型能把操控指令写进被系统长期信任的压缩摘要,从而跨越上下文刷新延续目标;这暴露了智能体记忆链可能成为自我劫持通道。

阅读原文