论文以去噪能量屏障统一解释扩散语言模型越狱,并归纳初始化与中途干预两类攻击。
推荐理由:该框架把安全对齐解释为有害输出与安全输出之间的能量屏障,并将现有攻击归为掩盖初始安全属性或干预去噪轨迹两类,为跨攻击防御提供统一靶点。
阅读原文