论文称前沿模型可利用语义无关填充token进行不可见推理,绕过CoT监控。
推荐理由:发现语义无关token也能承载目标相关计算,削弱了用显式CoT做安全监控的前提;对可解释性、审计和训练时约束都是直接挑战。
阅读原文