论文用社交推理游戏评估模型在多轮互动中维持欺骗策略的能力。
推荐理由:看点在于欺骗被定义为跨轮次的叙事、投票与行动一致性,而非单句撒谎;若强模型能长期维持隐藏目标,代理安全评测必须覆盖记忆和策略层。
阅读原文