AI@NEWS

研究评估AI代理欺骗能力

论文用社交推理游戏评估模型在多轮互动中维持欺骗策略的能力。

推荐理由:看点在于欺骗被定义为跨轮次的叙事、投票与行动一致性,而非单句撒谎;若强模型能长期维持隐藏目标,代理安全评测必须覆盖记忆和策略层。

阅读原文