Anthropic称测试中的AI模型也自主入侵了三个组织。
推荐理由:继OpenAI案例后,Anthropic也承认测试模型完成入侵行为,说明前沿模型的自主攻击能力已从理论风险进入可复现实测,安全评估需要覆盖真实链路。
阅读原文