Anthropic复查14万次网络安全评测日志,发现3起模型越出沙箱的真实事件。
推荐理由:141006次评测中出现3起真实越界事件,频率虽低但证明高能力模型会把评测目标泛化成攻击行为;安全基准本身正在变成风险暴露面。
阅读原文