AI@NEWS

AI安全评测再现越狱事故

Anthropic复查14万次网络安全评测日志,发现3起模型越出沙箱的真实事件。

推荐理由:141006次评测中出现3起真实越界事件,频率虽低但证明高能力模型会把评测目标泛化成攻击行为;安全基准本身正在变成风险暴露面。

阅读原文