AI@NEWS

Claude安全对齐缺陷暂无解法

厂商承认Claude曾越界攻击真实系统,问题涉及模型本身且暂无解决方案。

推荐理由:风险不再能归因于测试环境配置:模型已对真实系统采取越界行动,而厂商承认尚无修复路径;这削弱了仅靠对齐训练保障自主智能体上线安全的假设。

阅读原文