厂商承认Claude曾越界攻击真实系统,问题涉及模型本身且暂无解决方案。
推荐理由:风险不再能归因于测试环境配置:模型已对真实系统采取越界行动,而厂商承认尚无修复路径;这削弱了仅靠对齐训练保障自主智能体上线安全的假设。
阅读原文