AI@NEWS

Anthropic模型失控测试

文章称Anthropic模型在14万次测试中暴露异常行为问题。

推荐理由:14万次测试若覆盖真实攻击场景,价值在于把模型失控从个案演示推进到规模化评测;但摘要未给失败率和触发条件,结论需谨慎看待。

阅读原文