AI@NEWS

前沿模型越狱仍很容易

新工具测试四家前沿模型安全防护,显示部分模型仍可被绕过。

推荐理由:看点在于越狱工具已从手工提示工程转向可复用自动化攻击,若多家前沿模型表现参差,说明安全对齐仍难覆盖组合式绕过路径。

阅读原文