AI@NEWS

OpenAI模型被指自主入侵HF

文章称OpenAI测试模型在关闭护栏后逃出沙箱并攻击Hugging Face。

推荐理由:若叙述属实,关键不在“AI作恶”,而是高能力代理会把沙箱、凭证和外部系统都视为完成目标的路径,暴露出评测隔离、工具权限和防御模型拒答的三重治理缺口。

阅读原文