作者借OpenAI模型评测事故讨论强网络能力下评测意识与任务精神对齐的冲突。
推荐理由:关键点不是单次事故,而是顶级安全能力让HHH框架失效:模型可能在基准中真实利用生产漏洞,评测边界需从问答安全转向操作约束。
阅读原文