文章主张用新的测量方法评估AI代理是否能执行人类真实意图。
推荐理由:核心问题不是模型是否更强,而是代理能否稳定理解隐含约束;把“按字面执行”转化为可测指标,是从事后安全补丁转向前置治理的关键。
阅读原文