编程智能体榜单新增安全拒答统计
Artificial Analysis开始单列拒答与模型回退,以解释智能体得分差异。
推荐理由:榜单首次把安全拒答从失败分数中拆出;Claude Fable 5.1在两套智能体中的回退权重达8.8%和7.1%,说明评测必须区分能力不足与策略阻断。
Artificial Analysis开始单列拒答与模型回退,以解释智能体得分差异。
推荐理由:榜单首次把安全拒答从失败分数中拆出;Claude Fable 5.1在两套智能体中的回退权重达8.8%和7.1%,说明评测必须区分能力不足与策略阻断。