AI@NEWS

ConfidenceBench评估LLM置信校准

ConfidenceBench用Brier分数评估15个前沿LLM的语言化置信度校准能力。

推荐理由:它不依赖logits而用提示词抽取自报概率,能横向评估闭源模型是否知道自己何时可能错;这比单看准确率更贴近高风险部署的真实需求。

阅读原文