作者用3080个分类任务比较Jev与大模型的准确率、延迟、校准度和置信度。
推荐理由:测试把比较维度从准确率扩展到延迟、概率校准和置信度,直指AI决策层的可控性;但摘要未披露结果与基线,结论强度仍无法判断。
阅读原文