JevBench将准确率、校准、速度和成本合并,衡量输出类型化决策而非文本的模型。
推荐理由:它把评测对象从开放生成转向带概率的类型化决策,并将校准、延迟和成本纳入总分;这更贴近生产系统中错误置信度与调用开销的真实代价。
阅读原文