AI@NEWS

JevBench评估受限软件决策模型

JevBench将准确率、校准、速度和成本合并,衡量输出类型化决策而非文本的模型。

推荐理由:它把评测对象从开放生成转向带概率的类型化决策,并将校准、延迟和成本纳入总分;这更贴近生产系统中错误置信度与调用开销的真实代价。

阅读原文