AI@NEWS

推理档位正在扭曲模型基准比较

作者认为benchmark应统一最高推理档位,high只是成本性能甜点而非最强能力。

推荐理由:推理档位把精度、延迟和费用的选择转嫁给用户,也让榜单可通过不同算力预算失真;基准若不同时披露档位与成本,跨模型结论并不公平。

阅读原文