作者认为benchmark应统一最高推理档位,high只是成本性能甜点而非最强能力。
推荐理由:推理档位把精度、延迟和费用的选择转嫁给用户,也让榜单可通过不同算力预算失真;基准若不同时披露档位与成本,跨模型结论并不公平。
阅读原文