实测称部分模型high优于max,小型量化模型甚至可能在medium档表现更好。
推荐理由:推理预算与任务效果并非单调关系,high或medium反胜max暴露后训练和策略适配问题,也说明厂商用最高档跑榜难代表真实使用最优点。
阅读原文