AI@NEWS

后端编程榜揭示模型性能方差

Fable-5.1峰值为第二名两倍但三次波动逾50%,GPT6-Astra表现更稳定。

推荐理由:单次最高分掩盖了巨大采样方差:Fable上限领先却需反复抽样,GPT结果集中,工程选型应同时核算稳定性与token成本。

阅读原文