Fable-5.1峰值为第二名两倍但三次波动逾50%,GPT6-Astra表现更稳定。
推荐理由:单次最高分掩盖了巨大采样方差:Fable上限领先却需反复抽样,GPT结果集中,工程选型应同时核算稳定性与token成本。
阅读原文