GPT-Live-1兼顾对话偏好与任务成功率,但同系列配置间差异尚无统计显著性。
推荐理由:榜单揭示语音模型的偏好评分与任务成功率并不一致:Gemini偏好领先却仅有74.6%成功率,选型不能只看单一Elo。
阅读原文