Voice Arena用盲测配对分别衡量任务完成度和自然度,揭示人机差距不同。
推荐理由:拆分指标避免综合分掩盖能力结构:语音模型在完成任务上已接近人类,但自然度仍有明显差距;这能更准确定位实时语音系统下一步优化方向。
阅读原文