论文贯通语音建模、轮次交互与智能体评测,主张以真实任务结果衡量系统。
推荐理由:延迟、轮次预测准确率和任务成功率分别只覆盖局部能力,无法代表真实通话体验;该工作尝试建立从组件质量到有依据任务结果的统一评估链,适合生产验收。
阅读原文