AI@NEWS

语音智能体评估应拆为三层

LangChain框架分别评估执行合规、任务结果和通话体验。

推荐理由:框架明确区分指令遵从与真实任务成功,并优先使用预约成功率等下游信号;这能避免仅靠LLM评审把“会说”误判为“办成”。

阅读原文