AI@NEWS
语音智能体评估应拆为三层
LangChain框架分别评估执行合规、任务结果和通话体验。
推荐理由:
框架明确区分指令遵从与真实任务成功,并优先使用预约成功率等下游信号;这能避免仅靠LLM评审把“会说”误判为“办成”。
阅读原文