智能体评测应覆盖真实环境中的长链工具调用,而非只看单步响应质量。
推荐理由:核心是把评测单位从单次回答提升到完整任务链,检验数十次连续工具调用中的状态保持与故障累积,更贴近智能体上线后的真实可靠性。
阅读原文