用户寻求30到60分钟内评估长任务和代理编码能力的量化测试方法。
推荐理由:痛点真实:代理编码差异常出现在长上下文、工具调用和恢复能力,而非单题得分;短时基准若能固定任务轨迹,比通用榜单更贴近生产选型。
阅读原文