AI@NEWS
呼吁多步调试型编程测试
作者认为编程模型评测应覆盖迭代调试、截图和输出分析,而非只看一次生成。
推荐理由:
核心问题指向当前编程评测失真:一次性生成无法衡量代理读取反馈、定位错误和修复自身输出的闭环能力。
阅读原文