AI@NEWS

呼吁多步调试型编程测试

作者认为编程模型评测应覆盖迭代调试、截图和输出分析,而非只看一次生成。

推荐理由:核心问题指向当前编程评测失真:一次性生成无法衡量代理读取反馈、定位错误和修复自身输出的闭环能力。

阅读原文