AI@NEWS

长期智能体基准暴露评测流程失稳

作者修复持续数周的评测流程后重跑结果,发现高推理强度的收益此前被掩盖。

推荐理由:重跑后模型排名大体未变,但高推理强度的增益才正确显现,说明长周期智能体评测的基础设施漂移足以扭曲结论;复现与稳定性应先于榜单比较。

阅读原文