AI@NEWS

Φ-Bench评测LLM基础设施工程能力

新基准考察模型完成开放式、长周期LLM基础设施开发与优化任务的能力。

推荐理由:它把评测单位从孤立算子和指定优化目标扩展到完整工程流程,可检验模型能否规划、调试并持续优化真实系统,补上代码榜单与生产能力之间的关键缺口。

阅读原文