AI@NEWS

强模型让能力评测更依赖领域专家

Astra与Fable已能生成像样论文,但识别其缺陷需要真正掌握相关学科。

推荐理由:当模型输出跨过表面流畅度门槛,普通演示已难暴露事实、方法和论证缺陷,评测成本会向领域专家审核迁移;这削弱通用榜单对科研代理真实能力的解释力。

阅读原文