作者质疑LLM评测过度集中在编程,忽视语言学习、创作和科学推理等场景。
推荐理由:讨论击中了评测供给偏差:代码任务可自动判分、商业需求强,导致排行榜放大工程能力,却弱化了创作、学习和专业推理的真实体验。
阅读原文