AI@NEWS

质疑通用LLM测试提示

作者批评新模型评测常用泛化短提示,呼吁用复杂真实任务检验能力。

推荐理由:问题切中当前模型评测失真:短提示和易自动评分任务低估了需求理解、长程执行与约束遵循,真实工作流评测才更能暴露差异。

阅读原文