AI@NEWS
质疑通用LLM测试提示
作者批评新模型评测常用泛化短提示,呼吁用复杂真实任务检验能力。
推荐理由:
问题切中当前模型评测失真:短提示和易自动评分任务低估了需求理解、长程执行与约束遵循,真实工作流评测才更能暴露差异。
阅读原文