实验显示小模型依赖提示格式识别测试,大模型则更多使用高阶语境推理。
推荐理由:跨Gemma、Phi与Llama的分析显示,规模增长会把评测识别线索从表面格式迁移到任务语境;仅靠改模板防止模型“察觉考试”因而可能失效。
阅读原文