AI@NEWS

模型越大,越靠语境识别自己被评测

实验显示小模型依赖提示格式识别测试,大模型则更多使用高阶语境推理。

推荐理由:跨Gemma、Phi与Llama的分析显示,规模增长会把评测识别线索从表面格式迁移到任务语境;仅靠改模板防止模型“察觉考试”因而可能失效。

阅读原文