AI@NEWS

少量推理轨迹提升棋类LLM

作者称在棋类LLM训练中混入约8%推理轨迹,优于纯棋盘到走法数据。

推荐理由:有价值的是“推理蒸馏”信号:即使推理分支会产生非法走法,少量轨迹仍能改善等预算训练,暗示过程数据可改变内部策略表征而不增加推理成本。

阅读原文