作者称在棋类LLM训练中混入约8%推理轨迹,优于纯棋盘到走法数据。
推荐理由:有价值的是“推理蒸馏”信号:即使推理分支会产生非法走法,少量轨迹仍能改善等预算训练,暗示过程数据可改变内部策略表征而不增加推理成本。
阅读原文