AI@NEWS

少量推理轨迹提升棋类LLM

棋类LLM混入约8%推理轨迹后,在同等预算下优于纯棋步数据训练。

推荐理由:约8%带推理轨迹的数据提升了board到move训练效果,说明蒸馏式思考样本可改变策略表示,而不必增加推理时成本。

阅读原文