AI@NEWS
少量推理轨迹提升棋类LLM
棋类LLM混入约8%推理轨迹后,在同等预算下优于纯棋步数据训练。
推荐理由:
约8%带推理轨迹的数据提升了board到move训练效果,说明蒸馏式思考样本可改变策略表示,而不必增加推理时成本。
阅读原文