AI@NEWS

用自博弈搜索蒸馏生成推理数据

SPSD借助类MuZero网络在棋类环境中自博弈,将搜索轨迹转化为结构化推理样本。

推荐理由:方法借可执行棋类环境获得动作后果与竞争选项明确的监督,试图绕过人工标注和低质合成数据;价值在于训练决策推理,但跨域迁移仍是关键未知数。

阅读原文