AI@NEWS

强化学习后训练如何影响组合推理

以依赖图和三级组合复杂度,测量强化学习后训练对技能重组能力的作用。

推荐理由:依赖图框架把组合推理拆成三个递增层级,可区分模型是在复用单项技能还是形成新组合;这能检验强化学习增益是否真正迁移到未见任务。

阅读原文