AI@NEWS

指令条件探索训练LLM

ICE在RL训练时加入探索指令,并通过自蒸馏提升LLM训练样本多样性。

推荐理由:LLM强化学习的探索不是随机动作那么简单;用额外指令诱导多样经验,利用预训练知识扩展轨迹分布,针对后训练中的探索不足。

阅读原文