AI@NEWS

多领域RLVR该混训还是合并

论文比较多任务混合RLVR与分领域训练后合并两种通才模型路线。

推荐理由:单领域RLVR已能强化数学或代码能力,但跨域训练会产生梯度干扰与能力权衡;该研究直接比较混合训练和独立训练后合并,为构建专家级通才模型提供策略依据。

阅读原文