论文比较多任务混合RLVR与分领域训练后合并两种通才模型路线。
推荐理由:单领域RLVR已能强化数学或代码能力,但跨域训练会产生梯度干扰与能力权衡;该研究直接比较混合训练和独立训练后合并,为构建专家级通才模型提供策略依据。
阅读原文