研究通过扰动专家路由增加输出与轨迹多样性,将稀疏计算路径纳入RL探索。
推荐理由:论文不再把MoE路由视作固定基础设施,而把专家选择转化为额外探索维度;这可能以较低生成开销提升RL轨迹覆盖和奖励上限。
阅读原文