AI@NEWS

把MoE专家路由变成强化学习探索空间

研究通过扰动专家路由增加输出与轨迹多样性,将稀疏计算路径纳入RL探索。

推荐理由:论文不再把MoE路由视作固定基础设施,而把专家选择转化为额外探索维度;这可能以较低生成开销提升RL轨迹覆盖和奖励上限。

阅读原文