AI@NEWS

无需训练即可将MoE激活专家减半

解耦专家选择数与归一化概率质量,仅增加一个整数即可减少推理期激活专家。

推荐理由:论文指出直接缩小top-k会同时改变路由集合与专家分支增益,并用双k归一化解耦二者;若跨模型验证成立,可在不再训练的情况下直接削减MoE推理算力。

阅读原文