AI@NEWS

MoE专家预取优化

SpecPrefetch为稀疏MoE模型提出参数高效的专家预取方法以缓解卸载瓶颈。

推荐理由:问题定位清晰:MoE卸载节省显存却让路由、加载、执行串行化;提前预测专家可把I/O延迟隐藏到推理流程中,直接关系到大MoE低成本部署。

阅读原文