MoE²-LoRA将路由先验与低秩适配深度耦合,用于MoE模型高效微调。
推荐理由:MoE模型微调的关键痛点是适配器与路由机制脱节;MoE²-LoRA按token动态利用专家先验,可能降低遗忘并提升跨专家特征学习效率。
阅读原文