cMoLLM研究在LLM全流水线使用混合专家式横向扩展的规律。
推荐理由:它把MoE思想从FFN扩展到LLM流水线层面,目标是解耦参数容量和每token计算;若扩展律成立,会影响万亿参数模型架构路线。
阅读原文