CUDA改动将共享专家融合进MMVQ,为Qwen 35B A3B等部分MoE架构提速。
推荐理由:该改动把共享专家计算并入量化矩阵向量算子,减少额外内核启动与中间访存;收益受MoE结构限制,但可直接改善特定模型的推理效率。
阅读原文