AI@NEWS

llama.cpp融合MoE共享专家算子

CUDA改动将共享专家融合进MMVQ,为Qwen 35B A3B等部分MoE架构提速。

推荐理由:该改动把共享专家计算并入量化矩阵向量算子,减少额外内核启动与中间访存;收益受MoE结构限制,但可直接改善特定模型的推理效率。

阅读原文