AI@NEWS

llama.cpp尝试热缓存MoE专家

新PR按使用热度把MoE常用专家留在GPU,8GB显存下部分模型提速。

推荐理由:热专家缓存让8GB显存上Qwen3.6-35B-A3B从33到56 tok/s,说明MoE推理瓶颈可用动态放置缓解;但大模型负例显示策略强依赖专家分布。

阅读原文