AI@NEWS

llama.cpp新增Maple三值MoE支持

llama.cpp为Maple 20B-A1B三值MoE架构加入CPU推理支持,模型仍处预览阶段。

推荐理由:新增三值化MoE的CPU推理支持,20B总参数仅约1B激活;若模型兑现,可把本地运行瓶颈从显存容量转向CPU带宽与算子效率。

阅读原文