llama.cpp新增Maple三值MoE支持
llama.cpp为Maple 20B-A1B三值MoE架构加入CPU推理支持,模型仍处预览阶段。
推荐理由:新增三值化MoE的CPU推理支持,20B总参数仅约1B激活;若模型兑现,可把本地运行瓶颈从显存容量转向CPU带宽与算子效率。
llama.cpp为Maple 20B-A1B三值MoE架构加入CPU推理支持,模型仍处预览阶段。
推荐理由:新增三值化MoE的CPU推理支持,20B总参数仅约1B激活;若模型兑现,可把本地运行瓶颈从显存容量转向CPU带宽与算子效率。