llama.cpp默认加载MTP张量
新版llama.cpp会默认加载GGUF内MTP张量,即使未启用推测解码。
推荐理由:变更会让含MTP块的社区GGUF在常规加载时多占约一层MoE的显存/内存,影响GLM、Qwen等模型部署成本;本地推理用户需重新检查量化包与加载参数。
新版llama.cpp会默认加载GGUF内MTP张量,即使未启用推测解码。
推荐理由:变更会让含MTP块的社区GGUF在常规加载时多占约一层MoE的显存/内存,影响GLM、Qwen等模型部署成本;本地推理用户需重新检查量化包与加载参数。