AI@NEWS

llama.cpp合入GLM推测解码

llama.cpp合并GLM_DSA/GLM-5.2的NextN/MTP推测解码支持。

推荐理由:MTP/NextN进入llama.cpp意味着GLM-5.2可在本地推理栈利用多token预测降延迟;开源运行时适配速度正成为模型可用性的关键。

阅读原文