AI@NEWS

llama.cpp为Qwen Flash Next加入MTP

合并后的新实现让Qwen Flash Next可在llama.cpp中使用多Token预测推理。

推荐理由:关键变化是本地推理栈已接通Qwen Flash Next的多Token预测能力,并同步提供GGUF量化;这可能显著改善生成吞吐,降低从Qwen 3.8 27B迁移的门槛。

阅读原文