llama.cpp为Qwen Flash Next加入MTP
合并后的新实现让Qwen Flash Next可在llama.cpp中使用多Token预测推理。
推荐理由:关键变化是本地推理栈已接通Qwen Flash Next的多Token预测能力,并同步提供GGUF量化;这可能显著改善生成吞吐,降低从Qwen 3.8 27B迁移的门槛。
合并后的新实现让Qwen Flash Next可在llama.cpp中使用多Token预测推理。
推荐理由:关键变化是本地推理栈已接通Qwen Flash Next的多Token预测能力,并同步提供GGUF量化;这可能显著改善生成吞吐,降低从Qwen 3.8 27B迁移的门槛。