Strix Halo推理工具实测快于llama.cpp
用户实测Gufo运行Qwen 3.8 Flash Next时预填充1239、解码57 token/s。
推荐理由:实测显示开启MTP后预填充达1239 token/s、解码57 token/s,前者约为最快Strix Halo专用llama.cpp分支的两倍;长上下文部署收益尤其明显。
用户实测Gufo运行Qwen 3.8 Flash Next时预填充1239、解码57 token/s。
推荐理由:实测显示开启MTP后预填充达1239 token/s、解码57 token/s,前者约为最快Strix Halo专用llama.cpp分支的两倍;长上下文部署收益尤其明显。