AI@NEWS

llama.cpp采样上GPU提速

PR将MTP场景采样从CPU移到GPU,Qwen3.6 35B在5090上tok/s提升8%。

推荐理由:采样链路从CPU搬到GPU后,MTP推理少了一段主机侧瓶颈;5090提速8%、P40约4%,说明老卡和新卡都能吃到延迟收益。

阅读原文