PR将MTP场景采样从CPU移到GPU,Qwen3.6 35B在5090上tok/s提升8%。
推荐理由:采样链路从CPU搬到GPU后,MTP推理少了一段主机侧瓶颈;5090提速8%、P40约4%,说明老卡和新卡都能吃到延迟收益。
阅读原文