单台DGX Spark加速Qwen3.8实测
开源vLLM方案实现单流74 tok/s、八流合计212 tok/s,并支持完整262K上下文。
推荐理由:该方案把单台GB10的常规生成速度推至60至70 tok/s,八并发达212 tok/s,且公开逐轮数据与脚本,为本地长上下文部署提供了可复现实证。
开源vLLM方案实现单流74 tok/s、八流合计212 tok/s,并支持完整262K上下文。
推荐理由:该方案把单台GB10的常规生成速度推至60至70 tok/s,八并发达212 tok/s,且公开逐轮数据与脚本,为本地长上下文部署提供了可复现实证。