RTX Pro 6000推理Qwen达每秒600词元
用户称Ninfer运行Qwen3.6 35B-A3B时,单请求吞吐达到约600 tok/s。
推荐理由:单请求约600 tok/s意味着本地模型可用吞吐显著提升,甚至能以更多推理词元换取任务完成率;但缺少量化精度、上下文长度和测试配置。
用户称Ninfer运行Qwen3.6 35B-A3B时,单请求吞吐达到约600 tok/s。
推荐理由:单请求约600 tok/s意味着本地模型可用吞吐显著提升,甚至能以更多推理词元换取任务完成率;但缺少量化精度、上下文长度和测试配置。