单卡3090运行Qwen3.8-27B实测
作者用24GB RTX 3090部署27B四位量化模型,测试本地编码代理并暴露推理预算瓶颈。
推荐理由:约16.8GB权重可全量装入24GB显存并支持13万上下文,但推理会挤占8192输出额度,说明本地编码代理的主要约束已从模型装载转向预算分配。
作者用24GB RTX 3090部署27B四位量化模型,测试本地编码代理并暴露推理预算瓶颈。
推荐理由:约16.8GB权重可全量装入24GB显存并支持13万上下文,但推理会挤占8192输出额度,说明本地编码代理的主要约束已从模型装载转向预算分配。