AI@NEWS

177B模型可从SSD流式推理

Qwen3.8 177B以119GiB量化权重,在16GB显卡主机实现每秒9至10词元。

推荐理由:按需从SSD读取MoE专家,使远超显存和内存容量的177B模型仍可交互式解码;这把本地大模型部署瓶颈转向存储带宽与调度效率。

阅读原文