AI@NEWS

12GB显存本地运行Qwen3.8 Flash Next

作者在RTX 4070上将125B MoE模型生成速度从6提升至接近20 token/s。

推荐理由:125B-A6B混合专家模型可借64GB内存与NVMe在12GB显卡运行,优化后速度提升逾三倍,说明大模型本地部署的瓶颈正转向内存带宽与卸载策略。

阅读原文