AI@NEWS

DeepSeek V4 Flash三比特重量化

社区发布DeepSeek-V4-Flash-0731专家层GGUF重量化版本,面向CPU溢出多卡部署。

推荐理由:只量化129个路由专家张量、保留注意力和路由高精度,使111.37GiB模型仍处3-bit档;对MoE本地推理的瓶颈从容量压缩转向专家层带宽优化。

阅读原文