AI@NEWS

DeepSeek V4 Flash本地推理调参

作者分享DeepSeek V4 Flash 0731在llama-server上的本地推理配置与速度。

推荐理由:从140pp/s到约700pp/s的差异集中在-b、-ub和--cpu-moe配置,说明大MoE模型本地推理瓶颈不只在GPU,CPU侧调度同样关键。

阅读原文