AI@NEWS

DeepSeek V4 Flash推理加速修复

社区发现CUDA 13.2/13.3可能拖慢DeepSeek V4 Flash预填充吞吐。

推荐理由:关键点不是模型发布而是工程瓶颈:CUDA 13.2后DeviceTopK路径疑似导致prefill性能下降,降到13.1重编译可带来百级t/s改善。

阅读原文