AI@NEWS

DeepSeek-V4-Flash单卡A100测试

社区称DeepSeek-V4-Flash量化版可在40GB A100上以约16-18 tok/s运行。

推荐理由:162GB Q8量化模型在40GB A100上仅用约16GB显存、专家放CPU仍可跑到16-18 tok/s,说明MoE卸载让大模型本地代理式编码门槛明显下降。

阅读原文