DeepSeek V4量化跑分
用户分享DeepSeek-V4-Flash三比特量化在3张3090上的llama-bench结果。
推荐理由:3bit K_XL量化可在约72GB消费级显存上运行大模型,说明本地推理门槛继续下探;但这是单机bench,吞吐和质量损失需分开看。
用户分享DeepSeek-V4-Flash三比特量化在3张3090上的llama-bench结果。
推荐理由:3bit K_XL量化可在约72GB消费级显存上运行大模型,说明本地推理门槛继续下探;但这是单机bench,吞吐和质量损失需分开看。