AI@NEWS

Kimi K3量化至1.1TB GGUF

团队用llama.cpp分支将2.8T参数Kimi K3量化到Q3_K_S,CPU可运行。

推荐理由:2.8T A50B模型Q3_K_S后仍达1114.76GiB,且在64核EPYC、1.5TB内存无GPU下pp512仅4.21t/s,揭示超大MoE本地化可行但硬件和吞吐仍很苛刻。

阅读原文