AirLLM展示用单张4GB GPU进行2.8T参数Kimi K3推理的方案。
推荐理由:2.8T模型在4GB显存上推理的关键不在算力而在分层加载、量化与内存换显存,若可复现,说明超大MoE本地低成本试跑门槛继续下降。
阅读原文