AI@NEWS

Kimi K3在8GB内存CPU运行

作者用C99实现推理引擎,通过按需读取MoE专家让Kimi K3可在低内存CPU上运行。

推荐理由:关键在于利用MoE稀疏激活:1.56TB权重中93%为专家且每token仅激活16/896,将专家按需从NVMe流式读取,证明超大开源模型可用存储换内存做本地探索。

阅读原文