Kimi K3在8GB内存CPU运行
作者用C99实现推理引擎,通过按需读取MoE专家让Kimi K3可在低内存CPU上运行。
推荐理由:关键在于利用MoE稀疏激活:1.56TB权重中93%为专家且每token仅激活16/896,将专家按需从NVMe流式读取,证明超大开源模型可用存储换内存做本地探索。
作者用C99实现推理引擎,通过按需读取MoE专家让Kimi K3可在低内存CPU上运行。
推荐理由:关键在于利用MoE稀疏激活:1.56TB权重中93%为专家且每token仅激活16/896,将专家按需从NVMe流式读取,证明超大开源模型可用存储换内存做本地探索。