AI@NEWS

64GB Mac借SSD运行95.5GiB模型

定制llama.cpp按路由从SSD读取专家,使64GB Mac以约27 tok/s运行超内存模型。

推荐理由:关键是只把被路由命中的专家从SSD读入,而非加载全部95.5GiB权重;这以存储带宽换内存容量,拓宽消费级设备运行MoE模型的上限。

阅读原文