64GB Mac借SSD运行95.5GiB模型
定制llama.cpp按路由从SSD读取专家,使64GB Mac以约27 tok/s运行超内存模型。
推荐理由:关键是只把被路由命中的专家从SSD读入,而非加载全部95.5GiB权重;这以存储带宽换内存容量,拓宽消费级设备运行MoE模型的上限。
定制llama.cpp按路由从SSD读取专家,使64GB Mac以约27 tok/s运行超内存模型。
推荐理由:关键是只把被路由命中的专家从SSD读入,而非加载全部95.5GiB权重;这以存储带宽换内存容量,拓宽消费级设备运行MoE模型的上限。