M1 Max运行2.8T参数Kimi K3
Deltafin在64GB M1 Max上运行2.8T MoE模型,速度为0.0687 token/s。
推荐理由:64GB本地跑2.8T MoE证明权重分片和极限换页可行,但14.6秒/token只能算技术演示;意义在于降低超大MoE可访问性而非实用推理。
Deltafin在64GB M1 Max上运行2.8T MoE模型,速度为0.0687 token/s。
推荐理由:64GB本地跑2.8T MoE证明权重分片和极限换页可行,但14.6秒/token只能算技术演示;意义在于降低超大MoE可访问性而非实用推理。