AI@NEWS

32GB M1 Max运行125B模型达15 tok/s

MoEspresso 3通过专家驻留偏置等设计,在2021款M1 Max上实现Qwen3.8 125B模型12至15 tok/s解码。

推荐理由:在仅32GB统一内存的旧款M1 Max上,125B稀疏模型仍达到12至15 tok/s,说明专家驻留偏置与内存调度可显著降低MoE本地推理的硬件门槛。

阅读原文