AI@NEWS

M5 Ultra运行LLM的预填充调优

实测将预填充分块设为8192,可提升长上下文处理性能并改善MTP取值效率。

推荐理由:在M5 Ultra上,8192步长使GLM四比特模型处理3.2万词元时达到每秒1056词元;结果说明本地推理瓶颈不仅在算力,也在任务分发粒度。

阅读原文