实测将预填充分块设为8192,可提升长上下文处理性能并改善MTP取值效率。
推荐理由:在M5 Ultra上,8192步长使GLM四比特模型处理3.2万词元时达到每秒1056词元;结果说明本地推理瓶颈不仅在算力,也在任务分发粒度。
阅读原文