Mac与iPhone协同推理提速44%
开发者将Qwen3.8-27B分层拆至M4 Pro与A19 Pro运行,预填充性能最高提升44%。
推荐理由:分层流水线把手机GPU与神经网络引擎纳入长上下文推理,缓解Mac统一内存瓶颈,说明消费设备可通过异构协同扩展本地大模型能力。
开发者将Qwen3.8-27B分层拆至M4 Pro与A19 Pro运行,预填充性能最高提升44%。
推荐理由:分层流水线把手机GPU与神经网络引擎纳入长上下文推理,缓解Mac统一内存瓶颈,说明消费设备可通过异构协同扩展本地大模型能力。