芯片定制调优让Splash解码提速20%
Splash在40核M5 Max上实测调优量化矩阵乘内核,借助split-K布局将解码性能提升20%。
推荐理由:默认规则源自较小芯片,无法覆盖40核配置;逐机搜索量化矩阵乘实现后,split-K显著加速草稿令牌校验,说明本地推理仍有硬件专属优化红利。
Splash在40核M5 Max上实测调优量化矩阵乘内核,借助split-K布局将解码性能提升20%。
推荐理由:默认规则源自较小芯片,无法覆盖40核配置;逐机搜索量化矩阵乘实现后,split-K显著加速草稿令牌校验,说明本地推理仍有硬件专属优化红利。