llama.cpp后端性能更新
llama.cpp合入CUDA与Metal后端优化,Mamba-2长上下文预填充最高约22%加速。
推荐理由:最实质的是Mamba-2预填充在长上下文下约20%级加速,并补强Metal后端;本地推理瓶颈正在靠底层kernel小步优化累积改善。
llama.cpp合入CUDA与Metal后端优化,Mamba-2长上下文预填充最高约22%加速。
推荐理由:最实质的是Mamba-2预填充在长上下文下约20%级加速,并补强Metal后端;本地推理瓶颈正在靠底层kernel小步优化累积改善。