llama.cpp优化AMD显卡INT8矩阵乘法
llama.cpp为RDNA3和RDNA4实现INT8协作矩阵乘法,显著提升Vulkan推理性能。
推荐理由:该实现让7900 XTX运行Gemma 4 26B时预填充达到每秒3410个token,说明消费级AMD显卡的本地大模型吞吐瓶颈正被底层内核优化打破。
llama.cpp为RDNA3和RDNA4实现INT8协作矩阵乘法,显著提升Vulkan推理性能。
推荐理由:该实现让7900 XTX运行Gemma 4 26B时预填充达到每秒3410个token,说明消费级AMD显卡的本地大模型吞吐瓶颈正被底层内核优化打破。