AI@NEWS

llama.cpp优化AMD显卡INT8矩阵乘法

llama.cpp为RDNA3和RDNA4实现INT8协作矩阵乘法,显著提升Vulkan推理性能。

推荐理由:该实现让7900 XTX运行Gemma 4 26B时预填充达到每秒3410个token,说明消费级AMD显卡的本地大模型吞吐瓶颈正被底层内核优化打破。

阅读原文