AI@NEWS

16GB AMD显卡运行27B模型与十万上下文

用户借助Q4量化和分级KV缓存,在RX 7800 XT上实现约30 token/s解码。

推荐理由:关键突破是通过IQ4_XS权重量化、低精度KV缓存及关闭视觉投影卸载,把27B模型和十万上下文压入16GB显存;这显著降低了长上下文本地推理门槛。

阅读原文