AI@NEWS

16GB显存运行Qwen 3.8 Flash的实践

开发者修改llama.cpp专家池机制,在单张MI50 16GB显卡上测试Qwen 3.8 Flash量化版。

推荐理由:该分支绕过预留完整上下文KV缓存及固定3GiB上限导致专家无法卸载的问题,使老款16GB显卡可利用CPU专家缓存运行大规模MoE模型。

阅读原文