在RTX 4080上测试两款Qwen MoE模型,并公开补丁、基准与复现指南。
推荐理由:实验在不改权重和量化的前提下优化llama.cpp,部分提示处理和代码编辑负载显著提速;同时披露回退项,说明收益依赖工作负载而非普遍成立。
阅读原文