AI@NEWS

开源Qwen3.8推理预填充追平闭源方案

社区将Strix Halo上的llama.cpp预填充性能由约400提升至1200 token/s。

推荐理由:社区优化使llama.cpp在Strix Halo上的预填充吞吐提升约三倍,追平闭源Halogen;这证明消费级统一内存硬件仍有显著算子优化空间。

阅读原文