AI@NEWS

Strata运行80GB量化模型速度翻倍

DDR4与7900XTX运行Qwen3.8 Next的IQ3_XXS量化版达45至50词元每秒。

推荐理由:单机实测显示,Strata在慢速DDR4与消费级显卡上较调优后的llama.cpp吞吐翻倍,意味着大模型推理瓶颈可通过内存调度优化显著缓解,但结论仍需更多硬件复现。

阅读原文