AI@NEWS

5090运行量化Qwen长上下文实测

用户称限功耗RTX 5090运行Qwen量化模型时,解码达150至200 token/s。

推荐理由:单卡限功耗5090配96GB内存,在128K上下文下仍报告每秒150至200词元解码,显示激进量化可显著降低长上下文本地推理门槛,但缺少复现实验。

阅读原文