AI@NEWS

12GB显存运行Qwen3.8达65词元每秒

自研推理引擎在RTX 5070上将Qwen3.8量化模型输出提升至约65 tokens/s。

推荐理由:针对单一模型和消费级显卡的专用引擎,将此前约15词元每秒提升至65,并支持128K上下文;说明软硬件协同优化可显著降低本地长上下文推理门槛。

阅读原文