AI@NEWS

ExLlamaV3运行Flash Next实测提速

EXL3 3bpw在262K上下文及视觉、推测解码下,三张3090解码达80 token/s。

推荐理由:实测显示其在三张3090上预填充达1500、解码达80 token/s,单张5090亦达29 token/s,说明低比特量化可显著降低超长上下文模型的本地部署门槛。

阅读原文