AI@NEWS

Qwen长上下文KV缓存可卸载至内存

用户在vLLM上以三张3090实现百万上下文,长上下文解码速度稳定在约60 token/s。

推荐理由:实测将大部分KV缓存卸载至内存后,三张3090仍可跑百万上下文,解码约60至80 token/s,说明QSA可显著降低长上下文显存门槛。

阅读原文