AI@NEWS

Strata让24GB显卡跑长上下文Qwen

用户称在7900 XTX与64GB内存上以Q8运行Qwen Flash,250K上下文仍达60 token/s。

推荐理由:实质亮点是借助内存分层在24GB显存上承载Q8量化与250K上下文,同时维持约60 token/s;若可复现,本地长上下文推理将不再完全受显存容量约束。

阅读原文