AI@NEWS

单卡5090运行27B模型与156K上下文

单张RTX 5090以Q6_K运行Qwen3.8-27B,在近160K上下文下达到140至190 tok/s。

推荐理由:单卡5090同时容纳27B量化模型、近160K上下文与视觉投影,并借DFlash2达到140至190 tok/s,显示本地长程智能体门槛显著下降。

阅读原文