AI@NEWS

双P40运行27B模型的并发瓶颈

双P40可运行Qwen 27B并获得可用速度,但长上下文和多智能体并发明显受限。

推荐理由:实测显示双P40生成可达每秒45 token,15万上下文后降至12至16;单任务尚可,多智能体并行则暴露显存和吞吐瓶颈。

阅读原文