双P40可运行Qwen 27B并获得可用速度,但长上下文和多智能体并发明显受限。
推荐理由:实测显示双P40生成可达每秒45 token,15万上下文后降至12至16;单任务尚可,多智能体并行则暴露显存和吞吐瓶颈。
阅读原文