双昇腾卡运行Qwen的推理优化实测
双Atlas 300I Duo经适配后,将Qwen推理从约1 tok/s提升至单请求30 tok/s。
推荐理由:非CUDA昇腾平台经两周适配,将输出从不连贯且约1 tok/s提升至单请求30 tok/s、四并发61 tok/s,证明低成本大显存方案具备可用性。
双Atlas 300I Duo经适配后,将Qwen推理从约1 tok/s提升至单请求30 tok/s。
推荐理由:非CUDA昇腾平台经两周适配,将输出从不连贯且约1 tok/s提升至单请求30 tok/s、四并发61 tok/s,证明低成本大显存方案具备可用性。