AI@NEWS

双昇腾卡运行Qwen的推理优化实测

双Atlas 300I Duo经适配后,将Qwen推理从约1 tok/s提升至单请求30 tok/s。

推荐理由:非CUDA昇腾平台经两周适配,将输出从不连贯且约1 tok/s提升至单请求30 tok/s、四并发61 tok/s,证明低成本大显存方案具备可用性。

阅读原文