AI@NEWS

DeepSeek开源昇腾训练算子栈

六个昇腾项目覆盖内核与跨卡通信,矩阵算子达到芯片峰值性能的99.8%。

推荐理由:同一套TileLang源码可编译至英伟达和昇腾,且GEMM达到431 BF16 TFLOPS,实质降低大模型迁移国产芯片的工程成本。

阅读原文