AI@NEWS

Cerebras解释晶圆级推理的带宽优势

Cerebras称片上SRAM搬运模型权重的速度可达GPU HBM方案的2500倍。

推荐理由:解码阶段每生成一个词元都要搬运权重,片上SRAM确能缓解GPU的内存带宽瓶颈;但2500倍是数据移动指标,不等同端到端吞吐提升。

阅读原文