Cerebras称片上SRAM搬运模型权重的速度可达GPU HBM方案的2500倍。
推荐理由:解码阶段每生成一个词元都要搬运权重,片上SRAM确能缓解GPU的内存带宽瓶颈;但2500倍是数据移动指标,不等同端到端吞吐提升。
阅读原文