AI@NEWS

大模型推理瓶颈不只看算力

文章区分Prefill与Decode,指出后者常受显存带宽及KV Cache容量制约。

推荐理由:最实用的结论是推理选型不能只比较TFLOPs:Prefill偏计算密集,逐Token解码偏带宽密集,长上下文并发还会让KV缓存成为容量瓶颈。

阅读原文