AI@NEWS

本地LLM瓶颈不只看TOPS

文章讨论NPU TOPS指标无法完整反映本地LLM性能,内存带宽同样关键。

推荐理由:本地LLM推理常被参数搬运和KV缓存读写限制,单看NPU TOPS会高估端侧体验;这直接影响芯片选型、模型量化和上下文长度设计。

阅读原文