AI@NEWS

本地LLM推理速度骤降排查

用户反馈llama.cpp运行Qwen量化模型时TPS突然减半,寻求原因。

推荐理由:案例暴露本地推理性能对驱动、后端构建、显存占用、KV缓存和MoE卸载参数高度敏感;同一命令长期稳定并不代表环境未漂移。

阅读原文