AI@NEWS

llama.cpp长上下文预分配拖慢推理

用户发现配置131K上下文后,即使实际输入很短,9B量化模型仍明显变慢。

推荐理由:131K配置会扩大KV缓存并挤占仅8GB显存,部分张量被迫转移或减少GPU卸载层数,因此未填满上下文也可能变慢;应按实际需求降低窗口并检查卸载状态。

阅读原文