用户寻找可在llama.cpp中原生支持64K以上上下文的本地模型。
推荐理由:问题暴露本地agent部署的真实瓶颈:显存够跑主模型不等于能做长上下文压缩,原生训练窗口与llama.cpp请求校验会限制多模型工作流。
阅读原文