文章记录用llama-cpp-python在本地加载并流式运行Qwen2.5。
推荐理由:价值在绕开服务化框架直接本地加载模型,适合低门槛实验和嵌入式原型;但更多是操作记录,缺少性能、量化和内存对比数据。
阅读原文