llama.cpp合入Ternary-Bonsai支持
llama.cpp合入支持CUDA运行Ternary-Bonsai-8B-Q2_0.gguf的PR。
推荐理由:Ternary-Bonsai-8B的CUDA路径进入llama.cpp,重点不是单个模型,而是低比特GGUF在主流本地推理栈中获得更直接的GPU验证入口。
llama.cpp合入支持CUDA运行Ternary-Bonsai-8B-Q2_0.gguf的PR。
推荐理由:Ternary-Bonsai-8B的CUDA路径进入llama.cpp,重点不是单个模型,而是低比特GGUF在主流本地推理栈中获得更直接的GPU验证入口。