用户分享4090与5060 Ti双卡在35B和122B模型上的llama.cpp测速。
推荐理由:这类实测的价值在于揭示消费级异构双卡跑大模型的工程细节:CUDA版本和内核回退可造成约6倍提示处理差异,比单看显存更关键。
阅读原文