三张旧矿卡跑本地模型速度翻三倍
三张RTX 3060在IQ3量化下通过Strata实现38–40 token/s,显著快于llama.cpp。
推荐理由:三张旧款RTX 3060在IQ3量化下跑到38–40 token/s,约为llama.cpp三倍,表明闲置矿卡可低成本承载本地推理,但尚缺统一基准验证。
三张RTX 3060在IQ3量化下通过Strata实现38–40 token/s,显著快于llama.cpp。
推荐理由:三张旧款RTX 3060在IQ3量化下跑到38–40 token/s,约为llama.cpp三倍,表明闲置矿卡可低成本承载本地推理,但尚缺统一基准验证。