AI@NEWS

三张旧矿卡跑本地模型速度翻三倍

三张RTX 3060在IQ3量化下通过Strata实现38–40 token/s,显著快于llama.cpp。

推荐理由:三张旧款RTX 3060在IQ3量化下跑到38–40 token/s,约为llama.cpp三倍,表明闲置矿卡可低成本承载本地推理,但尚缺统一基准验证。

阅读原文