DeepSeek V4.1 Flash八卡A40实测
TensorSharp在8张A40上实现Q2约40 tok/s、Q4约32 tok/s的单请求解码。
推荐理由:结果表明旧款A40集群也能承载长上下文大模型:量化后单请求达31至41 tok/s,并发总吞吐升至48.9 tok/s,为低成本私有部署提供实测基线。
TensorSharp在8张A40上实现Q2约40 tok/s、Q4约32 tok/s的单请求解码。
推荐理由:结果表明旧款A40集群也能承载长上下文大模型:量化后单请求达31至41 tok/s,并发总吞吐升至48.9 tok/s,为低成本私有部署提供实测基线。