用户称原生vLLM可实现262K上下文、单流超70 tok/s及万级预填充。
推荐理由:双3090在原生vLLM下实现262K上下文、单流超70 tok/s和万级预填充,若可复现,说明消费级多卡部署仍有显著调优空间。
阅读原文