Kimi K3家用实验结果
用户在768GB DDR5和双5090上用Q2_K量化跑出约4 token/s解码。
推荐理由:768GB内存加双5090只能约4t/s解码,显示超大模型本地化仍受内存带宽和量化实现制约;50-70t/s预填充也提示瓶颈集中在生成阶段。
用户在768GB DDR5和双5090上用Q2_K量化跑出约4 token/s解码。
推荐理由:768GB内存加双5090只能约4t/s解码,显示超大模型本地化仍受内存带宽和量化实现制约;50-70t/s预填充也提示瓶颈集中在生成阶段。