80张5090跑起Kimi K3
Kimi K3以官方MXFP4权重在80张RTX 5090上实现约20 tok/s单流推理。
推荐理由:2.8T参数模型用消费级GDDR7显卡和普通以太网跑通,关键意义是绕开HBM稀缺约束;虽20 tok/s仍低,但证明开源前沿模型部署边界在下移。
Kimi K3以官方MXFP4权重在80张RTX 5090上实现约20 tok/s单流推理。
推荐理由:2.8T参数模型用消费级GDDR7显卡和普通以太网跑通,关键意义是绕开HBM稀缺约束;虽20 tok/s仍低,但证明开源前沿模型部署边界在下移。