NIM将Nemotron吞吐提升至1997 tok/s
4张B200上,NIM优化使吞吐由718升至1997 tok/s,并支撑约2.78倍并发。
推荐理由:提升来自固定每用户50 tok/s延迟目标下的全栈协同,而非单项算子跑分;其收益依赖64K输入与76% KV复用的特定负载。
4张B200上,NIM优化使吞吐由718升至1997 tok/s,并支撑约2.78倍并发。
推荐理由:提升来自固定每用户50 tok/s延迟目标下的全栈协同,而非单项算子跑分;其收益依赖64K输入与76% KV复用的特定负载。