RTX 5090上ninfer实测快于llama.cpp
单次长上下文测试中,ninfer最高约155 token/s,llama.cpp无MTP约68 token/s。
推荐理由:同卡单次测试显示,主要差距来自NVFP4与MTP组合,而非推理框架本身:启用MTP后llama.cpp也达141 token/s,因输出长度不同仍需多轮对照验证。
单次长上下文测试中,ninfer最高约155 token/s,llama.cpp无MTP约68 token/s。
推荐理由:同卡单次测试显示,主要差距来自NVFP4与MTP组合,而非推理框架本身:启用MTP后llama.cpp也达141 token/s,因输出长度不同仍需多轮对照验证。