系统梳理LLM推理的延迟、并发、显存、多机和每Token成本测量。
推荐理由:覆盖单请求到多GPU的测量口径,尤其把CUDA事件、并发请求和每Token成本放在同一框架,适合校准推理优化的真实瓶颈。
阅读原文