NVRx结合PyTorch FSDP,在2至8节点H100集群实现逾99%训练效率。
推荐理由:异步检查点与进程内、作业内重启把GPU故障恢复压到秒级,同时在2至8节点H100上保持99%以上效率,为大模型训练降低了容错成本。
阅读原文