Gefen通过共享二阶矩和量化一阶矩,将AdamW优化器状态内存显著降低。
推荐理由:AdamW状态约占两份参数内存,Gefen声称把内存占用降约8倍、每十亿参数省6.5GiB,直接击中大模型预训练显存成本。
阅读原文