AI@NEWS

Olmo 3后训练与DPO复盘

播客深入讨论Olmo 3后训练、DPO数据问题和多阶段训练组织挑战。

推荐理由:重点不在DPO公式,而是近前沿模型落地时的数据偏好构造、阶段协同和扩展问题,揭示后训练瓶颈正在工程化。

阅读原文