AI@NEWS
Olmo 3后训练与DPO复盘
播客深入讨论Olmo 3后训练、DPO数据问题和多阶段训练组织挑战。
推荐理由:
重点不在DPO公式,而是近前沿模型落地时的数据偏好构造、阶段协同和扩展问题,揭示后训练瓶颈正在工程化。
阅读原文