OPLD用on-policy潜在蒸馏,让多模态模型学习更灵活的内部视觉推理。
推荐理由:多模态CoT常受人工轨迹和外部视觉操作限制;OPLD把中间推理压进连续潜变量并用on-policy训练,指向更低开销的视觉思考。
阅读原文