AI@NEWS

OPLD改进多模态潜在推理

OPLD用on-policy潜在蒸馏,让多模态模型学习更灵活的内部视觉推理。

推荐理由:多模态CoT常受人工轨迹和外部视觉操作限制;OPLD把中间推理压进连续潜变量并用on-policy训练,指向更低开销的视觉思考。

阅读原文