提出在RL前先用忠实热启动把策略锚定到视觉接地推理,缓解VLM多模态推理不稳定。
推荐理由:指出VLM做RL不稳的根因是模型靠语言先验编出流畅却不看图的推理链;先热启动到视觉接地再上RL,把'忠实'前置而非事后约束。
阅读原文