以检索证据约束并细化推理奖励,改善通用多模态嵌入在大语料检索中的训练。
推荐理由:现有GRPO给整段思维链所有词相同优势值,无法区分有证据的判断与无效推演;该方法用检索反馈细化信用分配,直指大规模嵌入训练的噪声来源。
阅读原文