AI@NEWS

VERPO用验证证据细化策略优化

VERPO以经验证证据约束教师模仿,为模型后训练提供细粒度纠错。

推荐理由:结果奖励只能评价整段输出,教师重放虽更密集却可能传入无关风格;VERPO仅把证据视为修正提案,并用成功验证筛选,可将监督聚焦到真正影响任务结果的决策。

阅读原文