AI@NEWS
混合后见自蒸馏方法
H2SD针对RLVR中成功和失败轨迹采用不同后见监督。
推荐理由:
它把RLVR的标量结果奖励补成轨迹级token指导,并区分成功轨迹稳定行为、失败轨迹纠错,针对推理模型训练中的稀疏监督痛点。
阅读原文