DASH为RLVR中的自蒸馏动态选择监督跨度,缓解稀疏奖励下的时序利用不足。
推荐理由:关键点不是再加教师信号,而是按学生轨迹分歧自适应决定监督 horizon;若有效,说明推理RL可从“结果奖励”转向更细粒度的过程分配。
阅读原文