以参考答案驱动模型修订,在学习新任务时兼顾策略接近与有效监督。
推荐理由:ReDraft填补SFT信号强却易遗忘、在线强化学习保守却难冷启动的缺口,核心是把参考答案转成贴近当前策略的修订目标。
阅读原文