AI@NEWS

ReDraft缓解多模态持续训练遗忘

以参考答案驱动模型修订,在学习新任务时兼顾策略接近与有效监督。

推荐理由:ReDraft填补SFT信号强却易遗忘、在线强化学习保守却难冷启动的缺口,核心是把参考答案转成贴近当前策略的修订目标。

阅读原文