SuperFlow改进流模型RL训练
SuperFlow针对流匹配模型提出在线RL训练框架,优化采样效率与逐步信用分配。
推荐理由:核心在把prompt采样预算和flow轨迹内信用分配拆开处理,试图修正GRPO式固定组大小与轨迹优势复用的低效和偏差,对文生图flow模型后训练有直接方法价值。
SuperFlow针对流匹配模型提出在线RL训练框架,优化采样效率与逐步信用分配。
推荐理由:核心在把prompt采样预算和flow轨迹内信用分配拆开处理,试图修正GRPO式固定组大小与轨迹优势复用的低效和偏差,对文生图flow模型后训练有直接方法价值。