AI@NEWS

过程奖励驱动逐步模型路由

方法用量规指导的过程奖励监督每一步模型选择,弥补仅以最终答案训练路由器的不足。

推荐理由:最终正确率无法定位哪一步模型选择失误,导致路由策略信用分配模糊;逐步量规奖励提供细粒度监督,有望同时改善推理成本控制与跨任务泛化。

阅读原文