在线强化学习在共享策略中联合训练推理路由与条件响应,以减少简单问题上的冗长思考。
推荐理由:它不依赖固定路由标签,而以分层反事实信用区分“模式选择”和“答案质量”的贡献;若训练稳定,可让双模式模型自动交换推理成本与准确率。
阅读原文