方法用多数投票伪标签作奖励,仅优化约10万个偏置参数完成测试时推理适配。
推荐理由:它把测试时强化学习压缩到约十万个偏置参数,并完全省去人工标签;若效果稳定,推理能力适配将从重型全参更新变为可低成本部署的轻量过程。
阅读原文