AI@NEWS

仅调偏置的无标签测试时强化学习

方法用多数投票伪标签作奖励,仅优化约10万个偏置参数完成测试时推理适配。

推荐理由:它把测试时强化学习压缩到约十万个偏置参数,并完全省去人工标签;若效果稳定,推理能力适配将从重型全参更新变为可低成本部署的轻量过程。

阅读原文