AI@NEWS

小型搜索智能体也能直接强化学习

验证小于10亿参数模型能否不靠教师蒸馏,直接以可验证奖励学习开放域搜索问答。

推荐理由:关键在于检验十亿参数以下模型能否摆脱大模型蒸馏,直接从答案匹配奖励学会检索推理;若成立,可明显降低搜索智能体训练门槛。

阅读原文