AI@NEWS
RLSVR用于开放式自我改进
论文提出通过任务转换为开放式LLM自我改进构造可自验证奖励。
推荐理由:
论文试图绕过RLVR依赖外部可判题任务的限制,把开放任务转换为自验证奖励;若有效,可扩展模型自训练边界。
阅读原文