SeekJudge用模型化判断替代易过时的规则评测,服务电脑使用智能体RL训练。
推荐理由:电脑使用智能体的瓶颈在“任务是否真的完成”的奖励信号;SeekJudge若缩小模型裁判与规则评测差距,可直接改善长程GUI任务RL可训练性。
阅读原文