AI@NEWS

GUI智能体奖励框架

SeekJudge用模型化判断替代易过时的规则评测,服务电脑使用智能体RL训练。

推荐理由:电脑使用智能体的瓶颈在“任务是否真的完成”的奖励信号;SeekJudge若缩小模型裁判与规则评测差距,可直接改善长程GUI任务RL可训练性。

阅读原文