无需访问模型参数,以博弈式偏好建模替代受限的标量奖励进行推理时对齐。
推荐理由:现有推理时对齐多依赖Bradley-Terry标量奖励,无法表达循环或非传递偏好;纳什解可处理更一般的比较关系,为闭源模型提供无参数更新的对齐路径。
阅读原文