研究不再把标注分歧视作噪声,而是建模不同人群与个体的系统性效用差异。
推荐理由:它挑战奖励模型共享单一效用函数的基础假设,把主观任务中的分歧视为可学习结构;这关系到对齐系统能否避免用多数偏好抹平少数群体。
阅读原文