新框架融合少量人工判断与大规模自动评分,以无偏方式降低非可验证任务的评测成本。
推荐理由:核心贡献是用预测驱动推断校正自动指标偏差,使少量人工标注也能得到可证明无偏的系统比较;配对与非配对效率分析进一步回答了评测预算该如何分配。
阅读原文