SynthSentry无需生成模型、历史或标签,以三类统计量的分布偏差筛查语料。
推荐理由:它把模型坍塌治理前移到训练前的数据准入环节,并做到模型无关、无合成标签;若跨领域稳健,可成为大规模语料清洗的关键质量信号。
阅读原文