检验对话情绪是否真能被唯一标注,揭示模型可能依赖数据集捷径。
推荐理由:研究质疑每句对话只有一个无歧义情绪的基础设定,而非再刷任务分数;若标注本身存在多义性,现有微调模型的高准确率可能主要衡量数据集捷径。
阅读原文