以信息论刻画生成任务的可靠性天花板,并区分可由上下文消除与任务固有的不确定性。
推荐理由:研究把错误拆成可由更多上下文消除的部分与任务歧义导致的主观部分,说明单纯扩展模型无法越过信息上限,也动摇了以满分可靠性为目标的评测假设。
阅读原文