DEEPO分别处理困难样本优势归零和高置信错误词元缺乏梯度的问题。
推荐理由:论文定位了强化学习纠错链的两个失效点:困难问题全组答错导致优势为零,高置信错误又难获梯度;双熵机制因此直接作用于幻觉训练盲区。
阅读原文