AI@NEWS

双熵优化瞄准多模态幻觉盲区

DEEPO分别处理困难样本优势归零和高置信错误词元缺乏梯度的问题。

推荐理由:论文定位了强化学习纠错链的两个失效点:困难问题全组答错导致优势为零,高置信错误又难获梯度;双熵机制因此直接作用于幻觉训练盲区。

阅读原文