论文提出反事实模态归因,判断MLLM预测主要由图像还是文本驱动。
推荐理由:它补上现有解释方法的关键盲区:答案正确不代表证据来源正确;模态级归因可直接检测MLLM是否靠文本捷径或图像伪线索做决策。
阅读原文