因果扰动实验发现,VLM视觉注意力存在三种不同的忠实性处理模式。
推荐理由:研究把高注意力视觉词元置于因果扰动下检验,发现其充分性与必要性并不一致,意味着注意力热图不能被统一当作VLM推理解释。
阅读原文