论文区分视觉信息可用性与上下文敏感性,诊断MLLM依赖语言先验的问题。
推荐理由:关键贡献是把“模型没看见”和“看见但不信视觉证据”拆开评估;这直接指向MLLM幻觉治理的核心,不只是提高识别分数。
阅读原文