SaliLLM发现多模态大模型定位强于SOTA,但分割仍明显较弱。
推荐理由:最关键发现是能力错位:MLLM在显著物体定位上超过传统SOTA,却在像素级分割落后;这提示视觉语言模型的语义理解尚未转化为精细掩码能力。
阅读原文