AI@NEWS

VLM推理的视觉访问边界

研究用因果干预分析VLM长CoT是否持续依赖图像token。

推荐理由:如果长CoT主要在早期已提取的视觉信息上运转,而非持续读取图像token,那么测试时扩展提升的其实是语言侧推理重组,不是视觉证据获取能力。

阅读原文