研究用因果干预分析VLM长CoT是否持续依赖图像token。
推荐理由:如果长CoT主要在早期已提取的视觉信息上运转,而非持续读取图像token,那么测试时扩展提升的其实是语言侧推理重组,不是视觉证据获取能力。
阅读原文