LOCUS用局部视觉线索搜索训练MLLM,缓解关键信息被冗余上下文淹没的问题。
推荐理由:论文把MLLM细粒度视觉失败归因为“视觉上下文腐化”,用可验证代理任务训练模型主动找局部证据;这指向高分辨率输入之外的注意力选择瓶颈。
阅读原文