论文提出在VLM视觉Token压缩前校准语义一致性,降低语义漂移。
推荐理由:视觉Token压缩通常只看冗余,忽略N到K映射后关键线索是否错配;把语义漂移显式纳入压缩流程,直接关系到高分辨率VLM推理成本。
阅读原文