AI@NEWS

视觉Token裁剪前先校准

论文提出在VLM视觉Token压缩前校准语义一致性,降低语义漂移。

推荐理由:视觉Token压缩通常只看冗余,忽略N到K映射后关键线索是否错配;把语义漂移显式纳入压缩流程,直接关系到高分辨率VLM推理成本。

阅读原文