OmniVLM将视觉token从729压到81,在十亿参数以下实现端侧多模态推理。
推荐理由:729到81的视觉token压缩直接打在VLM推理成本核心上;若多基准仍接近大模型,说明端侧多模态的瓶颈可通过视觉序列重构缓解。
阅读原文