论文提出CVMA框架,评估多模态助手跨轮对话中丢弃视觉KV会损失哪些事实。
推荐理由:它直接挑战按当前注意力裁剪视觉KV的假设:未来问题未知时,低注意区域未必可删;CVMA用成对prefill衡量遗忘代价,对长上下文多模态压缩很关键。
阅读原文