VistaHop评测多模态模型在多步视觉搜索、证据回看和细粒度线索连接上的能力。
推荐理由:这类基准补上了单次看图问答的盲区,要求模型反复定位局部证据并跨步骤推理;它更贴近智能体式视觉检索,而非静态VQA。
阅读原文