CLBench-V评测模型从图表、报告、地图等多模态上下文中学习任务知识。
推荐理由:基准切中LLM评测盲区:现实上下文常藏在图表和页面结构里,不只是文本;它把grounding到知识获取串起来测,更接近企业文档场景。
阅读原文