Moonshot发布感知基准PerceptionBench
PerceptionBench从前沿模型失败中归纳10项视觉感知能力,构建3000道验证题。
推荐理由:它把多模态评测从综合问答拆成10个纯视觉原子能力,且能力来自42个基准的失败样本,能更精确定位模型是看不见还是推不出。
PerceptionBench从前沿模型失败中归纳10项视觉感知能力,构建3000道验证题。
推荐理由:它把多模态评测从综合问答拆成10个纯视觉原子能力,且能力来自42个基准的失败样本,能更精确定位模型是看不见还是推不出。