AI@NEWS

多模态模型越界问题基准

MMOOC评测MLLM何时该拒答、何时应回答上下文偏移问题。

推荐理由:它把真正越界问题和仍可回答的上下文偏移分开评测,比单纯不可回答基准更贴近产品风控;关键价值在于测试拒答边界而非只测准确率。

阅读原文