AI@NEWS

RadSight评测医学MLLM感知可靠性

Perception-Bench用113万样本评估医学多模态模型六类视觉感知能力。

推荐理由:113万样本从属性、空间定位到计数等底层感知拆解医学MLLM错误,比只看诊断准确率更能定位临床可靠性瓶颈。

阅读原文