研究显示VLM在不同角色上下文下对同一图像的可供性判断大幅变化。
推荐理由:Qwen3-VL和LLaVA复现实验证明,同图像在不同agent persona下Jaccard仅约0.095,说明VLM行为能力判断高度受语境牵引。
阅读原文