AI@NEWS

评测LLM应检查何时停止搜集信息

论文指出LLM常低估所需信息量,答对问题也可能掩盖证据搜集不足。

推荐理由:研究把评测对象从最终答案扩展到提问与停止策略:模型可能靠先验或猜测偶然答对,却未收集充分证据;这对搜索代理、诊断系统和高风险问答尤为关键。

阅读原文