论文将目标完成后仍持续优化、重复验证等行为归因于全局执行控制缺失。
推荐理由:论文识别出智能体在收益递减后仍继续行动的系统性浪费,并把问题从局部推理能力转向全局停止决策;核心启示是代理需要独立于生成循环的价值感知控制层。
阅读原文