以栈式记忆和强化学习改进多步检索、推理及中间上下文修订。
推荐理由:它针对智能体RAG动作粒度粗、轨迹奖励难归因的问题,引入栈式记忆支撑中间状态更新;若奖励设计有效,可减少短视且模板化的检索路径。
阅读原文