任务越长,上下文里会混进已经完成的步骤、过期信息和大量执行噪声。Agent 明明积累了很多经验,却越来越难判断「现在到底该调用哪条」。
Princeton、Stanford、Oxford、NUS 团队这篇论文提出 Recuris,把 Agent Memory 分成两部分:
Working Memory 持续记录当前进度、未完成目标和验证证据;Experiential Memory 保存过去积累的 Skills。
Agent 每走一步,都会根据「当前状态」选择需要的经验,再用环境反馈更新状态,而不是反复从整段历史里找答案。
更有意思的是,失败也会反过来更新记忆。
系统会从执行轨迹里定位问题出在哪个记忆组件,只修改对应部分,并通过独立验证后才保留这次更新。基础模型本身始终不变。
效果很明显:在 τ²-Bench 上,GPT-5.6 Sol 提升 17.8 个百分点,Claude Opus 5 提升 15.6 个百分点,达到 87.9%。任务越长,优势还会继续扩大,最长任务提升达到 32.2 个百分点。
长期 Agent 的记忆,可能更像一个会不断整理自己的工作区。
旧经验要能调用,当前状态要能更新,失败之后还要知道该改掉哪一部分。
这比单纯把更多内容塞进 Memory 里重要得多。
📎 arxiv: https://arxiv.org/abs/2608.24876