几十步之后,旧观察、过期状态、工具输出和推理过程全堆在一起。模型每走一步,都要重新判断哪些信息现在还有效。
Google 团队这篇 SKILL.state,给了一个很直接的解法:
别一直保存完整历史,只维护「当前状态」。
每一步 Agent 只看到三样东西:固定的 Skill、当前结构化状态,以及最新观察。
推理仍然正常进行,但完成这一步后就被丢掉,只把真正会影响未来执行的信息写回 state。
这样一来,任务跑 10 步还是 200 步,Prompt 大小基本保持稳定。
在 100 步任务中,传统 Stateful Agent 累计消耗约 106 万 token,SKILL.state 只用了 6.5 万,减少约 16 倍,同时准确率从 0.91 提升到 0.94。
在 InterCode CTF 和 τ-Bench 上,它也同时提升了成功率并减少 token 消耗。
这篇给我的一个很直接的启发是:
长时 Agent 的上下文,可能更适合做成一个持续更新的「工作状态」。
做过什么可以忘,下一步真正需要知道什么,才值得一直留下来。
📎 arxiv: https://arxiv.org/abs/2608.26263