Anthropic 刚刚发布了一份详尽的报告,阐述了其最大的 AI 终端如何让智能体自我改进。

Anthropic 刚刚发布了一份详尽的报告,阐述了其最大的 AI 终端如何让智能体自我改进。

如果你错过了之前的消息,Warp 是一个围绕智能体重建的终端。它每月服务 80 万名开发者,其中包括 56% 的财富 500 强企业,并已筹集了 7300 万美元。Warp 平台已运行了 1000 万次 Claude Code 会话,平均每周超过 40 万次。

他们自己的代码审查智能体总是给出无用的评论,工程师们对此怨声载道。他们尝试在每次收到差评后手动重写提示,然后改进上下文文件。这两种方法都有效,但都无法扩展。

真正的问题在于,会话结束后,反馈信息就消失了。

因此,他们构建了一个由两个文件组成的循环。

第一个文件存储着智能体运行所需的知识。它负责执行任务,而人工会在执行任务的地方做出反应,以评论的形式添加到拉取请求中。注意,这不是评分。原因在于:您建议重命名这个变量,但我们对这种类型的命名约定不同。

第二个文件是一个观察器,它按计划运行,而不是按任务运行。它收集反馈,将智能体提出的方案与用户的反馈进行比较,并对第一个文件进行尽可能小的修改。

该修改以拉取请求的形式提交。有人审核并合并它,下一次运行就会继承它。

他们总结了两条规则:编写原则而非规则,并且始终解释原因。


分类