Agent 自我进化跑久了,会出现一种很危险的情况:
Agent 自我进化跑久了,会出现一种很危险的情况:分数涨了,能力却在悄悄变窄。这篇 HarnessEvolve 想解决 Agent 自我修改 Harness 时很容易遇到的几个问题。长任务失败后,最终 reward 只能告诉它「错了」,却很难知道真正从哪一步开始偏航。HarnessEvolve 会先生成一条经过验证的「参考轨迹」,再和失败轨迹对齐,找到最早出现分歧的位置。随后把大量失败按原因聚类,再针对共性问题修改 Prompt、Skill、工具甚至执行逻辑。更关键的是,每次修改都要过两道检查。一层负责拦截把训练答案直接写进 Harness、疯狂堆例子这类捷径;另一层会测试新版本有没有提升当前任务,同时检查过去学会的能力有没有退化。结果在 CloudCoreNetwork-QA 上,Qwen3.6-27B 从 43.4% 提升到 86.9%。去掉「参考轨迹」后又掉到 57.8%,说明找到真正的失败起点非常关键。这篇工作会让我更关注自进化里的「验收机制」。Agent 会修改自己已经越来越容易了,真正难的是确保每次修改都学对了东西,而且没有顺手把以前会的东西弄丢。自进化跑得越久,就越需要一套独立于执行 Agent 的诊断、验证和回滚系统。📎 arxiv: https://arxiv.org/abs/2609.00829