查看: 4|回复: 0

Agent 自我进化跑久了,会出现一种很危险的情况:

[复制链接]

12

主题

2

回帖

50

积分

注册会员

积分
50
发表于 昨天 19:50 | 显示全部楼层 |阅读模式
Agent 自我进化跑久了,会出现一种很危险的情况:分数涨了,能力却在悄悄变窄。这篇 HarnessEvolve 想解决 Agent 自我修改 Harness 时很容易遇到的几个问题。长任务失败后,最终 reward 只能告诉它「错了」,却很难知道真正从哪一步开始偏航。HarnessEvolve 会先生成一条经过验证的「参考轨迹」,再和失败轨迹对齐,找到最早出现分歧的位置。随后把大量失败按原因聚类,再针对共性问题修改 Prompt、Skill、工具甚至执行逻辑。更关键的是,每次修改都要过两道检查。一层负责拦截把训练答案直接写进 Harness、疯狂堆例子这类捷径;另一层会测试新版本有没有提升当前任务,同时检查过去学会的能力有没有退化。结果在 CloudCoreNetwork-QA 上,Qwen3.6-27B 从 43.4% 提升到 86.9%。去掉「参考轨迹」后又掉到 57.8%,说明找到真正的失败起点非常关键。这篇工作会让我更关注自进化里的「验收机制」。Agent 会修改自己已经越来越容易了,真正难的是确保每次修改都学对了东西,而且没有顺手把以前会的东西弄丢。自进化跑得越久,就越需要一套独立于执行 Agent 的诊断、验证和回滚系统。📎 arxiv: https://arxiv.org/abs/2609.00829


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部