查看: 9|回复: 0

智能体不断进化,但其训练环境却往往停滞不前。

[复制链接]

12

主题

0

回帖

36

积分

新手上路

积分
36
发表于 20 小时前 | 显示全部楼层 |阅读模式
智能体不断进化,但其训练环境却往往停滞不前。

像谷歌云人工智能研究院这样的团队,通过这篇名为 EnvHarness 的论文,开始在环境层面引入“Harness”的概念。

在传统的基准测试中,任务和规则通常是固定的。一旦智能体能力增强,原有环境很快就会失去训练价值,而且很难持续生成针对其当前薄弱环节的新挑战。

EnvHarness 在现有环境之上添加了一个可编程组件,通过改变初始状态、交互规则或组合多个任务,动态生成更适合当前智能体的训练环境。

更重要的是,它保留了原有环境的逻辑和验证器,因此您无需再为“这个新生成的任务是否有正确答案?”而烦恼。

配套的 EnvRigger 会观察智能体的成功和失败轨迹,识别具体的弱点,然后自动生成针对性环境,并运行新的测试来验证效果。

实验涵盖五个基准测试:ALFWorld、WebArena、SWE-bench Verified、OfficeQA 和 SpreadsheetBench。在学习了 EnvHarness 生成的环境后,保留任务的性能提升最为显著,达到 9 分,执行步骤减少了 9.8%;用于强化学习时,性能提升最高可达 6.5 分。

本文最有价值的部分在于,它为智能体自进化机制增添了一个新的层次:

智能体可以从环境中学习,而环境也可以根据智能体暴露出的弱点不断演化。

未来,持续演化的系统将同时维持两个循环:智能体不断增强,而训练它的环境也随之演化。

📎 arxiv:



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部