像谷歌云人工智能研究院这样的团队,通过这篇名为 EnvHarness 的论文,开始在环境层面引入“Harness”的概念。
在传统的基准测试中,任务和规则通常是固定的。一旦智能体能力增强,原有环境很快就会失去训练价值,而且很难持续生成针对其当前薄弱环节的新挑战。
EnvHarness 在现有环境之上添加了一个可编程组件,通过改变初始状态、交互规则或组合多个任务,动态生成更适合当前智能体的训练环境。
更重要的是,它保留了原有环境的逻辑和验证器,因此您无需再为“这个新生成的任务是否有正确答案?”而烦恼。
配套的 EnvRigger 会观察智能体的成功和失败轨迹,识别具体的弱点,然后自动生成针对性环境,并运行新的测试来验证效果。
实验涵盖五个基准测试:ALFWorld、WebArena、SWE-bench Verified、OfficeQA 和 SpreadsheetBench。在学习了 EnvHarness 生成的环境后,保留任务的性能提升最为显著,达到 9 分,执行步骤减少了 9.8%;用于强化学习时,性能提升最高可达 6.5 分。
本文最有价值的部分在于,它为智能体自进化机制增添了一个新的层次:
智能体可以从环境中学习,而环境也可以根据智能体暴露出的弱点不断演化。
未来,持续演化的系统将同时维持两个循环:智能体不断增强,而训练它的环境也随之演化。
📎 arxiv: