NUS 团队这篇 SkillGLoW 研究的就是 Skill 应该怎么长期组织。
现在常见的做法有两种。
把所有经验不断压进一个文档,最后很容易只剩下一些泛化原则;每个任务单独存一条 Skill,又会让技能库越来越大,而且很多经验只能适用于当时那个具体任务。
SkillGLoW 在两者之间加了一层「程序族」。
它会把大量执行经验按照「怎么解决」来聚类,把相似任务共享的解题流程压缩成一个 Global Skill。至于具体参数、环境状态这些细节,则在每次新任务里重新生成 Local Skill。
这样长期保存的是可迁移的流程,任务细节用完就不再塞进技能库。
每次新的 Global Skill 也要经过真实执行验证,确认不会让现有能力退化之后才会写入。
实验覆盖数学推理、终端操作、软件修复和具身控制。相比没有 Skill,Global Skill 平均提升 17.2 个百分点,同时技能库比逐任务保存缩小了 3.6 倍。
在未见过的 ALFWorld 任务上,成功率也从 73.9% 提升到 83.9%。
这篇让我想到,Agent Skill 的核心可能会从「存多少经验」转向「经验应该抽象到哪一层」。
太具体,很难迁移。
太抽象,又很难真正指导行动。
找到那个可以跨任务复用的「解题流程」,可能才是长期自进化 Agent 真正需要沉淀的东西。
📎 arxiv: https://arxiv.org/abs/2609.02217