微软SkillOpt:让AI Agent在“睡觉”时完成自我进化

【微软SkillOpt:让AI Agent在“睡觉”时完成自我进化】微软推出的SkillOpt框架将LLM代理的自然语言指令视为可优化的“权重”,通过引入深度学习中的Epoch、批大小和验证门控等概念,对一份名为best_skill.md的技能文档进行迭代演进(repo:microsoft/SkillOpt)。核心功能SkillOpt-Sleep支持代理在离线状态下回顾历史轨迹,通过自我反思和模拟演练来合并验证过的技能。实验显示,这套机制在不改变模型权重的前提下,让GPT-5.5在编程等任务上的表现提升了20个百分点以上,且生成的技能文档在不同规模的模型间具备通用性。这标志着提示词工程正从“凭感觉调优”转向“系统化训练”。与其耗费巨资去微调动辄千亿参数的大模型,不如给它一套能自我迭代的“操作手册”。SkillOpt证明了在Token成本和推理延迟不变的情况下,通过精细化管理代理的认知经验,依然能榨取巨大的性能红利。它为开发者提供了一种务实的路径:让AI在实战中复盘,在“睡眠”中进化,最终沉淀出比人类手写更高效的指令集。


分类