微软研究院最近开源了 Orchard,定位就是给Agent研究提供一套可复用的建模和实验底座。

微软研究院最近开源了 Orchard,定位就是给Agent研究提供一套可复用的建模和实验底座。

它最核心的东西叫 Orchard Env:基于Kubernetes,可以批量拉起隔离容器,让Agent自己执行命令、读写文件、提交Git补丁,完整跑一遍真实任务。

更重要的是,这套环境不是只服务代码Agent。

软件工程、浏览器操作、个人助理等不同场景,都能用同一套底座做训练和评估,环境不用每个项目重新造一遍。

微软还把SFT和RL的训练方案一起放出来了,对应SWE、GUI、Claw等不同Agent任务。

其中Orchard-SWE在SWE-bench Verified上给出了73.0%的成绩,而且使用的是约30亿活跃参数的小模型,这点挺有意思。

再加上10万+轨迹数据和配套论文,基本把环境、数据、训练方法、评估这一整套都摆上桌了。

以前大家都在卷“怎么把模型训聪明”,Orchard更像是在解决另一件事:

先把一个足够真实、还能反复复用的Agent世界造出来。
🔗 GitHub:http://github.com/microsoft/Orchard
🔗 论文:http://arxiv.org/abs/2605.15040


分类