它最核心的东西叫 Orchard Env:基于Kubernetes,可以批量拉起隔离容器,让Agent自己执行命令、读写文件、提交Git补丁,完整跑一遍真实任务。
更重要的是,这套环境不是只服务代码Agent。
软件工程、浏览器操作、个人助理等不同场景,都能用同一套底座做训练和评估,环境不用每个项目重新造一遍。
微软还把SFT和RL的训练方案一起放出来了,对应SWE、GUI、Claw等不同Agent任务。
其中Orchard-SWE在SWE-bench Verified上给出了73.0%的成绩,而且使用的是约30亿活跃参数的小模型,这点挺有意思。
再加上10万+轨迹数据和配套论文,基本把环境、数据、训练方法、评估这一整套都摆上桌了。
以前大家都在卷“怎么把模型训聪明”,Orchard更像是在解决另一件事:
先把一个足够真实、还能反复复用的Agent世界造出来。
🔗 GitHub:http://github.com/microsoft/Orchard
🔗 论文:http://arxiv.org/abs/2605.15040