查看: 7|回复: 0

微软研究院最近开源了 Orchard,定位就是给Agent研究提供一套可复用的建模和实验底座。

[复制链接]

20

主题

0

回帖

60

积分

注册会员

积分
60
发表于 昨天 22:09 | 显示全部楼层 |阅读模式
微软研究院最近开源了 Orchard,定位就是给Agent研究提供一套可复用的建模和实验底座。

它最核心的东西叫 Orchard Env:基于Kubernetes,可以批量拉起隔离容器,让Agent自己执行命令、读写文件、提交Git补丁,完整跑一遍真实任务。

更重要的是,这套环境不是只服务代码Agent。

软件工程、浏览器操作、个人助理等不同场景,都能用同一套底座做训练和评估,环境不用每个项目重新造一遍。

微软还把SFT和RL的训练方案一起放出来了,对应SWE、GUI、Claw等不同Agent任务。

其中Orchard-SWE在SWE-bench Verified上给出了73.0%的成绩,而且使用的是约30亿活跃参数的小模型,这点挺有意思。

再加上10万+轨迹数据和配套论文,基本把环境、数据、训练方法、评估这一整套都摆上桌了。

以前大家都在卷“怎么把模型训聪明”,Orchard更像是在解决另一件事:

先把一个足够真实、还能反复复用的Agent世界造出来。
🔗 GitHub:http://github.com/microsoft/Orchard
🔗 论文:http://arxiv.org/abs/2605.15040


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部