高德刚开源了个狠货,能让 Claude Code、Codex 接了活之后一连干几十个小时不跑偏。论文挂 arXiv 上,还登过 Hugging Face 每周论文榜第一。

高德刚开源了个狠货,能让 Claude Code、Codex 接了活之后一连干几十个小时不跑偏。论文挂 arXiv 上,还登过 Hugging Face 每周论文榜第一。

用 AI 干过长活的都懂那种崩溃:前两小时像模像样,越往后越离谱,最后甩一句“已完成”,点开一看一半是空的。它不是不努力,是干着干着忘了自己一开始要干嘛。

LongHorizon-Harness 的解法像个靠谱小团队:

1⃣ 一个人管进度,只负责想下一步做什么
2⃣ 一个人闷头干,每次都清清爽爽重新上工
3⃣ 一个人专门验收,不听汇报,直接翻文件、看日志、跑测试,对得上才算数,对不上记下来重做

同一套模型和工具,套上这层壳,跨软件折腾一两个小时的任务,完成率从五成提到八成;命令行和写代码的活儿也稳了一截,token 还少烧 24%。干得多花得少,这个真少见。

它不挑活也不挑工具:浏览器、表格、文档、设计软件、3D 软件都能上手;Claude、GPT、Qwen 都能接,Claude Code、Codex CLI、OpenCode 这些现成的直接用。管进度的、干活的、验收的还能各用各的模型。

GitHub:https://github.com/AMAP-ML/LongHorizon-Harness



分类