用 AI 干过长活的都懂那种崩溃:前两小时像模像样,越往后越离谱,最后甩一句“已完成”,点开一看一半是空的。它不是不努力,是干着干着忘了自己一开始要干嘛。
LongHorizon-Harness 的解法像个靠谱小团队:
1⃣ 一个人管进度,只负责想下一步做什么
2⃣ 一个人闷头干,每次都清清爽爽重新上工
3⃣ 一个人专门验收,不听汇报,直接翻文件、看日志、跑测试,对得上才算数,对不上记下来重做
同一套模型和工具,套上这层壳,跨软件折腾一两个小时的任务,完成率从五成提到八成;命令行和写代码的活儿也稳了一截,token 还少烧 24%。干得多花得少,这个真少见。
它不挑活也不挑工具:浏览器、表格、文档、设计软件、3D 软件都能上手;Claude、GPT、Qwen 都能接,Claude Code、Codex CLI、OpenCode 这些现成的直接用。管进度的、干活的、验收的还能各用各的模型。
GitHub:https://github.com/AMAP-ML/LongHorizon-Harness