改一下 → 跑测试 → 看结果 → 再下指令。
Autoresearch 玩的是另一套:你只负责定目标和评价标准,剩下的让 AI 自己迭代。
它会不断修改方案、运行验证,效果变好就保留,变差就回退,然后继续下一轮。
思路来自 Karpathy 的 autoresearch,目前可以配合 Claude Code、OpenCode 使用。
而且这套机制不一定只适合代码,凡是能量化结果、能自动验证的任务,都可以拿来尝试。
🔗 http://github.com/uditgoenka/autoresearch