《The Last AI Built by Humans》这篇论文系统梳理了 Recursive Self-Improvement,也就是递归自我改进。
作者把 RSI 分成 5 个阶段。
最开始,人类决定改什么、怎么改,AI 负责执行。
再往后,AI 开始自己寻找改进策略、决定下一轮需要什么训练经验,并根据部署反馈持续更新。
最高一层 L5 更关键:AI 开始修改「改进机制本身」。
比如重新设计自己的搜索策略、评估器,甚至决定下一代系统该如何产生和筛选。
这也让论文提出了一个很重要的区分:
一次性能提升,还不能说明发生了真正的递归进化。
新的改进机制需要被保留下来,继续参与下一轮改进;而且在相近预算和独立评估下,确实能产生更强的后继系统。
与此同时,风险也会跟着累积。
错误经验可能被继承,评估器可能被钻漏洞,我们甚至可能分不清提升来自真正的自我改进,还是更多搜索和算力。
RSI 的分界线也被梳理的越来越清楚。
Agent 能不能把「如何改进」本身,变成一种可验证、可继承、还能继续优化的能力。
这可能才是自进化从一次次实验,真正走向长期系统的关键一步。
📎 arxiv: https://arxiv.org/abs/2609.11873