一个被讨论多年的词,终于落地
RSI(Recursive Self-Improvement,递归自我改进)——AI改进AI、AI训练下一代AI——这个在AI安全论文里被讨论了近十年的概念,在2026年第一次有了工程层面的确凿证据。
信号来自OpenAI旗舰产品GPT-6 Astra:它是OpenAI首款由前代模型深度参与监督训练的旗舰产品。这不是某一个环节用了一下AI,而是"上一代模型深度参与了下一代怎么被训练"。
数据来源:OpenAI研究训练副总裁Aidan Clark公开确认;DeepMind姚顺宇评论
谁在训练谁?链条开始闭环
理解RSI,关键看训练链条的闭环:
- 过去:人写数据、人定规则、人训模型,模型只是被训练的对象;
- 现在:前代模型参与生成训练数据、参与打分(奖励建模)、参与对齐与监督。
当"训练者"本身包含了一个AI,链条就出现了递归:模型产出用于训练下一代模型的数据和判断,下一代更强的模型又参与再下一代的训练。每一轮迭代,AI在生产AI中的占比都在上升。
OpenAI研究训练副总裁Aidan Clark亲自确认这一点,本身就很说明问题——这是公司愿意公开承认的战略方向。
“一小步"与"巨大飞跃”
DeepMind的姚顺宇给出了一个流传甚广的评价:“对模型是一小步,对RSI是一次巨大飞跃。”
这句话精确地划出了两层:
- 对模型而言,Astra只是又一次性能提升,普通用户几乎感受不到范式变化;
- 对RSI而言,一旦训练流程里AI的参与从"辅助"变成"深度嵌入",递归迭代的飞轮就转起来了——它可能自我加速,也可能引入我们难以察觉的偏差。
另一组证据来自Anthropic:其报告显示代码库中约80%由Claude自己编写。当模型不仅参与训练,还在写维护自己的代码、工具、流水线,“AI为AI工作"的闭环就更完整了。
为什么RSI值得严肃对待
递归自我改进之所以让安全与产业两边都高度紧张,是因为它改变了进步的动力学:
- 迭代速度可能非线性:如果AI训出来的AI更强,更强的AI又能训出更强的下一代,进步曲线可能脱离人类工时的约束;
- 反馈偏差可能累积:模型的偏好由模型打分,如果它倾向于"自己喜欢的答案”,这种偏好会一代代被放大;
- 可追溯性下降:当大量训练决策由AI做出,人类将越来越难说清"这个能力到底从何而来"。
行业影响
guijiagi.com认为,RSI从论文走进旗舰产品,是2026年最具长期影响的事件之一。它标志着AI发展的"发动机"开始部分自动化——人类从"亲自造车"变成"设计并监视那条造车流水线"。
但递归本身是中性的:它既能带来能力的指数级跃升,也能悄悄累积偏差与风险。真正的课题,是在飞轮转起来之后,人类是否还保有对方向、数据与评价标准的最终控制权。AI训练AI的时代已经到来,问题不再是它会不会发生,而是我们能不能让它沿着可验证、可纠偏的轨道运行。