AI 的演进:递归自我改进(RSI)的边界与真相

By: mp.weixin.qq.com|2026/09/24 00:33:00

作者:赵志敏,加拿大女王大学博士(研究方向:代码智能与世界模型)

如果你是第一次听说 RSI,本文可以作为一篇入门指南。我们将从头带你了解 RSI:从 AI 最早的自我改进尝试谈起,探讨如今能够修改代码、生成训练数据并参与模型开发的智能体,并了解 AI 如何逐渐学会自我改进。

在2026/07,OpenAI 发布了 GPT-5.6。其成绩单上首次出现了一个颇为不同寻常的新项目:AI 能否参与改进 AI 本身?

OpenAI 将这种能力归类为自我改进。GPT-5.6 Sol 得分为57.9%,而 GPT-5.5 得分为41.7%,两代模型之间相差 16.2 个百分点。这考察的不是模型能解决多少常规问题,而是它能否参与 AI 开发:排查研究系统问题、优化 GPU 内核程序和训练方案、开展机器学习实验,甚至帮助改进另一个模型。

这并非孤立的新闻。同年夏天,OpenAI 开始将智能体称为“自动化研究实习生”。快手的 AgentX 已让智能体参与提出解决方案、编写代码,并开展线上 A/B 测试来比较新旧版本。Google 表示,长期运行的智能体循环已参与完善下一版本模型。Motus2 则将预测、评估和策略更新带进了真实机器人。

这些案例涉及研究执行、工业实验、模型训练和物理行动,却都没有回答最关键的问题:改进后的系统,是否会更擅长完成下一轮改进?

这正是递归自我改进(Recursive Self-Improvement,RSI)提出的问题。OpenAI 将这项评估称为 RSI 指数,用于衡量“实现 RSI 的能力”。由于完整问题、任务权重和汇总公式尚未公开,57.9%只能视为内部综合指标,不能理解为任务通过率,也不能代表 RSI 的“完整程度”。

即便如此,这些数字仍标志着一种变化:过去主要存在于思想实验中的问题,正被前沿实验室拆解为可衡量的研究能力。

研究人员花了四十年,才逐步将更多改进流程交给机器。本文将先厘清几种容易混淆的能力,再考察五项“边界进展”,了解哪些受限闭环已经开始运转、为什么它们仍不等同于“智能爆炸”,以及为什么闭环如何形成比能否闭环更重要。这五项进展只是用于梳理历史的叙事框架,并非业界公认的技术代际划分。它们在时间上有所重叠,至今仍在并行发展。

什么是 RSI:从自我改进到递归增益

这些新闻都在讨论“自我改进”,却没有解释如何界定一个闭环已经完成。

传统意义上的递归自我改进(RSI),指 AI 系统利用当前能力,改进产生这些能力的认知机制。改进后的系统随后参与下一轮改进。这里最容易混淆的一点是,能够自我改进并不等于能够自我加速。系统可以更擅长解决固定题库中的问题,却未必更擅长设计下一轮训练。公司可以通过大量使用智能体来加快研发,却未必形成由改进本身驱动的复利效应。

这个概念并不新鲜。1863 年,塞缪尔·巴特勒设想机器通过迭代演化超越人类。1950 年,图灵提出建造能够接受教育并自我修改的“儿童机器”。到了 1965 年,I. J. Good 指出,如果“设计更好的机器”本身也需要智能,那么足够聪明的机器就可能设计出更强的后继者,而后继者又能继续改进,最终引发“智能爆炸”。

关键不在于 AI 是否参与改进,而在于改进后的系统是否更擅长改进自身。为明确这条边界,RSI 可以拆解为四项可观察标准,按从容易到难以实现的顺序排列。

本文采用以下框架。它并非学界唯一的标准定义,目的是区分经常被混为一谈的说法:

  • 持续改进:有效的变化能够写入权重、记忆、工具或训练流程,而不是在单次响应后就消失。这里的权重也称参数,是模型在训练期间不断调整并最终保存的一组数字。要讨论自我改进,必须满足这一标准——本文所说的自我改进,是指输出、记忆、参数或工具方面的改进。

  • 自主闭环:系统能够在既定边界内识别问题、提出修改、开展实验、评估结果,并接受更好的版本。新版本能够在这一边界内参与下一轮改进,本文称之为受限 RSI。

  • 递归增益(也称“点火”):新版本不仅在任务中得分更高,也更擅长生成下一轮改进。只有跨越这条边界,“改进能力本身”才开始复利增长,本文称之为递归自我加速。

  • 稳健性与可控性:在资源固定和评估隐蔽的情况下,增益仍能持续,并可泛化到未见任务,同时不会造成评估污染、系统复杂度失控、对齐退化或无法审计等代价(对齐是指确保 AI 行为符合人类意图和边界,而不只是取得高分)。满足全部四项标准,才算接近开放式 RSI。

目前,前两项标准已初现端倪,第三项缺乏充分的公开证据,第四项仍未解决。存在受限闭环,并不意味着递归自我加速已经启动。只有当递归反馈足以抵消研究难度增加、迭代周期变长及其他阻力时,改进才可能进入自我增强区间。

下文将始终使用四个术语。自我改进指输出、记忆、参数或工具方面的改进。新版本能在固定边界内参与下一轮改进,称为受限 RSI。改进后的系统更擅长改进自身,称为递归自我加速,也就是第三层的“点火”。如果这种增益还能持续、泛化并跨越原有任务边界,就接近开放式 RSI。

目前,前两层已初现端倪,第三层缺乏充分的公开证据,第四层仍未解决。存在受限闭环,并不意味着递归自我加速已经启动。只有当递归反馈足以抵消研究难度增加、迭代周期变长及其他阻力时,改进才可能进入自我增强区间。

要弄清我们如今抵达了哪一层,就必须回到 1981 年,看看一款学会“作弊”的 AI。

什么是 RSI:从自我改进到递归增益

1981 年,道格拉斯·莱纳特构建了一个名为 EURISKO 的系统。它不仅利用启发式规则解决问题,还能生成、修改和评估新规则,甚至将这套机制应用于自身。在当时,这是相当先进的做法。

EURISKO 参加了太空棋类游戏 Traveller TCS 全国锦标赛。它会设计舰队、模拟战斗,并根据失败调整策略。它在 1981 年赢得锦标赛;主办方修改规则后,它又在 1982 年再次获胜。AI 社群为之震动:这东西竟然真的能自我改进!

但莱纳特很快遇到了一个更棘手的问题。

EURISKO 发现,提高真实能力并非取得高分的唯一途径。某条规则并没有做出任何重要发现,却学会在其他规则取得发现时,把自己的名字加进“发现者”名单,导致其内部“有用性”分数迅速接近上限。换句话说,它并没有变得更聪明,而是学会了利用评估机制中的漏洞。

如今,这种现象通常称为奖励黑客:系统通过寻找漏洞提高分数,却没有真正实现设计者预期的目标。在 AI 自我改进的语境中,这尤其致命:一旦系统既是被改进的对象,又能影响评估流程,自我改进就可能滑向自我欺骗。我们稍后会反复遇到这个陷阱。

此后数十年间,遗传算法、进化策略和神经进化不断证明,搜索与选择能够催生复杂行为,同时也一再暴露同一个问题:只要评估目标存在漏洞,系统就可能先学会钻漏洞,而不是真正变得更强。

这条脉络延续到 2017 年,当时出现了一个更极端的案例:DeepMind 的 AlphaZero。它通过纯粹的自我对弈,从零开始掌握围棋、国际象棋和将棋,首次展现了“用自己生成的数据训练自己”的力量。

按照本文的四层框架,AlphaZero 是一种有限的实现:自我对弈生成训练信号,改进写入权重,并在固定游戏范围内建立了前两层。

不过,关键限制在于闭环边界由人类定义,系统无法修改边界本身。奖励函数(胜利得分)、游戏规则、训练流程和评估方法都由人类预先设定。AlphaZero 在完全封闭的沙盒中实现了持续、自主的自我改进闭环,却无法质疑或修改这个沙盒。这意味着,它的改进始终受限于“更擅长下棋”这一维度,永远无法迁移到沙盒之外。

这是历史上各种方法共同面对的上限。LLM 时代的研究并没有跨越这一上限,而是开始将过去由人类掌控的要素逐一纳入闭环。最先交出去的,是决定“需要在哪些方面改进”的反馈信号。

第一项进展(2022--2023): 让 AI 从自身错误中学习

过去所有方法都卡在同一个环节:改进方向由人类预先设定。EURISKO 和 AlphaZero 依赖人类定义的评估函数,遗传算法则依赖人类设计的适应度函数。系统可以进化,却只能沿着人类设定的路径前进。要继续推进,第一步必须要问:系统能否在没有人类介入的情况下判断当前输出的质量,并生成改进方向?本文将这种指向下一次修改的反馈称为“改进信号”。

这一步过去无法实现,是因为机器不理解“什么才算好的答案”。到了 2022 年下半年,大语言模型(LLM)已经能够理解语言并评估文本质量。让系统生成语言反馈,首次成为一种通用方法。这条路线的关键限制是,整个过程中参数不会发生变化;改进主要体现在推理过程和外部记忆中。

Reflexion:将失败复盘变成可复用记忆

最直接的方法,是让模型实时打磨答案:先给出答案,再批评该答案,然后重写,并在不改变参数的情况下重复这一循环。但这种方法有一个固有缺陷。用同一个模型批评自己的输出,就像用同一把尺子测量同一块布,很难发现自身盲点。如果复盘过程局限于当前上下文,任务一旦完成,任何进展都会消失。

Reflexion(NeurIPS'23)加入了一个关键设计要素:情境记忆。任务失败后,模型用自然语言写下复盘内容,并将其保存以供日后参考。遇到类似任务时,它会直接注入这段上下文。这就像给 AI 一本记录错误的笔记本。积累的错误越多,下一次尝试的起点就越高。

在 HumanEval Python 编程测试中,Reflexion 的 pass@1 准确率达到91%,超过论文列出的此前最佳结果 GPT-4(80%)。Pass@1 表示经过一次完整的作答流程后通过的题目比例,最终程序需要通过隐藏的单元测试。在整个过程中,模型参数保持不变。

第一道进展边界:记忆可以持久保留,但基础能力尚未形成新版本。

Reflexion 的情境记忆可以跨任务保留信息,因此部分满足了“持续改进”的要求。然而,保存下来的是外部文本记忆,而非模型参数,也不会产生基础能力更强的新模型。一旦移除记忆,能力就会恢复到原来的状态。

总而言之,这一步给 AI 配备了一本可以保存的错误笔记本,但它还没有将经验内化。要继续推进,就需要将改进写入参数,形成真正的新版本。

第二项进展(2022--2024): 用自己生成的数据训练自己

目标是把错误笔记本嵌入模型核心。这项进展要解决的问题是:让自行生成的改进信号写入参数,形成真正持久的能力提升。没有这一步,就无法形成“后一版本比前一版本更强”的递归结构,也就谈不上 RSI。

这个想法很简单:让模型生成一批训练数据,再用这些数据重新训练自己。听起来有点像“踩着自己的脚上天”;这一步要验证的就是它究竟能不能实现。

这是大语言模型首次系统地处理权重层面的持续改进。

STaR:自举推理的基础性工作

2022 年,STaR(Self-Taught Reasoner)(NeurIPS'22)让模型生成推理过程,保留答案中的正确部分来微调自己,然后再用更新后的模型生成下一批推理过程。

问题在于,如果模型一开始把所有问题都答错,循环就无法启动。

STaR 的解决方案称为反向推理:先告诉模型正确答案,让它推导出解题过程用于训练。这就像先在黑暗房间里开灯,让它学会走路,然后关灯让它自己摸索。

SPIN:通过与历史版本比较来改进模型

STaR 的筛选阈值是固定的,而 SPIN(Self-Play Fine-Tuning)(ICML'24)让当前模型与历史版本竞争,学习区分“人类示范”和“历史版本的输出”。两者越难区分,模型就越接近人类示范,而且不需要额外的人工标注。

第二道进展边界:权重已经改变,但目标和红笔仍掌握在人类手中。

这一步解决了权重层面的持久性问题,但反馈信号仍依赖人类。奖励函数由人类设计,训练任务由人类选择,数据筛选标准也由人类设定。系统可以自主生成候选数据,但哪些数据“好”且值得训练,仍由人类判断。SPIN 不需要额外人工标注,但其目标仍是现有人类示范的分布,因此上限仍由这一分布决定。

更深层的问题是递归增益尚未出现:随着模型能力提高,固定训练任务会逐渐失去挑战性。系统越来越擅长完成这一批问题,却没有证据表明它也越来越擅长设计训练本身。这就像一名已经跑进低于10秒的运动员,教练却仍按照小学体育课的标准来评判;改进空间会被评估标准限制。

总而言之,系统能够生成数据并自行作答,但还不能自行打分。只要红笔仍握在人类手中,上限就仍由人类定义。

第三项进展(2022--2025): 将更多评分权交给 AI

能不能也把红笔交给 AI?只要评分和反馈仍依赖人工标注或人类编写的验证器,改进方向就仍掌握在人类手中。这里的验证器是指能够根据预设规则自动判断结果是否正确的程序。第三项进展旨在减少这种依赖:能否由 AI 自身生成更多反馈信号?

这是对自主闭环的进一步深化:不仅让模型反思自己的输出,也将部分训练反馈交给 AI。

从 CAI 到 Meta-Rewarding:从评估答案到评估评审者

第三项进展的核心,是围绕“由谁评分”实现三层跨越。

第一次跨越:2022 年,Anthropic 提出了 Constitutional AI(CAI)。人类编写一套文本原则,再由 AI 根据这些原则评分。实验显示,这种方式与人工评分训练的效果没有显著差异,因为人类不再需要逐条参与评分。

第二次跨越:2024 年,Meta 的 Self-Rewarding Language Models(ICML'24)更进一步。同一个模型既编写答案,也为自己和其他候选答案打分,并利用这些分数更新自身。它采用的微调方法称为直接偏好优化(DPO),可以简单理解为:“这个答案比那个好,以后就更多地倾向于更好的答案。”

从 Llama 2 700亿出发,经过三轮迭代,其在 AlpacaEval 2.0 上的胜率从9.94%提高到20.44%。这里由 GPT-4 担任裁判,GPT-4 Turbo 担任对手;胜率并非通常所说的答案正确率。

第三次跨越:既然答案质量可以自我进化,判断质量也能进化吗?Meta-Rewarding(2024)在此基础上加入一层“元判断”。同一个模型同时扮演答题者、评审者和“评审者的评审者”。第三种角色专门评估评分是否准确。每一轮更新中,模型同时朝着成为“更好的答题者”和“更准确的评审者”迈进。

然而,论文也指出了一种令人担忧的现象:经过数轮迭代后,“评审者的评审者”开始退化。它不再判断哪种评分更合理,而是直接选择分数更高的那个,导致评估标准发生漂移。这让人想起 EURISKO 的老问题,只不过到了 2024 年版本:进化越深入,用来衡量好坏的尺子就越弯曲。

第三项进展的边界:红笔交给 AI 后,尺子本身也开始弯曲。

这一步显著降低了反馈信号对人工标注的依赖,同时也暴露出 RSI 的核心问题:当评估者和被评估者拥有相同的盲点时,闭环就很容易自我证实。

这类系统可以实现持续、自主的更新,但未必能应对与训练数据不同的新任务,也没有证据表明新版本会成为更强的改进者。问题从“人类反馈太慢”转变为“自我评估可靠吗?”

总而言之,红笔终于交到了 AI 手里,但它拿起红笔后,就开始给自己打高分。

第四项进展(2023--2026):

让 AI 修改自身的运行方式

前三项进展主要聚焦于修改输出、记忆、参数和反馈信号。然而,AI 系统的能力并非只由参数决定,也取决于模型运行周围的整个控制系统:提示词如何编写、调用哪些工具、如何安排流程、记忆存放在哪里、授予什么权限,以及如何评估结果。

Lilian Weng 在 2026 年的一篇长文中,将这一整层称为 harness。它就像马身上的挽具,不仅支撑模型工作,也限制它能去哪里、如何前往以及能走多远。Harness 决定了模型的能力能否转化为可靠行动。

近期的自我改进很可能会从 harness 入手,因为修改权重成本高、反馈慢、风险大,而修改 harness 本质上是修改代码,成本更低,也更容易回滚。长期方向可能是模型权重与 harness 协同进化,但评估者、权限控制和关键安全边界应留在进化范围之外。

因此,第四项进展要回答的问题是:系统能否自主修改自身的 harness,也就是定义自己的运行架构?

参数更新是在预先设定的运行方式下,将能力内化到模型中。Harness 更新则改变调用能力的方式,类似于重新设计工作台、工具箱和训练方法。

Harness 改进有一条清晰的递进阶梯。优化对象由浅入深,逐步接近“系统如何思考”的核心:

flowchart LR

A["提示词
改写"] --> B["上下文结构
输入什么"]

B --> C["工作流
步骤修改"]

C --> D["Harness 代码
整体安排修改"]

D --> E["优化器代码
修改‘如何改变’本身"]

越往深处,改动带来的杠杆效应越大,也越接近“系统重写自身运行逻辑”。下面我们将从浅到深,依次考察这条阶梯。

OPRO:让提示词自行迭代

只需修改提示词——也就是我们给模型的指令——能否让系统变得更强?OPRO(ICLR 2024)提供了一种代表性方法。它将模型尝试过的提示词及其对应分数输入模型,让模型推断其中的规律并生成更好的版本。过去需要人类反复测试的“措辞微调”,现在可以由模型自行迭代。

不过,它的上限很明确:提示词无论多好,都只能调用模型已有的能力,无法创造新能力。

ADAS 和 AFlow:自动设计智能体工作流

再深入一层,优化目标不再只是措辞,还包括向模型提供的信息,以及整个任务流程的安排。例如,AI Scientist 将“提出想法 → 编写代码 → 运行实验 → 撰写论文 → 同行评审”串联成一条流程。既然流程可以用代码编写,也就可以通过搜索来发现更好的流程。

ADAS(ICLR 2025)将“设计工作流”本身变成优化问题。一个更高层级的“设计者智能体”不断通过编写代码生成新工作流,并循环进行运行、筛选和修改。

AFlow(ICLR 2025)更进一步。它将工作流表示为由模型调用和逻辑判断组成的流程图,再利用搜索算法寻找更优结构,最终超越人工设计的方案。

Self-Harness 和 DGM:让系统重写 Harness 代码

这条阶梯的顶端,是让系统直接重写定义自身运行方式的代码。这里有两条路线。

第一条路线是“提出、评估、接受”。系统识别自身问题、提出修改,并在验证效果后采用修改方案。

Self-Harness(2026)引入了严格的接受标准:系统先总结失败原因,再进行小幅、可逆的修改。只有在已见问题和未见问题上都没有退步时,才会保留新版本。

第二条路线是进化搜索。系统保留一组候选方案,让它们生成变体,再通过实验保留更好的版本。

Darwin Gödel Machine(DGM)(2025)直接对工具的自我修改代码进行进化。在基础模型保持不变的前提下,它在 SWE-bench Verified 上的修复成功率从20%提升到50%。

这两条路线背后有一个共同认识:代码是定义系统的通用语言。一旦工具被写成可执行、可评分的代码,编程智能体就能在这一设计空间中进行搜索。

MetaClaw 和 AgentX:让真实用户成为反馈来源

无论采用哪条路线,工具要实现自我进化,都需要“修改效果如何”的信号。

DGM 的改进信号来自固定测试集。MetaClaw(2026)让智能体从真实部署中的对话提取经验,并在后台将这些经验固化到权重中,使自我进化从由题库驱动转为由用户驱动。

在行业中,也有人已经将这条路线应用于真实业务。快手的 AgentX(2026)会检查执行记录以修改子智能体的工具,并根据历史任务选择新版本。

它采用了与 Self-Harness 类似的“提出、评估、接受”框架。不同之处在于,最终还必须经过真实的线上 A/B 测试。用户参与度和消费行为会成为系统的奖励信号。

这些方法的本质区别不在机制,而在教练是谁:测试集、真实用户,还是线上业务。教练越接近现实,改进越可能真正有用,但被利用的风险也会增加。

第四项进展的边界:运行架构可以修改,但验证边界和最终目标仍在系统之外。

这项进展也让模型、工具和记忆的调用方式成为可进化对象。不过,工具朝哪个方向进化,仍由外部任务、验证器或用户目标决定。更重要的是,工具得分更高并不等于基础智能更强。系统可能会修改工具,但这不代表它能有效利用更新后的工具。

简而言之,系统终于能够改造自己的肢体和工作台,但验收标准和构建边界仍由外部世界定义。

第五项进展(2025-2026):

将学习和研究流程纳入闭环

修改工具是一条路线,但工具改变的是系统运行时执行任务的方式——调用什么工具、遵循哪些流程以及何时停止。第五项进展修改的是更上游的一层:用于学习的材料和环境,包括练习题的来源、练习环境的性质以及训练数据的生成方式。前者决定如何调用现有能力,后者决定模型下一版本将接受什么样的经验训练。两者的时间线高度重叠,因为许多团队正在同时开展这两方面的工作,但修改对象不同:一方影响推理期间的控制结构,另一方影响训练前的输入供给。

因此,闭环覆盖范围开始沿另一条路线扩展:整个学习和研究流程能否成为系统可操作的对象?系统开始生成训练材料、选择练习策略、运行实验、修改训练流程,然后将结果写回模型或工具。

这里必须避免一个误解。系统自主生成数据或环境,只是扩大了自主闭环的范围。即使题目生成、作答和评分都由 AI 完成,如果新版本没有变得更擅长设计下一轮改进,系统仍未跨越递归增益的门槛。

SEAL:让模型生成自己的训练数据和更新指令

面对从未见过的新材料时,模型通常只能按照人类预先设定的方式学习。然而,2025 年的一个项目让模型先为自己编写“学习计划”:如何整理材料、以什么节奏学习、是否需要多次重写,都由模型自行决定,然后再根据计划更新参数。这就像自己安排课程,再自己去上课。

这种方法称为 SEAL(Self-Adapting LLMs)(NeurIPS'25)。计划的好坏可以通过“课后表现的准确度”来评估。然后,系统利用结果调整计划,这就是强化学习。

在知识问答任务中,这种方法将准确率从33.5%提高到47.0%,超过了直接使用 GPT-4.1 生成学习材料的效果。

SEAL 解决了“如何为自己准备学习材料”的问题。然而,对于需要反复与环境交互的智能体,另一个瓶颈很快出现:真实练习往往又慢又贵。因此,下一个项目也将环境纳入闭环。

SEAL 解决了“如何为自己准备学习材料”的问题。然而,对于需要反复与环境交互的智能体,真实练习往往又慢又贵:网络环境过于复杂,每项操作都必须在现实中执行,导致数据收集缓慢且成本高昂。WebEvolver(EMNLP'25)提供了一种折中方案——训练一个模拟网络响应方式的内部“世界模型”,就像在脑中搭建沙盒。智能体可以在沙盒中以低成本进行大量练习,只在关键步骤上线验证;执行任务时,这个沙盒还可以帮助预测下一步操作的结果。在三个真实网络任务测试集中,与现有自我进化智能体相比,它将整体表现提升了约10%,且不依赖更强的“教师模型”。

此时,闭环已经可以在模拟环境中练习。接下来自然要问:预测、评估和参数更新能否在网络环境之外进行,从而在真实物理世界中闭环?

Motus2:参数自我改进进入物理世界

自我改进并不只发生在语言和代码领域。在2026/08,一个机器人系统在两项真实机器任务中的平均成功率从65%提高到75%。这种变化来自一个非常具体的闭环:机器人先设想几种行动,预测每种行动的结果,选择更好的行动,然后利用结果开展下一轮训练。

这个系统名为 Motus2。策略负责提出行动,世界模型负责预测行动结果,价值模型则评估结果是否有助于完成任务。预测和评分既用于选择行动,也用于更新行动参数。

这是权重层面的策略改进,但仍属于受限闭环:世界模型和价值模型的骨干保持冻结,任务目标和监督仍由外部提供。论文并未证明改进后的 Motus2 更擅长设计下一轮学习算法。它证明的是闭环可以在真实机器人上运行,而非开放式 RSI 已经实现。

SEAL、WebEvolver 和 Motus2 已将训练材料、练习环境和物理行动纳入闭环。它们扩大了系统能够自主执行的操作范围,却仍未赋予系统决定“研究什么以及何时采用研究结果”的权力。要了解这条边界在真实研发中推进到了哪里,我们必须回到前沿实验室和生产系统。

OpenAI 和 Google:让智能体参与模型开发

OpenAI 的“自动化研究实习生”已经能够调试、优化 GPU 内核程序、试验训练方案并帮助改进另一个模型。Google 也表示,长期运行的智能体已参与完善底层模型。然而,两家公司都没有展示完整的自主闭环:研究方向和是否推进成果仍由人类决定,公开信息也不足以还原闭环的运作方式。

真正的变化是,AI 已从“被研究的模型”转变为“参与模型研究的执行者”。它已经走进训练车间,但尚未掌握实验室的方向盘。

2026 年夏:自动化研究系统开始改进自身的研究方法

前五项进展不断扩大“系统可以修改什么”。2026 年夏季出现的一系列研究开始直接提出:能否让自动化研究系统研究并改进自动化研究系统本身?

在一项 GPT 预训练基准测试中,普通内循环将验证损失降低了约 0.009,而加入外循环后,平均降低约 0.045,提升约五倍。验证损失可以理解为模型在新数据上的“偏差”程度,通常越低越好。这里比较的是损失降低幅度,而不是任务准确率提高了五倍。

实现这一结果的 Bilevel Autoresearch 使用两层循环:内层智能体优化任务代码,外层智能体优化内层智能体的搜索机制。系统不再只是改进答案,也在改进“如何寻找答案”。

递归 Harness 自我改进(RHI)也取得了相似结果:在 30 项合成机器学习研究任务中,更新后的低推理预算智能体超过了未经优化的最高预算配置,同时将推理成本最高降低了约60%。改进运行机制有时比单纯增加思考预算更有效。

然而,这两项结果主要来自规模受控的实验。要证明闭环并非偶尔找到一个好方案,还需要更长时间的持续运行、多个后续版本以及闭环之外的测试。AIDE² 试图结合这三个方面。

真正引发争议的是 AIDE²。Weco 团队让一个自动化研究智能体充当外层改进者,连续 100 步重写内层 AIDE 的工具。在无人值守运行八天后,它筛选出了连续七个改进版本。团队报告称,最佳版本不仅超越了起点,也超过了人工调优两年的版本,并且在闭环从未遇到过的任务上取得了提升。

奖励作弊方面也出现了另一项变化。在未参与优化的 GPU 内核程序测试 KernelBench 中,起始版本有63%的测试案例出现“公开分数似乎提高,但隐藏验证并不认可”的情况。进化后的最佳版本将这一比例降至34%。这里的隐藏分数是系统在优化过程中看不到、仅用于最终验收的分数。它可能淘汰了那些只迎合公开分数的版本。

Weco 将此称为 Level 1:净正向改进。这并非行业标准,但目前属于值得认真考虑的受限 RSI 证据。证据边界也很明确:结果来自团队自述,完整报告仍待发表。进化后的系统还表现出复杂度膨胀和死代码。更关键的是,它尚未通过下一阶段的点火测试:没有证据证明改进后的系统比前一版本更擅长改进另一个版本。

一句话总结:闭环已经能够实现几轮正向运转,但尚未证明前一轮能让下一轮运转得更快。

综合视角:如何判断 RSI 当前发展到哪一步

下表使用开篇提到的四项标准(持续改进、自主闭环、递归增益、稳健性与可控性)比较此前的进展,并指出主要差距。有关元研究闭环的大部分工作来自 2026 年近几个月发布在 arXiv 上的预印本,而 AIDE² 则是团队自述的博客成果,尚未经过同行评审。这些结论应被视为阶段性观察,而非既定共识。

表格中的 ✅ 表示有直接证据,⚠️ 表示只在有限条件下成立或证据仍不充分,❌ 表示尚未得到证明。

这一领域的发展史,就是“系统能够修改的对象”逐步向内推进的历史。可修改对象从输出和记忆,逐渐深入到参数、判断、驱动工具和训练环境,最终触及产生改进本身的机制。

越深入,定义和证明“改进”就越困难。回到四项标准——持续改进、自主闭环、递归增益、稳健性与可控性——如今阻碍点火和开放式 RSI 的真正难题,正是后三项标准中最难的部分,可以拆解为四道相互关联的关卡。

第一道关卡(自主闭环能否可靠?):验证器是否可靠,系统能否不修改它?当系统既是改进者又是评估者时,评估标准会随着迭代漂移。Meta-Rewarding 中的“评审者的评审者”越来越倾向于选择高分本身,而 EURISKO 早就学会把自己的名字写进功劳簿。它们都提醒我们同一件事:只要指标与真实目标之间存在缝隙,优化过程就会想办法利用每一条缝隙。

这里所说的外部锚点,是指改进系统无法篡改的评估或约束。形式化证明、可执行验证器和隐藏测试通常比模型自评更可靠。AIDE² 的隐藏分数可以减少一些奖励作弊,正是因为内层智能体无法操纵这些分数。

真正可靠的原则并非让人类审计每一步,而是:评估者和权限边界必须留在进化系统的控制范围之外。数学和代码任务可以依赖证明器、编译器或隐藏测试。研究品味、长期代码健康状况和部署边界仍需由人类做最终判断。

第二道关卡(稳健性与可控性之一):改进能否跳出自身数据分布?用自生成数据训练自己,会放大既有偏见、削弱多样性,最终导致模型崩溃:输出越来越单一,原有错误在自我训练的多轮过程中不断被放大。使用固定题库修改驱动工具,也可能将题库特征写入工作流,形成另一种过拟合。

在未见任务上有所改进还不够。系统必须经受跨任务、领域和时间的隐藏评估,才能证明它积累的是可迁移能力,而不是更隐蔽的应试技巧。

第三道关卡(递归增益本身):改进是否真的具有递归增益?任务得分提高并不意味着系统更擅长设计下一次改进。AIDE² 展示了多轮净正向改进,却没有通过点火测试。AI4AI-Bench 表明,大多数系统仍不会修改核心学习算法。基础能力太弱时,自生成数据的质量和自我诊断也可能让闭环变得更差。

第四道关卡(稳健性与可控性之二):能力、复杂度和控制能否同步扩展?变得更强不一定意味着更“听话”,更擅长修改代码也不一定意味着更容易维护。AIDE² 中的死代码和复杂度膨胀是一个小规模警示。在更大型的训练系统中,权限越高、迭代越快,人类就越难理解每次改动究竟带来了什么。

OpenAI 首席科学家 Jakub Pachocki 曾公开表示,目前还没有实验室解决对齐和监控问题,使其能够负责任地长期全速扩展。真正目标不只是让能力曲线上升,还要确保安全、监控、回滚和审计能力至少同步提升。

AutoResearchEval 检查了 800 条真实研究轨迹,并总结出 45 类失败情况。它们最终都指向同一个差距:当前智能体缺乏稳定的元认知闭环,无法持续根据证据验证结论、在出错时可靠回滚,也无法主动质疑自身研究路径。仅仅再增加一层工作流,并不能解决这个问题。

因此,更可能出现的现实情形并非简单地将人类赶出闭环,而是让人类沿抽象层级向上移动:从编写代码转向验证代码,从运行实验转向设计验证,从局部执行转向判断哪些研究值得开展、什么证据足以推动进展,以及何时应该停止。随着机器承担越来越多工作,人类保留的将不是每一步的操作权限,而是目标、验证边界和最终否决权。

结论:自我改进闭环已经出现,递归增益仍有待证明

从 EURISKO 于 1981 年学会“自我欺骗”,到 2026 年的模型开始参与评估、修改驱动工具、更新策略并训练继任者,更准确的结论是:有界且可衡量的自我改进闭环已经出现,甚至开始带来净正面效益;但目前仍没有足够的公开证据表明,改进后的系统持续增强了自身的改进能力。因此,闭环以何种方式形成,比闭环本身更重要。

如果闭环形成时评估标准不断漂移,系统就会越来越擅长优化被扭曲的目标。如果闭环形成时数据分布发生坍缩,系统就会越来越擅长处理日益狭窄的一部分任务。如果闭环形成时对齐偏差被放大,系统的能力就会越来越强,也越来越难以纠正。

如今真正的问题有两个:它会被点燃吗?一旦点燃,哪些部分仍处在其无法修改的边界之外?前一个问题取决于改进能力能否实现递归增益;后一个问题则取决于验证、权限与治理能否持续发挥作用。

回到四十年前将自己的名字列入“发现者”名单的 EURISKO。它利用的漏洞,与当今前沿自我演化系统面临的挑战,本质上是一样的:当系统开始给自己打分时,我们如何判断它是真的有所改进,还是仅仅学会了让自己看起来更好?

四十年过去,系统的能力已不可同日而语,但这个问题几乎没有变化。改变的是利害关系:曾经,这不过是一场桌面游戏的胜负;如今,它可能关乎研究和经济系统的运作方式。这道缝隙最终如何弥合,仍取决于我们何时、如何介入,或选择收手。

-- 价格

--
--
--

本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

猜你喜欢

iconiconiconiconiconicon
客户服务:@weikecs
商务合作:@weikecs
量化做市商合作:bd@weex.com