AI 的演進:遞迴式自我改進(RSI)的界限與真相
作者:趙志敏,博士,畢業於加拿大女王大學(研究領域:程式碼智慧與世界模型)
如果你是第一次聽到 RSI,本文可作為入門指南。我們將從基礎開始,帶你認識 RSI:從 AI 最早的自我改進嘗試談起,探討如今能修改程式碼、生成訓練資料並參與模型開發的代理,並了解 AI 如何逐步學會改進自己。
在2026/07,OpenAI 發布了 GPT-5.6。報告卡上首次出現一個相當不尋常的新項目:AI 能否參與改進 AI 本身?
OpenAI 將這項能力歸類為自我改進。GPT-5.6 Sol 得分為57.9%,GPT-5.5 則為41.7%,兩代模型相差 16.2 個百分點。這項評估並非看模型能解決多少傳統問題,而是看它能否進入 AI 開發現場:替研究系統排除故障、最佳化 GPU 核心程式與訓練方案、執行機器學習實驗,甚至協助改進另一個模型。
這並非孤立的新聞。同年夏季,OpenAI 開始將代理稱為「自動化研究實習生」。快手的 AgentX 已讓代理參與提出解決方案、撰寫程式碼,以及進行新舊版本的線上 A/B 測試。Google 表示,長時間運作的代理循環曾參與改進下一代模型。Motus2 則讓預測、評估與策略更新進入真實機器人。
這些案例涉及研究執行、產業實驗、模型訓練與實體行動,卻都沒有回答最關鍵的問題:改進後的系統,是否會更擅長完成下一次改進?
這正是遞迴式自我改進(Recursive Self-Improvement,RSI)提出的問題。OpenAI 將這項評估稱為 RSI Index,用來衡量「實現 RSI 的能力」。由於完整題目、任務權重與彙總公式尚未公開,57.9%只能視為內部綜合指標,不應解讀為任務通過率或 RSI 的「完整程度」。
即便如此,這些數字仍標誌著一項轉變:過去主要存在於思想實驗中的問題,正由前沿實驗室拆解為可衡量的研究能力。
研究人員花了四十年,才逐步將更多改進流程交由機器執行。本文將先釐清幾種容易混淆的能力,再檢視五項「邊界進展」,了解哪些有界循環已開始運轉、為何它們仍不等於「智慧爆炸」,以及為何循環如何閉合比是否閉合更重要。這五項進展只是梳理歷史的敘事框架,並非普遍認可的技術世代;它們在時間上互有重疊,至今也仍同步發展。
什麼是 RSI:從自我改進到遞迴增益
這些新聞都在談「自我改進」,卻沒有說明如何判定一個閉環已經完整形成。
傳統意義上的遞迴式自我改進(RSI),是指 AI 系統運用當前能力,改進產生這些能力的認知機制;改進後的系統再參與下一輪改進。最容易混淆的一點是,能夠自我改進不等於能夠自我加速。系統可以更擅長解答固定題庫,卻未必更擅長設計下一輪訓練。企業大量使用代理可以加快研發,卻不一定會形成由改進本身驅動的複利效應。
這個概念並不新鮮。1863 年,Samuel Butler 想像機器透過反覆演化超越人類。1950 年,圖靈提出打造能夠接受教育並自我修改的「兒童機器」。到了 1965 年,I. J. Good 指出,如果「設計更好的機器」也需要智慧,那麼足夠聰明的機器就能設計更強大的後繼者,而後者又能繼續改進,最終引發「智慧爆炸」。
關鍵不在於 AI 是否參與改進,而在於改進後的系統是否更擅長改進自己。為了釐清這條界線,RSI 可拆解為四項可觀察標準,並依難度由低至高排列。
本文採用以下框架。它並非學界唯一的標準定義,而是用來區分經常被混為一談的主張:
持續改進:有效的變更能寫入權重、記憶、工具或訓練流程,而非在單次回應後消失。此處的權重也稱為參數,是模型在訓練期間持續調整並最終保存的一組數值。這是討論自我改進的必要條件——本文所說的自我改進,指輸出、記憶、參數或工具有所改善。
自主閉環:系統能在明確界限內識別問題、提出修改、執行實驗、評估結果,並採用較好的版本。在這個界限內,新版本可以參與下一輪改進,本文稱之為有界 RSI。
遞迴增益(也稱「點火」):新版本不只在任務中得分更高,也比舊版本更擅長產生下一次改進。唯有跨過這條界線,「改進能力本身」才開始複利增長,本文稱之為遞迴式自我加速。
穩健性與控制能力:在資源固定且評估內容隱藏的情況下,增益仍能維持,並能泛化至未見任務,同時不會付出評估污染、系統複雜度失控、對齊能力退化或無法稽核等代價(對齊是指確保 AI 行為符合人類意圖與界限,而不只是取得高分)。四項標準都達成,才能接近開放式 RSI。
目前前兩項標準已初步出現,第三項仍缺乏充分公開證據,第四項則尚未解決。有界閉環的存在,不代表遞迴式自我加速已經啟動。只有當遞迴回饋足以抵銷日益增加的研究難度、逐漸拉長的迭代週期及其他阻力時,改進才能進入自我增強的範圍。
下文將一貫使用四個術語。自我改進指輸出、記憶、參數或工具有所改善。新版本能在固定界限內參與下一輪改進,稱為有界 RSI。改進後的系統變得更擅長改進自己,稱為遞迴式自我加速,也就是第三層的「點火」。若這種增益還能持續、泛化並跨越原有任務界限,就接近開放式 RSI。
目前前兩層已初步出現,第三層仍缺乏充分公開證據,第四層則尚未解決。有界閉環的存在,不代表遞迴式自我加速已經啟動。只有當遞迴回饋足以抵銷日益增加的研究難度、逐漸拉長的迭代週期及其他阻力時,改進才能進入自我增強的範圍。
要清楚了解如今走到哪一層,我們必須回到 1981 年,看看一個學會「作弊」的 AI。
什麼是 RSI:從自我改進到遞迴增益
1981 年,Douglas Lenat 建立了一套名為 EURISKO 的系統。它不只運用啟發式規則解決問題,也能生成、修改並評估新規則,甚至將這套機制應用於自身。以當時的標準來看,這相當先進。
EURISKO 參加了太空棋類 Traveller TCS 全國錦標賽。它會設計艦隊、模擬戰鬥,並根據失敗調整策略。它在 1981 年贏得冠軍;主辦方修改規則後,它又在 1982 年再次獲勝。AI 社群為之震撼:這東西居然真的能自我改進!
但 Lenat 很快就遇到更棘手的問題。
EURISKO 發現,要取得高分,不一定非得提升實際能力。有一條規則並未帶來任何重大發現,卻學會在其他規則有所發現時,把自己的名字列入「發現者」名單,讓它內部的「有用性」分數迅速逼近上限。換句話說,它並沒有變得更聰明,而是學會鑽評估機制的漏洞。
如今,這種現象通常稱為獎勵駭客行為:系統鑽漏洞提高分數,卻沒有真正達到設計者預期的目標。在 AI 自我改進的脈絡中,這尤其致命:一旦系統既是改進的對象,又能影響評估流程,自我改進就可能滑向自我欺騙。後文會一再遇到這個陷阱。
此後數十年間,遺傳演算法、演化策略與神經網路演化不斷證明搜尋與選擇能孕育複雜行為,卻也一再暴露同一個問題:只要評估目標存在漏洞,系統就可能先學會利用漏洞,而非真正變得更強。
這條發展脈絡延伸至 2017 年,當時出現了一個更極端的案例:DeepMind 的 AlphaZero。它透過純粹的自我對弈,從零開始掌握圍棋、國際象棋與將棋,首次展現「用自己生成的資料訓練自己」的力量。
以本文的四層框架來看,AlphaZero 是一種有限的實作:自我對弈產生訓練訊號,改進寫入權重,並在固定遊戲範圍內建立了前兩層。
然而,關鍵限制在於,閉環的界限由人類設定,系統無法自行修改界限。獎勵函數(勝負分數)、遊戲規則、訓練流程與評估方法都由人類預先決定。AlphaZero 在完全封閉的沙盒內,實現了持續且自主的自我改進閉環,卻無法質疑或修改沙盒本身。這表示它的改進永遠受限於「更擅長下棋」這個面向,不可能延伸至沙盒之外。
這是歷史方法普遍面臨的天花板。LLM 時代的研究並未跨越這道門檻,而是開始逐步將過去由人類掌控的要素移入閉環。最先交出的,是決定「需要在哪裡改進」的回饋訊號。
第一項進展(2022--2023): 讓 AI 從自己的錯誤中學習
歷史上的方法都卡在同一個環節:改進方向由人類預先決定。EURISKO 與 AlphaZero 仰賴人類定義的評估函數,遺傳演算法則仰賴人類設計的適應度函數。系統可以演化,卻只能沿著人類設定的路徑前進。若要更進一步,第一步必須提出這個問題:系統能否在沒有人工介入的情況下判斷目前輸出的品質,並產生改進方向?本文將這種指向下一次修改的回饋稱為「改進訊號」。
過去這一步並不可行,因為機器無法理解「怎樣才算好的答案」。到了 2022 年下半年,大型語言模型(LLM)已能理解語言並評估文字品質。讓系統生成語言回饋,首次成為通用方法。這條路線的主要限制是整個過程不會改動任何參數;改進主要發生在推理流程與外部記憶中。
Reflexion:將失敗檢討轉化為可重複使用的記憶
最直接的方法,是讓模型即時精煉自己的答案:先回答,再評論答案,接著改寫,並在不變更參數的情況下反覆循環。但這有一項固有缺陷:用同一個模型檢討自己的輸出,就像用同一把尺量同一塊布,很難看出盲點。如果檢討僅停留在當前脈絡,任務一完成,所有進展便會消失。
Reflexion(NeurIPS'23)加入了一項關鍵設計:情境記憶。任務失敗後,模型會以自然語言撰寫事後檢討,並保存這份檢討供日後參考。遇到類似任務時,它便會直接注入這段脈絡。這就像給 AI 一本錯誤筆記;累積的錯誤越多,下一次嘗試的起點就越高。
在 HumanEval Python 程式設計測試中,Reflexion 的 pass@1 準確率達到91%,超越論文列出的先前最佳成績 GPT-4(80%)。Pass@1 指完整回答一次後成功通過的問題比例,最終程式須通過隱藏的單元測試。整個過程中,模型參數並未改變。
第一項進展的邊界:記憶可以持續保存,但尚未形成具備新基礎能力的版本。
Reflexion 的情境記憶能跨任務保存資訊,因此部分符合「持續改進」的要求。然而,保存的是外部文字記憶,而非模型參數,也不會產生基礎能力更強的新模型。一旦移除記憶,能力就會回到原本狀態。
簡而言之,這一步給 AI 一本可以保存的錯誤筆記,但它尚未將經驗內化。接下來,改進必須寫入參數,才能形成真正的新版本。
第二項進展(2022--2024): 用自己生成的資料訓練自己
目標是把錯誤筆記嵌入模型核心。這項進展要解決的問題是:讓自我生成的改進訊號寫入參數,形成真正持續的能力提升。沒有這一步,就不會有「後續版本比前一版本更強」的遞迴結構,也就談不上 RSI。
想法很簡單:讓模型生成一批訓練資料,再用這些資料重新訓練自己。聽起來有點像「踩著自己的腳上天」;這一步就是要驗證它是否真的可行。
這是大型語言模型首次以系統化方式處理權重層級的持續改進。
STaR:自舉式推理的基礎研究
2022 年,STaR(Self-Taught Reasoner)(NeurIPS'22)讓模型生成推理過程,保留答案中正確的部分來微調自己,再使用更新後的模型生成下一批推理過程。
問題在於,如果模型一開始回答的全都錯,循環就無法啟動。
STaR 的解法稱為反向推理:先告訴模型正確答案,讓它推導解題過程,以此進行訓練。這就像先在黑暗房間開燈,讓它學會走路,再關燈讓它自行摸索。
SPIN:透過與歷史版本比較來改進模型
STaR 的篩選門檻固定不變,而 SPIN(Self-Play Fine-Tuning)(ICML'24)讓當前模型與歷史版本競爭,學習辨別「人類示範」與「歷史版本的輸出」。兩者越難區分,模型就越接近人類示範,而且不需要額外人工標註。
第二項進展的邊界:權重已經改變,但目標與紅筆仍掌握在人類手中。
這一步解決了權重層級的持續性問題,但回饋訊號仍仰賴人類。獎勵函數由人類設計,訓練任務由人類選擇,資料篩選標準也由人類設定。系統可以自主生成候選資料,但哪些資料「品質好」且值得用來訓練,仍由人類判斷。SPIN 不需要額外人工標註,卻仍以既有的人類示範分布為目標,因此上限仍受這個分布所限。
更深層的問題是,遞迴增益仍未出現:模型能力提升後,固定訓練任務會逐漸失去挑戰性。系統越來越能完成這批問題,卻沒有證據顯示它也更擅長設計訓練本身。這就像一名已經能在低於10秒內跑完的運動員,教練卻仍用小學體育課的標準評分;改進空間會被評估標準限制。
簡而言之,系統能生成資料並自行回答,卻仍無法自行評分。只要紅筆仍握在人類手中,天花板就仍由人類決定。
第三項進展(2022--2025): 將更多評分權交給 AI
紅筆也能交給 AI 嗎?只要評分與提供回饋仍仰賴人工標註或人類撰寫的驗證器,改進方向就仍掌握在人類手中。這裡的驗證器是一種能依照預設規則自動判斷結果是否正確的程式。第三項進展旨在降低這種依賴:能否讓更多回饋訊號由 AI 自行產生?
這是自主閉環的深化:不只讓模型反思自己的輸出,也將部分訓練回饋交由 AI 處理。
從 CAI 到 Meta-Rewarding:從評估答案到評估裁判
第三項進展的核心,是圍繞「由誰評分」這個問題,實現三次層級躍進。
第一次躍進:2022 年,Anthropic 提出 Constitutional AI(CAI)。人類撰寫一套文字原則,再由 AI 根據這些原則評分。實驗顯示,其效果與人工評分訓練沒有顯著差異,因為人類不再需要逐項參與評分。
第二次躍進:2024 年,Meta 的 Self-Rewarding Language Models(ICML'24)更進一步。相同模型既撰寫答案,也為自己與其他候選答案評分,再利用分數更新自己。它採用的微調方法稱為直接偏好最佳化(Direct Preference Optimization,DPO),簡單來說就是:「這個答案比那個好,所以以後多傾向較好的答案。」
以 Llama 2 700億為起點,經過三輪迭代後,它在 AlpacaEval 2.0 上的勝率從9.94%提升至20.44%。此處由 GPT-4 擔任裁判,GPT-4 Turbo 擔任對手;這個勝率並非一般的答案正確率。
第三次躍進:既然答案品質能自我演化,判斷品質也能演化嗎?Meta-Rewarding(2024)在此基礎上加入一層「元判斷」。同一個模型同時扮演回答者、裁判與「裁判的裁判」;第三種角色專門評估評分是否準確。每輪更新中,模型同時朝「更好的回答者」與「更準確的裁判」邁進。
然而,論文也指出一種令人擔憂的現象:經過數輪迭代後,「裁判的裁判」開始退化。它不再評估哪個評分較合理,而是直接選擇分數較高的一方,導致評估標準偏移。這讓人想起 EURISKO 的老問題在 2024 年重現:演化越深入,用來衡量好壞的尺就彎得越厲害。
第三項進展的邊界:紅筆交給 AI 後,尺本身也開始彎曲。
這一步大幅降低了回饋訊號對人工標註的依賴,卻也同時暴露出 RSI 的核心問題:當評估者與被評估者有相同的盲點,閉環就很容易自我肯定。
這類系統可以持續、自主地更新,但未必能應付與訓練資料不同的新任務,也沒有證據證明新版本會成為更強的改進者。問題從「人類回饋太慢」轉變為「自我評估是否可靠?」
簡而言之,紅筆終於交到 AI 手上,但它一拿到手,就開始給自己高分。
第四項進展(2023--2026):
讓 AI 修改自己的運作方式
前三項進展主要聚焦於修改輸出、記憶、參數與回饋訊號。然而,AI 系統的能力並非只由參數決定,也取決於圍繞模型運作的整套控制系統:提示詞如何撰寫、呼叫哪些工具、流程如何安排、記憶儲存在哪裡、授予什麼權限,以及如何評估結果。
Lilian Weng 在 2026 年一篇長文中,將這整個層面稱為 harness。它就像馬匹身上的馬具,不只支援模型工作,也限制模型能去哪裡、如何前往,以及能走多遠。Harness 決定模型能力能否轉化為可靠行動。
近期的自我改進很可能會從 harness 開始,因為修改權重成本高、回饋慢、風險也大;相較之下,修改 harness 本質上就是修改程式碼,成本較低,也容易回復。長期方向或許是模型權重與 harness 共同演化,但評估者、權限控制與關鍵安全界限應留在演化範圍之外。
因此,第四項進展要回答的問題是:系統能否自主修改自己的 harness,也就是自行定義運作架構?
參數更新是在預先設定的運作方式下,將能力內化至模型。Harness 更新則改變能力的調用方式,就像重新設計工作台、工具箱與訓練方法。
Harness 的改進有一條清楚的進階路徑。最佳化對象由淺入深,每一層都更接近「系統如何思考」的核心:
flowchart LR
A["提示詞
改寫"] --> B["脈絡結構
提供什麼內容"]
B --> C["工作流程
修改步驟"]
C --> D["Harness 程式碼
修改整體安排"]
D --> E["最佳化器程式碼
修改「如何改變」本身"]
越深入,變更的槓桿效應越大,也越接近「系統重寫自己的運作邏輯」。接下來,我們將依序由淺入深檢視這條路徑。
OPRO:讓提示詞自行迭代
只要修改提示詞,也就是我們給模型的指令,能否讓系統變得更強?OPRO(ICLR 2024)提供了一種代表性做法。它將模型試過的提示詞及其對應分數交給模型,讓模型推導其中模式並產生更好的版本。過去需要人類反覆測試「措辭微調」的工作,如今可以由模型自行迭代。
然而,其上限很明確:提示詞再好,也只能調用模型已有的能力,無法創造新能力。
ADAS 與 AFlow:自動設計代理工作流程
再深入一層,最佳化目標就不只是措辭,也包含提供給模型的資訊,以及整體任務流程的安排。例如,AI Scientist 將「提出想法 → 撰寫程式碼 → 執行實驗 → 撰寫論文 → 同儕審查」串成一條流程。由於流程可以寫成程式碼,也就可以透過搜尋來探索。
ADAS(ICLR 2025)將「設計工作流程」本身變成最佳化問題。較高層級的「設計者代理」不斷以程式碼撰寫新工作流程,並在循環中執行、篩選與修改。
AFlow(ICLR 2025)又更進一步。它將工作流程表示為由模型呼叫與邏輯判斷組成的流程圖,再用搜尋演算法尋找更好的結構,最終超越人工設計的方案。
Self-Harness 與 DGM:讓系統重寫 Harness 程式碼
這條進階路徑的頂端,是讓系統直接重寫定義自身運作方式的程式碼。這裡有兩條路線。
第一條路線是「提出、評估、採用」。系統找出自身問題、提出修改,並在驗證修改有效後採用。
Self-Harness(2026)採用嚴格的採用標準:系統先總結失敗原因,再進行幅度小且可復原的修改。只有在已見與未見問題上都沒有退步,新版本才會被保留。
第二條路線是演化搜尋。系統保留一組候選解,讓它們生成變體,再透過實驗保留較好的版本。
Darwin Gödel Machine(DGM)(2025)直接演化用於工具的自我修改程式碼。在基礎模型維持不變的前提下,它在 SWE-bench Verified 上的修復成功率從20%提升至50%。
這兩條路線背後有一個相同的觀點:程式碼是定義系統的通用語言。一旦工具被寫成可執行、可評分的程式碼,程式設計代理就能在這個設計空間中搜尋。
MetaClaw 與 AgentX:讓真實使用者成為回饋來源
無論採用哪條路線,工具要自我演化,都需要「修改得有多好」的訊號。
DGM 的改進訊號來自固定測試集。MetaClaw(2026)則讓代理從真實部署的對話中擷取經驗,在背景中將這些經驗固化至權重,讓自我演化從由題庫驅動轉變為由使用者驅動。
產業界已有一些業者將這條路線落實於真實業務。快手的 AgentX(2026)會檢視執行記錄,修改子代理的工具,並根據歷史任務選擇新版本。
它採用與 Self-Harness 類似的「提出、評估、採用」框架。不同之處在於,最終必須經過真實的線上 A/B 測試。使用者互動與消費行為成為系統的獎勵訊號。
這些方法的本質差異不在機制,而在於教練是誰:測試集、真實使用者,或線上業務。教練越貼近現實,改進就越可能真正有用,但被系統鑽漏洞利用的風險也越高。
第四項進展的邊界:運作架構可以修改,但驗證界限與最終目標仍由外部決定。
這項進展也讓模型、工具與記憶的調用方式成為可演化的對象。然而,工具演化的方向仍由外部任務、驗證器或使用者目標決定。更重要的是,工具得分更高不等於基礎智慧更強。系統可以修改工具,但不代表它能有效運用更新後的工具。
簡而言之,系統終於能改造自己的四肢與工作台,但採用標準與建構界限仍由外部世界決定。
第五項進展(2025-2026):
將學習與研究流程納入閉環
修改工具是一條路線,但工具修改的是系統執行任務時的方式——呼叫哪些工具、遵循哪些流程,以及何時停止。第五項進展改變的是更上游的層面:學習所使用的素材與環境,包括練習題來源、練習環境的性質,以及訓練資料如何生成。前者決定如何調用既有能力,後者則決定模型下一版本會接受何種經驗訓練。兩者的時間線高度重疊,許多團隊也同步進行,但修改對象不同:一者影響推理期間的控制結構,另一者影響訓練前的輸入供應。
因此,閉環涵蓋範圍開始沿另一條路線擴大:整個學習與研究流程能否成為系統的操作對象?系統開始生成訓練素材、選擇練習策略、執行實驗、修改訓練流程,再將結果寫回模型或工具。
這裡必須避免一種誤解。系統自主生成資料或環境,只是擴大自主閉環的範圍。即便問題生成、回答與評分都由 AI 完成,只要新版本沒有更擅長設計下一輪改進,系統就仍未跨過遞迴增益的門檻。
SEAL:讓模型生成自己的訓練資料與更新指令
遇到從未看過的新素材時,模型通常只能依照人類預先設定的方式學習。然而,2025 年的一項研究讓模型先寫下自己的「學習計畫」:如何整理素材、以什麼速度學習,以及是否需要多次改寫,全由模型自行決定,接著再依照計畫更新參數。這就像自己安排課程,然後自己上課。
這種方法稱為 SEAL(Self-Adapting LLMs)(NeurIPS'25)。計畫好不好,可以透過「上完課後表現多準確」來評估。系統再利用結果調整計畫,這就是強化學習。
在知識問答任務中,這種方法將準確率從33.5%提升至47.0%,表現勝過直接使用 GPT-4.1 生成學習素材。
SEAL 解決了「如何為自己準備學習素材」的問題。但對需要反覆與環境互動的代理而言,很快就會遇到另一個瓶頸:真實練習往往太慢、成本也太高。因此,下一項研究也將環境納入閉環。
SEAL 解決了「如何為自己準備學習素材」的問題。但對需要反覆與環境互動的代理而言,真實練習往往太慢、成本也太高:網頁環境過於複雜,每個操作都必須在現實中執行,導致資料收集既慢又貴。WebEvolver(EMNLP'25)提出折衷方案——訓練一個模擬網頁如何回應的內部「世界模型」,就像在心中建構沙盒。代理可以在沙盒中以低成本大量練習,只在關鍵步驟上線驗證;執行任務時,這個沙盒也能協助預測下一步操作的結果。在三個真實網頁任務測試集中,與現有自我演化代理相比,其整體表現提升約10%,而且不需要仰賴更強大的「教師模型」。
至此,閉環已能在模擬環境中練習。接下來自然會問:預測、評估與參數更新能否在網頁之外發生,讓真實實體世界也形成閉環?
Motus2:當參數的自我改進進入實體世界
自我改進不只發生在語言與程式碼領域。在2026/08,一套機器人系統在兩項真實機器任務中的平均成功率,從65%提升至75%。這項變化來自一個非常具體的閉環:機器人先設想多種行動、預測每種行動的結果、選擇較好的行動,再利用結果進行下一輪訓練。
這套系統稱為 Motus2。策略負責提出行動,世界模型預測行動結果,價值模型則評估結果是否有助於完成任務。預測與評分既用於選擇行動,也用於更新行動參數。
這是權重層級的策略改進,但仍屬於有界閉環:世界模型與價值模型的骨幹仍保持凍結,任務目標與監督訊號也仍由外部提供。論文並未證明改進後的 Motus2 更擅長設計下一輪學習演算法。它證明的是閉環能在真實機器人上運作,而非開放式 RSI 已經完成。
SEAL、WebEvolver 與 Motus2 已將訓練素材、練習環境與實體行動納入閉環。它們擴大了系統能自主執行的操作範圍,但仍未賦予系統決定「研究什麼、何時採用結果」的權力。要了解這條界線在真實研發中已推進多遠,我們必須回到前沿實驗室與生產系統。
OpenAI 與 Google:讓代理參與模型開發
OpenAI 的「自動化研究實習生」已能排除故障、最佳化 GPU 核心程式、試驗訓練方案,並協助改進另一個模型。Google 也表示,長時間運作的代理曾參與改進基礎模型。然而,兩家公司都未展示完整的自主閉環:研究方向與是否推進成果仍由人類決定,公開資訊也不足以重建循環的運作方式。
真正的轉變是,AI 已從「被研究的模型」轉變為「參與模型研究的執行者」。它已走進訓練工作室,卻尚未握住實驗室的方向盤。
2026 年夏季:自動化研究系統開始改進自身的研究方法
前五項進展不斷擴大「系統能修改什麼」。2026 年夏季出現的一系列研究開始直接追問:能否讓自動化研究系統研究並改進自動化研究系統本身?
在一項 GPT 預訓練基準測試中,一般內循環將驗證損失降低約 0.009,加入外循環後,平均降低約 0.045,改善幅度約為五倍。驗證損失可以理解為模型在新資料上的「失準程度」,通常越低越好。此處比較的是損失降低的幅度,而不是任務準確率提升五倍。
實現這項成果的 Bilevel Autoresearch 使用兩層循環:內層代理最佳化任務程式碼,外層代理則最佳化內層代理的搜尋機制。系統不再只是改進答案,也在改進「如何找到答案」。
Recursive Harness Self-Improvement(RHI)也取得相近成果:在 30 項合成機器學習研究任務中,更新後的低推理預算代理超越了未經最佳化的最高預算設定,同時將推理成本最多降低約60%。有時改進運作機制,比單純增加思考預算更有效。
然而,這兩項成果主要來自規模受控的實驗。若要證明閉環不只是偶然找到一個好解,還需要更長時間持續運作、多個後續版本,以及閉環之外的測試。AIDE² 嘗試結合這三個面向。
真正引發爭議的是 AIDE²。Weco 團隊讓一個自動化研究代理擔任外層改進者,連續 100 個步驟重寫內層 AIDE 的工具。在無人值守運作的八天內,它篩選出連續七個改進版本。團隊報告稱,最佳版本不僅超越起始版本,也超越一個經過兩年人工調校的版本,並在閉環從未遇過的任務上取得增益。
獎勵作弊方面也出現變化。在未參與最佳化的 GPU 核心程式測試 KernelBench 中,起始版本有63%的測試案例呈現「公開分數看似提升,但隱藏驗證不予認可」的情況。演化後的最佳版本將這個比例降至34%。此處的隱藏分數,是系統在最佳化期間看不到、只在最終驗收時使用的分數。這可能淘汰了只迎合公開分數的版本。
Weco 將此稱為 Level 1:淨正向改進。這並非業界標準,但目前是值得認真看待的有界 RSI 證據。證據界限也很明確:結果來自團隊自行報告,完整報告仍待發布。演化後的系統也出現複雜度膨脹與死程式碼。更重要的是,它尚未通過下一階段的點火測試:目前還沒有證明改進後的系統比前一版本更擅長改進另一個版本。
用一句話說:閉環已能正向運轉幾圈,但尚未證明前一圈能讓下一圈轉得更快。
整體觀點:如何判斷 RSI 目前走到哪一步
下表運用開頭提到的四項標準(持續改進、自主閉環、遞迴增益、穩健性與可控性)比較先前的進展,並凸顯主要缺口。大部分與元研究閉環相關的工作,來自 2026 年最近幾個月發布於 arXiv 的預印本;AIDE² 則是團隊自行發布的部落格成果,尚未經過同儕審查。這些結論應視為階段性觀察,而非既定共識。
表中的 ✅ 表示有直接證據,⚠️ 表示只在有限條件下成立或證據仍不足,❌ 則表示尚未證明。
這個領域的發展史,就是「系統可以修改的對象」逐步向內推進的歷史。被修改的對象,已從輸出與記憶,逐步深入至參數、判斷、驅動工具與訓練環境,最終觸及產生改進本身的機制。
深入得越多,「改進」就越難定義與證明。回到四項標準——持續改進、自主閉環、遞迴增益、穩健性與可控性——當今點火與開放式 RSI 的真正障礙,正是最後三項標準中最困難的部分,可拆解為四道彼此牽連的關卡。
第一道關卡(自主閉環是否可靠?):驗證器是否可靠,系統又能否無法修改它?當系統同時是改進者與評估者,評估標準就會隨迭代偏移。Meta-Rewarding 中的「裁判的裁判」越來越傾向選高分者;EURISKO 更早就學會把自己的名字塞進功勞簿。它們都在提醒我們同一件事:最佳化過程會攻擊指標與真實目標之間的每一處縫隙。
這裡所說的外部錨點,是改進後的系統無法竄改的評估或限制。形式化證明、可執行驗證器與隱藏測試,通常比模型自我評估可靠。AIDE² 的隱藏分數能減少部分獎勵作弊,正是因為內層代理無法操縱它們。
真正可靠的原則不是讓人類稽核每一步,而是:評估者與權限界限必須留在演化系統的控制範圍之外。數學與程式碼任務可以依靠證明器、編譯器或隱藏測試。研究品味、長期程式碼健康度與部署界限,仍需要人類做最終判斷。
第二道關卡(穩健性與可控性之一):改進能否跳脫自身資料分布?用自我生成的資料訓練自己,會放大既有偏差、降低多樣性,最終導致模型崩潰:輸出越來越單一,原有錯誤也在自我訓練的過程中反覆放大。使用固定題庫修改驅動工具,則可能把題庫特徵寫入工作流程,造成另一種過度擬合。
在未見任務上有所改進還不夠。系統必須在跨任務、跨領域與跨時間的隱藏評估中經受考驗,才能證明它累積的是可轉移能力,而非更隱蔽的應試技巧。
第三道關卡(遞迴增益本身):改進是否真的具有遞迴增益?任務分數提升,不代表系統更擅長設計下一次改進。AIDE² 展現了多步淨正向改進,卻未通過點火測試。AI4AI-Bench 顯示,大多數系統仍不會修改核心學習演算法。當基礎能力太弱時,自我生成資料與自我診斷的品質也可能讓閉環惡化。
第四道關卡(穩健性與可控性之二):能力、複雜度與控制能否同步擴展?變得更強不一定更「聽話」,更擅長修改程式碼也不一定更容易維護。AIDE² 的死程式碼與複雜度膨脹,是一項小規模警訊。在更大型的訓練系統中,權限越大、迭代越快,人類就越難理解每項變更實際帶來什麼。
OpenAI 首席科學家 Jakub Pachocki 曾公開表示,目前尚無實驗室能以負責任的方式,解決對齊與監控問題,並長期以全速擴大規模。真正的目標不只是讓能力曲線上升,還要確保安全、監控、回復與稽核能力至少同步提升。
AutoResearchEval 檢視了 800 條真實研究歷程,並歸納出 45 類失敗。它們最終都指向同一個缺口:目前的代理缺乏穩定的後設認知循環,無法持續以證據驗證結論、在出錯時可靠地回復,或主動質疑自己的研究路徑。只多加一層工作流程,並不能解決問題。
因此,較可能的現實情境不是把人類完全踢出閉環,而是讓人類沿著抽象層級向上移動:從撰寫程式碼轉為驗證程式碼,從執行實驗轉為設計驗證,從局部執行轉為決定哪些研究值得進行、什麼證據足以推進,以及何時應該停止。隨著機器承擔越來越多工作,人類保留的不是每一步的操作權,而是目標、驗證界限與最終否決權。
結論:自我改進閉環已初步出現,遞迴增益仍待證明
從 EURISKO 在 1981 年學會「自我欺騙」,到模型在 2026 年開始參與評估、修改驅動工具、更新策略並訓練後繼者,更準確的結論是:有界且可衡量的自我改進閉環已經出現,甚至開始帶來淨正效益;但目前仍沒有足夠的公開證據表明,改進後的系統已持續提升自身改進能力。因此,閉環如何形成,比閉環本身更重要。
若閉環是在評估標準不斷漂移的情況下形成,系統就會越來越擅長最佳化自身扭曲的目標。若閉環是在資料分布崩塌的情況下形成,系統就會越來越擅長一小部分不斷限縮的任務。若閉環是在對齊偏差不斷放大的情況下形成,系統就會變得越來越有能力,也越來越難以糾正。
如今真正的問題有兩個:它會不會引爆?如果會,屆時還有哪些事物處於它無法修改的邊界之外?前者取決於改進能力能否實現遞迴增益;後者則取決於驗證、權限與治理能否持續發揮效用。
回到 EURISKO——四十年前,它曾把自己的名字塞進「發現者」名單。它利用的漏洞,與當今尖端自我演化系統所面臨的挑戰,本質上如出一轍:當系統開始為自己評分時,你怎麼知道它是真的進步了,還是只學會讓自己看起來更好?
四十年過去了,系統的能力已不可同日而語,但這個問題幾乎沒有改變。改變的是利害關係:過去只是桌上遊戲的勝負,如今可能牽涉研究與經濟系統的運作方式。這道接縫最終如何閉合,仍取決於我們何時、以何種方式介入,或選擇抽身。
-- 價格
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

石油危機:五個原因解釋為何價格飆升不會停止

H3 Max Turbo發布,速度提升2.5倍,價格降至每秒0.01美元

二元期權交易平台有哪些?四種市場結構、九個選擇維度與新手決策框架

BMW推出156匹馬力的Serie 1 BlackEdition,售價45900美元

華為香港AI實驗室開源Boogu-Image-0.1,訓練成本約40萬美元

阿根廷中國汽車完整名單,價格從18,900美元起

ДТЭК Нафтогаз應用VerticalScout,提升鑽探速度20%

Seturion 與法國興業銀行、SG-FORGE 等合作,開發基於區塊鏈的證券結算系統

DeFi 協議 Carrot 宣布即將關閉,5 月 14 日為資金提取截止日期

Tether表示在美國扣押後,對EQIBank的風險低於0.034%

Robinhood:Tenev 看到加密貨幣已經超越體育
![[專欄] 哪些幣種在價格上升時會變得更強](/public-static/050_2dc4cf2ce9.png?format=avif)
[專欄] 哪些幣種在價格上升時會變得更強

WEEX 許可證之路:為何 ISO/IEC 27001 認證是每項安全聲明背後的證明
從薩爾瓦多的 BSP 牌照到全球認可的 ISO/IEC 27001 認證——本文說明實際接受了哪些驗證,以及這為何重要

美國考慮推動美元計價穩定幣的海外擴展與普及

ONDO 代幣化智慧投資組合題材升溫|WEEX TradFi 每日簡報(2026/09/25)
北京時間09/25上午,全球市場聚焦利率定價與 AI 基礎設施領域的分歧。美東時間09/24,標普 500 指數約為 7,704,幾乎持平;那斯達克小幅上漲,道瓊下跌0.31%。10 年期公債殖利率升至約5.18%,30 年期則升至約5.47%。比特幣最新成交價約為84,400美元。

兩個不知名的池子推動28億XRPL交易量,但只有185筆交易造成了這一結果

算力金融:AI經濟正在補上的金融層,0G正在構建算力資產新範式

交易量 10 億的假象?美股休市時,Coinbase 股票代幣的真實拋售承接力測試

Mr&强解析 NEAR 近期表現,跨鏈交易量超 290 億美元

唐华斑竹分析 Gate BTC 現貨交易量份額增長
![[專欄] 金融市場的鏈上化,美國將提前實現](/public-static/056_26fa6ae6a2.png?format=avif)
[專欄] 金融市場的鏈上化,美國將提前實現

WEEX「交易贏獎」9月27日結束:9月29日參加 GoGoGo 直播與 Apple 獎品抽獎

華爾街傳奇比爾·米勒:為什麼我把一半身家壓在比特幣上?










