Google 創建 WikiSkill 讓 AI 代理記住錯誤並改進

By: www.diariobitcoin.com|2026/08/29 13:32:09

Google Research 的研究人員介紹了 WikiSkill,這是一個保存 AI 代理錯誤和成功的框架,並在持久的維基中創建更好的指令以便未來的執行。測試顯示在數學、電子表格和互動環境方面取得了重要進展,儘管該系統仍未在嚴格意義上代表持續學習。\n\n\n\n WikiSkill 將執行痕跡、累積知識和主動指令分為三個層次。\n 該框架將 Gemini 3.5 Flash 的平均值從 49.5% 提高到 68.1%,將 Qwen-3.6-27B 的平均值從 39.4% 提高到 63.3%。\n 大型模型更好地利用了進化的技能,而小型模型則可以縮小部分差距。\n\n### 一個為忘記的代理提供的外部記憶\n\nGoogle Research 的研究人員介紹了 WikiSkill 作為一個旨在解決人工智慧代理的重複性限制的框架:每次執行結束後,獲得的大部分經驗都會消失。該系統不是在每個任務後修改模型的參數,而是將有關失敗、成功和有用策略的信息收集到類似於協作百科全書的結構中。然後,代理會查詢這些材料,以便在下一次機會中採取更好的指令。\n\n該提案並不意味著模型以傳統意義上持續學習。模型保留其原始訓練,但根據記錄的經驗為自己生成更精確的指令,這是一種不如持續學習優雅的解決方案,並且可能容易受到累積錯誤的影響。儘管如此,研究結果表明,這種外部記憶可以顯著改善需要多步驟和協調工具使用的任務的表現。\n\n這一概念源於 Andrej Karpathy 的觀點,關於一種為語言模型設計的維基,在這裡,代理的經驗轉化為持久和累積的知識。WikiSkill 將這一理念推進到自動技能開發,通過一個過程試圖將先前的執行轉化為可重用的程序,而不觸及訓練期間學到的行為。這一區分是相關的,因為它允許在不進行全新模型調整的情況下測試行為變化。\n\n該工作在五種類型的測試中進行評估:數學推理、網頁搜索、電子表格操作、文檔問答和虛擬環境中的互動任務。研究人員使用了 40 億、90 億和 270 億參數的 Qwen 版本,以及 Gemma-4-31B 和 Gemini-3.5-Flash。這一組合使得觀察累積記憶在不同能力模型中的運作,以及在面對非常不同要求的任務時的表現成為可能。\n\n### 三個層次和一個改進循環\n\nWikiSkill 將工作空間組織為三個層次,這些層次執行不同的功能。Raw Layer 保存每次執行的完整痕跡,包括對工具的調用、獲得的回答和代理遵循的步驟;這些記錄是不可變的,並作為分析行為的原材料。其上是 Wiki Layer,經驗轉化為結構化的結論,如失敗模式、操作建議和產生有利結果的策略。

Wiki Layer並不會在任務完成後重啟,而是隨著每次迭代而增長,根據研究人員的描述。這種連續性使得後續執行可以查詢之前檢測到的問題,即使引發這些問題的策略已不再活躍。第三層稱為技能層(Skill Layer),包含代理在執行過程中使用的程序指令,並作為系統的可修改部分。

循環開始於推理代理完成一項任務,利用可用的技能並產生新的痕跡。之後,Wiki維護者會檢查這些記錄,以識別出錯誤的原因及有助於成功的決策,而技能提議者則利用累積的結論來建議對當前指令的具體修改。這種架構將事實觀察、經驗解釋和新行為的應用分開。

在接受修改之前,一個驗證或篩選機制會在一組獨立的任務中進行測試。如果變更改善了結果,則可以納入技能層;如果對表現造成損害,則會撤回,但不會刪除導致提議的信息。即使是失敗的更新也保留了實用性,因為維基記錄了嘗試的內容及其失敗的原因,這樣系統可以避免重複相同的路徑或在後續回合中設計替代方案。

根據模型和任務的不同結果

研究報告了WikiSkill相對於沒有額外技能的代理的改進。平均而言,Gemini-3.5-Flash從49.5%提升至68.1%,而Qwen-3.6-27B則從39.4%提升至63.3%。這些數字對應於五個基準的平均值,並根據工作中包含的表格計算得出。

在觀察單個任務時,差異變得更加明顯。Gemini-3.5-Flash在LiveMath中從33.0%上升至72.6%,在SpreadSheet中從50.5%上升至76.6%,這兩個場景中累積的指令似乎影響最大。在Qwen-3.6-27B的情況下,WikiSkill在LiveMath中達到61.9%,在SpreadSheet中達到81.7%,而當模型在沒有技能的情況下工作時,分別為33.9%和40.8%。

增益在所有領域並不均勻。數學任務和電子表格操作顯示出最大的提升,而OfficeQA則要求回答有關文檔的問題並處理長上下文,在多個配置中進展較為有限。例如,在Gemini-3.5-Flash中,OfficeQA的分數從48.6%提升至60.7%,這是一個相關的改進,但低於在LiveMath和SpreadSheet中觀察到的提升。

模型的大小也影響了利用進化技能的能力。研究人員指出,Qwen-3.5-4B在需要在廣泛上下文中持續執行多步搜索策略時,經常無法可靠地執行,因此經常回到其預設行為。然而,一個配備WikiSkill的小型模型可以達到不使用該框架的大型模型的表現,這為提升資源較少的系統的實用性開辟了可能的途徑。

技能轉移與待解決的限制

研究的另一個觀察是,由模型創建的技能可以轉移到另一個模型,並且在某些情況下,這些技能的效果可能優於接收模型自行開發的指令。這一可能性指向一個共享程序的庫,其中對於解決電子表格或瀏覽網絡的有用技能可以在不同的代理中重複使用。然而,結果並不保證轉移在所有情況下都是有利的,因此研究人員建議逐一驗證。

轉移過程需要謹慎,因為在一個模型中有效的指令可能依賴於其能力、推理風格或與工具互動的方式。較小的代理可能會不完全理解為較大系統設計的策略,特別是當任務需要在上下文中保持多個步驟時。驗證機制提供了一個防範此風險的屏障,但並不消除在使用環境中評估每項技能的必要性。

WikiSkill 也揭示了記憶與學習之間的根本區別。Wiki 保存信息,而 Skill Proposer 則生成新的指令,但模型的參數保持不變;因此,系統不會像持續訓練過程那樣獲得內部的持久理解。這個解決方案可能改善可觀察的行為,儘管錯誤的結論、不完整的記錄或錯誤的推斷可能會被納入知識庫,並影響未來的決策。

層級設計試圖通過保持原始痕跡、結論和活躍技能的分離來解決這個問題。能夠撤回更新保護了即時執行,而保存失敗的嘗試則避免了丟失對後續分析有用的信息。總體而言,這種方法展示了開發者如何構建具有累積操作歷史的代理,而不聲稱他們已經解決了持續學習的問題,這仍然是一個未解的挑戰。

結果表明,外部記憶可能成為重複執行相同類型任務的代理的重要組成部分。WikiSkill 並未消除模型的限制,也無法保證每次經驗都能帶來改進,但提供了一個系統化的程序來觀察錯誤、記錄策略、測試變更和保留所獲得的教訓。該框架的主要承諾在於將執行之間的遺忘轉變為一個逐步控制的精煉過程。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com