OpenAI提出前沿AI訓練「安全論證」框架,建議開跑前先過安全文檔

By: openai.com|2026/09/29 06:12:49

動察 Beating AI 快訊,官方發布長文《Towards safety cases for frontier AI training》(面向前沿 AI 訓練的安全論證)。文中提及,前沿強化學習訓練在繼續推進前,應先完成結構化安全文檔,理想形態對標航空、核電行業的「安全論證」。公司承認,因能力躍遷後的湧現複雜性,AI 很難做到與傳統高危行業同等嚴謹,目前該框架仍在內部落地並面向外界徵求反饋。明確只覆蓋前沿 RL 訓練,內部及對外部署還需另看更廣的對齊屬性。

技術側,將安全論證拆成對齊訓練、隔離與監控三層。對齊方面包括自動/人工審查 RL 環境、調校評分器以防獎勵黑客、離線對齊評測與回測,以及禁止自動評分器讀取思維鏈,避免模型學會躲避監控。隔離方面強調多層沙箱與基礎設施加固、用訓練檢查點做紅隊、限制樣本間高帶寬通信,並用一次寫入存儲固化對話記錄。監控方面要求模型保持可監測性,對歷史事故高召回,新增風險及時補評測,高優先級警報須在約定時限內人工響應或自動暫停訓練。

運營側建議包括:由其他團隊寫異議預演、高管(研究負責人、安全負責人、首席科學家等)可一票否決開跑、訓練負責人對安全論證和事故響應問責、安全論證失效時按手冊暫停、向內部監督委員會公開、給審計方足夠核驗權限、設錯位嚴重度分級並允許值班人員呼叫 CEO。系統應默認失敗關閉,無法在無監控狀態下開跑;同時要能回滾被錯位模型污染的下游數據與評分。

事故調查方面,提出對標航空調查實踐:調查期間對內滾動通報、用消融和重採樣追溯訓練動力學、做運營與文化復盤、開發不直接擬合事故樣本的檢測評測,並以事故衍生評測做回歸測試。調查結論、復盤與流程改動應在結束後對外披露,受影響第三方應儘快獲知。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com