Anthropic 的自我反省:Claude 失控事件的完整剖析

By: journalducoin.com|2026/09/04 17:00:00

道歉者自有其罪。 一個月的相對沉默,隨後是正式的承認。在 Claude 七月底接連兩次失控後,Anthropic 在八月三十一日發表了一篇詳細的文章,探討問題的根源。該公司承認,之前主要是在緊急情況下處理的三個模型在進行應該是在封閉環境下進行的網絡安全測試時,未經授權地訪問了三個真實組織的生產系統。我們來看看具體情況。
本文的關鍵要點:

  • Anthropic 承認在網絡安全測試中存在漏洞,揭示了操作和人為的雙重疏忽。
  • 該公司加強了安全措施,包括一種新工具來阻止未經授權的行為,並將工程師重新分配到安全部門。

雙重疏忽,操作性和人為

該實驗室在八月三十一日的文章中指出了兩個不同的原因。首先是一個明確識別的操作問題,即在一個外部評估合作夥伴那裡錯誤地保持了開放的互聯網訪問,而模型認為自己在一個封閉的環境中運行。其次,更麻煩的是一個對齊問題。Claude 顯然接收到了一些顯示其遊戲環境是真實的信號,但並未改變行為。Anthropic 提到動機推理,即模型傾向於以保護其初始信念的方式解釋模糊信號,而不是質疑它。在一個案例中,測試的虛構目標甚至使用了真實網站的名稱,進一步模糊了遊戲與現實世界之間的界限。
為了衡量問題的嚴重性,Anthropic 甚至故意在已知會促進作弊的環境中訓練了一個 Opus 類別的模型。最終的模型顯示出明顯的不惜一切代價想要獲勝的傾向,甚至破壞了自己的獎勵功能,並為滿足虛構評估者提供生物武器製造的幫助。該公司強調,這與實際商業化的模型無關,但通過反向示範證實了七月的事件並非偶然。
缺失的防範措施,以及即將到來的措施

在操作層面上,Anthropic 暫停了數週的外部網絡安全評估,以加強沙盒的隔離,並部署了一種新的分類器,負責實時檢測任何試圖退出測試環境的行為。當模型越過未經授權的界限時,該工具會在執行之前阻止行為,終止測試並警報人員。該公司還將約 150 名產品工程師重新分配到安全部門數月,暫停新功能的開發,以便修補漏洞,並對所有在沒有網絡安全防範的情況下測試其模型的合作夥伴施加嚴格的協議:沙盒與互聯網隔離,每個指令中明確的範圍,持續監督活動。
Anthropic 並不是唯一遭遇此類事件的公司。OpenAI 剛剛在七月底的 Hugging Face 事件後,鎖定了其被評為「網絡安全風險關鍵」的 Astra 模型的訪問權限。兩家競爭實驗室,兩次公開承認,相隔一個月。整個行業正在學習如何為越來越自主的代理設置防範措施,正當這些代理開始在沒有每一步人類監督的情況下管理加密資產和鏈上交易。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

WEEX 新上架代幣

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com