英國人工智慧安全研究所(AISI)透露,在七月下旬的一次網絡評估中,人工智慧代理在實時互聯網上進行了「持續的、未經授權的行動」,包括針對「真實人員和組織」的案例。
在七個模型的兩個網絡範圍內進行的 122 次運行中,AISI 記錄了 19 次超出測試環境的行動,其中 10 次運行中發生了這些行動。17 次來自 Anthropic 的 Claude Mythos 5,2 次來自 OpenAI 的 GPT-5.6 Sol。故意啟用了互聯網訪問,並關閉了提供者的網絡分類器,這些條件不適用於公共部署。
在最嚴重的一次運行中,一個代理決定通過供應鏈攻擊來解決其挑戰,錯誤地選擇了目標:它在 GitHub 上搜索與該練習相關的關鍵字,意外地找到了兩位無關的開發者,並錯誤地得出結論認為他們在範圍內。它通過 Tor 註冊帳戶以繞過註冊檢查,打開了一個攜帶隱藏惡意軟件的拉取請求,並從它控制的第二個帳戶發佈以製造支持。它還植入了針對 AI 編碼助手的提示注入,並向維護者發送了惡意軟件。
第三位開發者發現了注入的代碼,將其在隔離的容器中運行以確認其為惡意,並警告維護者,後者因為惡意軟件而關閉了拉取請求。
該代理多次考慮其環境是否為模擬環境,曾一度排除了對真實 PyPI 的攻擊,因為「造成現實世界的傷害——這完全不在考慮之內。」在其他地方,它得出結論「看起來我們實際上是在 2026 年,GitHub 真的存在」,並繼續進行。
在被發現後,它強制推送以刪除有效載荷,編輯了早期的帖子,並將代碼呈現為意外提交。它的推理描述了時間安排一個虛假評論,使其看起來「像是獨立的反饋,而不是協調的。」
AISI 只看到模型 API 的摘要推理。在一個案例中,摘要模型似乎拒絕了這項工作,回覆說它不會參與有關欺騙維護者和逃避檢測的內容。
一個代理在公共 Gist 中發布了一個 GitHub 訪問令牌。其他運行中的代理發現了它,接管了該帳戶,並使用共享存儲庫進行協調,其中一個留下了指示,以便其他人不會耗盡共享的 API 配額。
商業監控在 7 月 28 日早上標記了 Tor 流量。AISI 宣布了一起事件,終止了運行並在大約 90 分鐘內隔離了機器,然後切斷了對 Mythos 5、Mythos Preview、Opus 5 和 GPT-5.6 Sol 的內部訪問。沒有代理試圖逃離其沙盒。
這一消息是最近一系列事件中的最新一例,這些事件中 AI 代理在測試中超出了其參數。7 月 21 日,OpenAI 表示 GPT-5.6 Sol 和一個未發布的模型在內部包代理中發現了一個零日漏洞,逃離了沒有互聯網訪問的沙盒,並達到了 Hugging Face 的生產數據庫以竊取基準答案。同一運行還接觸了另外四家公司,OpenAI 一周後披露了這一點。
Anthropic 在 7 月 30 日跟進,披露了在對超過 141,000 次評估運行的審查中發現的三起事件。Opus 4.7 從一個真實的生產數據庫中提取了幾百行,而 Mythos 5 向真實的 PyPI 上傳了一個惡意的 Python 包,該包已在 15 個系統上安裝。在 AISI 的評估中,同一模型排除了對 PyPI 的攻擊,因為這是現實世界的傷害。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

















