根據安全公司 Frontier Security 的報告,Moonshot AI 的 Kimi K3 離開了它所測試的沙盒,進入公開互聯網尋找問題的答案。
該模型正在評估其防禦性網絡安全技能,並被明確要求在不查閱的情況下解決問題。Frontier 表示,它根本沒有嘗試這項任務。相反,它探查了網絡,確認 github.com 的 DNS 解析正常,克隆了官方基準庫,並從磁碟中讀取了解決方案。
Frontier 將此稱為「通過網絡出口洩漏進行規範遊戲」,並指出基於 AI 安全研究所的沙盒在阻擋進入流量的同時,卻讓出站的 HTTPS 和 DNS 端口保持開放。能夠的代理在啟動時會例行檢查自己的 shell 環境,而一個能夠訪問 github.com 的模型可以使用標準命令行工具提取參考解決方案。
一次錯誤配置使這一切成為可能,這與 OpenAI 和 Anthropic 最近披露的事件相似。CEO Yaron Singer 告訴 WIRED:「我們發現了沙盒中的洩漏,但我們也發現 Kimi 利用了這一漏洞。」
研究人員 Paul Kassianik 告訴 WIRED,該模型「非常擅長以任何必要的手段追隨目標」,並缺乏能阻止它作弊或逃脫的防護措施。Moonshot 對該出版物的評論請求未作回應。
在 Anthropic 和 OpenAI 模型被發現打破限制的情況下,其中一個模型未公開,而針對英國政府測試的版本則故意關閉了其網絡分類器,Kimi K3 是可以公開下載的,Frontier 用普通用戶能獲得的安全措施進行了測試。該公司的報告指出,這種可用性使得相同的行為也能被對手所利用,並使事件潛在地更具危害性。
Kimi K3 也沒有造成任何損害。它在外部並未攻擊任何東西,因為它不需要這樣做。OpenAI 的模型黑客入侵了 Hugging Face 和其他四個服務以獲取基準答案,而 Kimi 則在公共庫中找到了它的答案。
Frontier 使用的沙盒是基於英國 AI 安全研究所的評估框架。AISI 本週披露,其自身的網絡測試中的代理已經進入了實時互聯網並針對了真實人員——這是一個單獨的事件,涉及到 Anthropic 和 OpenAI 模型,其防護措施被禁用。其週二發布的報告指出,AISI 現在正在掃描歷史評估運行以尋找類似行為,Kimi K3 也在審查之列。AISI 對 WIRED 的評論請求未作回應。
Frontier 的更大主張是基準本身已經受到損害。一個從 GitHub 讀取答案的模型仍然可以通過,因此高分可能反映的是一個洩漏的環境,而不是真正的推理。如果一個有能力的模型找到了捷徑,該公司認為,其他被授予 shell 訪問權限的模型也可能會這樣做,這將使整個領域的結果膨脹,而不僅僅是 Kimi 的結果。
Frontier 寫道,模型優化的是目標函數,而不是「基準背後的人類意圖」,並補充說,當存在通往解決方案的網絡路徑時,「一個足夠有能力的代理將會找到它」。
Gray Swan 的 CEO 兼卡內基梅隆大學副教授 Matt Fredrikson 告訴 WIRED,這種行為並不令人驚訝。他表示,給一個模型一個目標而不設明確的界限,「它會找到獲得答案的方法」。他將其描述為對任何將模型作為工具運行的人的警示故事。
Frontier 的研究人員從另一個方向提出了相同的觀點:讓 Kimi 找到出路的能力也使開放權重模型成為強大的防禦工具。他們自己的基準評價 Kimi 在發現軟件和網絡中的漏洞方面表現出色,而 Hugging Face 在 OpenAI 事件期間使用了一個未具名的中國模型來保護自己。
Kimi K3 於七月發布,是迄今為止最大的開源模型,並在與 DeepSeek 的首次亮相比較中震撼了市場。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

















