保羅·米勒(Paul Miller),一位維護比特幣和以太坊項目中使用的加密庫的開發者,測試了7個人工智慧(AI)代理,以分類和修正由比特幣紅隊(Bitcoin Red Team)報告的5個真實安全漏洞。結果顯示,這些模型之間存在明顯差異,無論是在執行每個模型所需的美元支出上,還是在其診斷的準確性上。
在7個評估的代理中,3個未能完成任務。來自阿里巴巴的Qwen 3.8在過程中卡住,米勒未給出具體原因。來自OpenAI的GPT-5.6 Sol和來自Anthropic的Fable則直接拒絕對代碼進行工作,根據米勒的說法,儘管任務是識別和修復漏洞,而不是利用它們。
完成工作的4個代理,Grok 4.6(xAI)、Kimi K3(Moonshot AI)、DeepSeek V4 Pro和DeepSeek V4 Flash(DeepSeek),在執行過程中的美元消耗差異很大 (用戶指令的代幣消耗):
所需的時間也有顯著變化。DeepSeek V4 Pro在30分鐘內完成工作,Kimi K3在40分鐘內完成,Grok 4.6則花了1小時,而DeepSeek V4 Flash則需要3小時,這是DeepSeek V4 Pro所需時間的六倍(500%)。
根據米勒的說法,只有Grok 4.6與他自己對5個漏洞嚴重性的評估一致。
其他3個完成工作的代理(Kimi K3、DeepSeek V4 Pro和DeepSeek V4 Flash)則誇大了所發現漏洞的嚴重性,這根據米勒的說法,最終影響了這3個模型所提供結果的整體質量。
米勒的測試發生在一波利用人工智慧加速尋找和利用比特幣生態系統安全漏洞的攻擊潮中。
在過去幾周,Coldcard、Boltz、ZEUS、BTCPay Server和LNP2Pbot 遭受了與漏洞相關的安全事件,攻擊者利用AI模型識別和利用這些漏洞。這些事件並未影響比特幣協議本身,而是影響了在網絡外運行的產品和服務。
這波事件促使比特幣紅隊,一個專注於尋找比特幣開源項目安全漏洞的開發者團隊,發起了一次大規模的AI輔助審計。
比特幣紅隊的審計已經涵蓋了300多個開源代碼庫,並從這項工作中產生了米勒用作其對7個AI代理測試基礎的5個漏洞,還有其他8000個漏洞,如CriptoNoticias報導的那樣。
在米勒測試的7個代理中,4個是開源的,分別是Kimi K3、DeepSeek V4 Pro、DeepSeek V4 Flash和Qwen 3.8。這意味著訓練這些模型的公司公開了其參數,任何用戶都可以下載並在自己的設備上執行,而無需依賴這些公司的批准。
其他3個代理,Grok 4.6、GPT-5.6 Sol和Fable,則是封閉的,因此只能通過開發它們的公司的平台或應用程式介面(API)使用。
這種開源模型和封閉模型之間的區別對比特幣生態系統的安全性至關重要。由於在每家公司自己的伺服器上運行,封閉模型使其創建者能夠保持活躍的安全過濾器,這就是為什麼GPT-5.6 Sol和Fable在這次測試中拒絕對漏洞進行工作。
相比之下,開源模型可以在本地計算機上運行,並由任何用戶進行修改,這使得去除這些安全過濾器成為可能。攻擊者可以使用這些模型的無限制版本來協助對比特幣生態系統平台的實際攻擊,而這是任何外部過濾器無法阻止的。
米勒的測試表明,儘管人工智慧在漏洞檢測方面取得了進展,但在分類和準確修正漏洞時,各種模型之間仍然存在顯著差異,無論是在每個模型所需的美元支出上,還是在它們所應用的標準上。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。





























