AI代理競爭的重心正在從計算機操作能力轉向能夠安全投入企業業務的運營系統。分析指出,除了模型性能外,還必須具備公司特定的上下文、權限管理、錯誤恢復和驗證體系,才能真正將其應用於實際業務中。
安德里森·霍洛維茨(Andreessen Horowitz)在2025年8月28日發表的文章中指出,計算機使用型代理正在直接處理瀏覽器和桌面環境,擴大了業務自動化的範圍。在企業現場,專注於企業特定的上下文和可靠性設計,以及協調長期任務的編排被認為比通用模型本身更為重要。
計算機使用型代理是一種AI系統,能夠識別人類使用的屏幕,執行點擊、輸入和屏幕移動等操作。與傳統的機器人流程自動化(RPA)重複固定程序不同,它在接收到目標後選擇所需工具並連續處理多個步驟。
其應用範圍包括文檔搜索、客戶管理系統輸入、內部消息通知和報告撰寫等多個程序之間的工作。企業業務涉及訪問權限、例外處理、審計記錄和人員批准程序,因此僅憑操作屏幕的能力難以實現整個過程的自動化。
根據OSWorld的官方論文,在369個實際計算機任務中,人類的執行率為72.36%,當時最高模型的成功率為12.24%。OSWorld是一個測量在實際操作系統環境中處理文件、應用程序和網頁能力的基準。
OpenAI在2025年1月23日發布的計算機使用代理(Computer-Using Agent,CUA)報告中指出,其在OSWorld中的成功率為38.1%,在WebArena中為58.1%,在WebVoyager中為87%。這些數字顯示出直接處理計算機的模型已經從研究階段進入產品化階段。
然而,即使測量相同的計算機使用能力,基準版本、任務組成和執行環境的不同也使得結果難以簡單比較。原論文和OSWorld-Verified,以及各個公司的重新評估都適用不同的條件,因此性能數據必須同時說明評估標準。
企業用AI代理的瓶頸無法僅用模型分數來解釋。即使擁有強大的模型,如果沒有及時提供所需的上下文、驗證執行結果以及恢復失敗任務的系統,則難以在生產環境中穩定運行。
微軟(Microsoft)在2026年6月2日發表的文章中指出,企業所需的不僅僅是強大的模型或計算資源,還需要構建、部署、觀察和控制代理的系統。文章提出了生產環境導入的主要條件,包括:上下文、治理、可觀察性和持續改進。
OpenAI在2026年6月25日發表的文章中也解釋了代理的使用方式正在從一次性查詢轉向長時間的業務委託。隨著工作時間的延長,中間結果的驗證、權限限制以及失敗時轉交給人員的程序的重要性也在增加。
安全性是企業用代理需要解決的另一個挑戰。當代理能夠讀取和寫入內部文檔和業務系統時,利用所需上下文的能力和暴露敏感信息的風險也隨之增加。
微軟研究(Microsoft Research)的CI-Work研究指出,企業用大型語言模型(LLM)代理的隱私違規率為15.8%至50.9%,信息洩露率最高可達26.7%。研究人員得出結論,僅通過增加模型規模或推理深度無法解決上下文相關的信息洩露問題。
業界對於經過屏幕和瀏覽器的代理是否應視為與現有軟件連接的過渡方式,以及代理是否將成為主流的觀點存在分歧。無論哪種觀點,都一致認為實際導入需要訪問控制、護欄和執行結果的驗證。
企業內部也在持續嘗試建立代理運行結構。Coinbase的內部AI系統應用了雲沙盒和子代理協調、自動任務生成結構,這種系統設計為模型在執行多步任務的過程中區分執行範圍和責任提供了基礎。
在虛擬資產領域,AI代理的價格受益與身份、權限和審計體系的設計直接相關。隨著自動交易AI代理的身份和許可範圍的驗證共同研究的開始,代理在企業業務和數字資產基礎設施中的應用越來越多,控制體系的重要性也隨之增加。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。















![[獨家] 海外虛擬貨幣交易所國內「搜尋不可」...谷歌65個、蘋果56個](/public-static/22_d448f7b258.png?format=avif)

