當 AI Agent 互相雇用,誰來監督?

By: foresightnews.pro|2026/09/01 02:32:13

ERC‑8004 解決了身份,ERC‑8183 解決了托管,那麼呢?


撰文:Thejaswini M A

編譯:Saoirse,Foresight News


在互聯網發展的很長一段時間裡,搜尋引擎只負責返回結果列表,其餘的全部工作都交由用戶處理。映入眼簾的,是藍色標題與超連結。之後我們點擊那些看起來和查詢需求相匹配的內容。但把這段經歷當作往事來講,感覺有些怪怪的,也不由得讓我生出幾分歲月感。


作為寫作者,我向來反感 SEO 這套東西。關鍵詞會毀掉文章裡不少精彩內容;在谷歌的排名邏輯裡,外部引用還會被視作投票。本質上,如果更多其他網頁指向你的頁面,你的頁面權重就會更高。不過也無可厚非,聊不上抱怨。某種可信度,總好過完全不被採信。廣告養活了互聯網的一切。但內容發布方顯然十分厭惡這套機制。


如今這套模式正在走向消亡。我想找一本金融經濟相關的書籍,或是想知道長時間走路之後腳踝疼痛該如何處理,我會直接打開 Gemini。有人會用 Perplexity,有人用 GPT。對 Token 消耗不敏感的人,則直接選擇 Claude。這些工具的效果,一定比讀完一整篇文章更好嗎?我們並不知道...... 或許並非如此,但它確實讓生活變得輕鬆。你不必去讀兩篇觀點截然相反的文章,AI 已經幫你把問題處理好了。


我認為,至少 30 歲以下的群體,已經不再把搜尋引擎當作一個需要主動訪問的入口。


隨後智能體(Agent)登場,徹底打破舊有格局。非人類流量已經超過人類流量。一個執行研究任務的智能體,可能會讀取上千個網頁,最終只輸出一份備忘錄。這和人類完全不同。因此,在智能體驅動的經濟體系中,廣告可能失去價值。我曾經寫過兩篇文章,探討軟體是否應當為自己索取的資源付費。我們得出結論:付費這件事本身,反而是最簡單的環節。


一個智能體在網絡中完成任務、實現價值結算,需要一套相互獨立的六層技術棧。


智能體需要找到網頁資源、信任返回結果、信任其他機器人、確認任務完成情況、完成支付,還要給內容創作者留下相應報酬。接下來,我們就按這個順序逐層展開。


真實網絡上有什麼?


機器和人類都在使用「搜尋」,但二者對網頁的訴求截然不同。


人類搜尋會返回完整網頁列表,由用戶瀏覽標題、自主選擇跳轉。面向 AI 智能體的機器搜尋則不一樣。智能體受上下文窗口(短期記憶)限制,不會完整瀏覽網頁。它不會返回按權重排序的全部連結,只會提取對任務最有用的少數段落,直接餵給模型,以此避免內存溢出,整個過程僅需毫秒級耗時。


該賽道兩大主要廠商為 Parallel 與 Exa,二者都是服務智能體搜尋的獨立公司。Parallel 由 Parag Agarwal 在離開 Twitter 之後創立,4 月完成 1 億美元融資,估值 20 億美元。Parallel 會根據明確目標執行搜尋,返回壓縮後的內容片段,片段會按照對任務的貢獻度排序,並且為每一條事實附上引用來源與置信分數。


再看 Exa,a16z 領投,5 月完成 2.5 億美元融資,估值 22 億美元。服務超過 5000 家企業、4 萬名開發者,為 Cursor、Cognition、HubSpot、OpenRouter、Monday.com 等產品提供底層能力。Exa 側重語義理解而非關鍵詞匹配,即便原文沒有出現查詢詞,也能夠返回匹配的內容,同時直接返回乾淨的網頁原文。


根據 Parallel 官方文檔,兩套高速檔位千次搜尋請求費用為 1 美元,兩套低速檔位千次請求 5 美元。無論網頁篇幅長短,URL 內容提取統一為千條 1 美元。Exa 千次搜尋請求收費 7 美元,是 Parallel 的 7 倍;網頁內容提取千頁 1 美元,帶引用的問答接口千次 5 美元。


搜尋效果究竟好不好?

谷歌大多在內部完成搜尋質量評估:判斷用戶是否點擊首條結果、停留頁面還是立刻跳出;同時雇用人工評分員對結果打分。過去也有 RTEC 這類測試,但不存在對外公開、可供採購的排行榜。Google Analytics、Similarweb 統計的是流量,而非搜尋質量。


而在智能體互聯網中,已經出現實驗室基準測試集,專門衡量搜尋工具能否幫助 AI 拿到正確答案。


OpenAI 於 2025 年 4 月發布 BrowseComp,包含 1266 道逆向構造的考題。出題人先確定一個可核驗的客觀事實,再設計問題,把事實隱藏在多重約束條件之下。如果先出題,就像普通知識問答,模型很可能依靠自身記憶或者一次幸運搜尋答對。而先確定事實、再做問題包裝,才可以真正檢驗工具的網頁檢索能力。


原生 GPT‑4o 得分僅 0.6%;開啟網頁瀏覽能力的 GPT‑4o 得分 1.9%;OpenAI 的 Deep Research 拿到 51.5%。



測試目標是驗證系統能否在真實互聯網中找到一條被隱藏、可核驗的事實並輸出。1266 道題目都有簡短標準答案,模型僅有一次作答機會,匹配即得分,不匹配不得分,最終分數等於答對題目占總題數的百分比。原生 GPT‑4o 0.6% 代表模型幾乎無法靠固有記憶獲取事實;開啟瀏覽的 GPT‑4o 得到 1.9%,說明基礎搜尋工具帶來的提升微乎其微;Deep Research 拿到 51.5%,代表更長的搜尋‑閱讀循環,大約一半概率可以找到目標事實。


除 BrowseComp 外還有其他評測集:SimpleQA(OpenAI,4326 個問題),一套易於打分的事實性測試;隨著瀏覽工具提速,SimpleQA 難度被模型輕易突破,因此才有 BrowseComp。GAIA(Meta / Hugging Face,466 道人工任務),面向真實助手場景,可能需要網頁瀏覽、調用工具、讀取文件、多步推理,不止單純搜尋。DeepSearchQA 是多輪檢索的研究數據集,Artificial Analysis 會基於該數據集做綜合評估。FRAMES(Google DeepMind,824 個樣本),多跳問題集,需要從多個來源提取事實再做整合。


私人機構 Artificial Analysis 由 George Cameron 與 Micah Hill‑Smith 聯合創立,2026 年 8 月 18 日發布搜尋指數。這套評測固定作答所用的 AI 模型與評測規則,只更換智能體調用的搜尋 API。分數發生變化,就代表差異來自搜尋工具本身,而非模型能力。


來源:@artificialanalysis


完全不使用搜尋的前提下,同一模型在該指數基線得分 33,BrowseComp 子集基線得分 17。即便各家搜尋服務商排名發生變動,基線分數始終沒有變化。


截至 8 月 27 日 Artificial Analysis 搜尋指數:Perplexity 中端版本以 80 分位居第一;Parallel 高級檔位與 Brave 同為 75 分並列;You.com、Exa74 分;Firecrawl、Parallel 基礎版、Parallel 高速版均為 73 分。


如果搜尋工具得分高於基線,代表搜尋確實幫助模型獲取新信息。邏輯如下:AI 僅靠記憶作答,得到基線分;接入搜尋之後分數上漲,代表搜尋找到了模型原本不知道的信息;分數沒有提升,則搜尋沒有起到作用。


但是評測本身存在局限:測試題目、所用模型都並非業務場景專屬。服務商可以專門針對已知測試集(例如 DeepSearchQA)做應試優化,就像過去網站針對谷歌做 SEO 一樣。


對面的機器人是誰?

當兩個 AI 智能體互相委託工作時,僅有錢包地址和簡介不足以建立信任。錢包地址僅能證明賬戶擁有資金,描述文本很容易偽造,無法證明機器人的開發者身份,也無法佐證它過往工作記錄是否真實。ERC‑8004 這套標準就是為了解決智能體真實身份與聲譽驗證而設計。


ERC‑8004 由 MetaMask、以太坊基金會、Google、Coinbase 相關人員共同編寫,2026 年 1 月 29 日在以太坊主網上線,包含三大註冊表。


第一,身份註冊表,以 NFT 形式實現。每個智能體對應一個編號代幣,代幣的統一資源標識符指向註冊文件,記錄智能體名稱、服務端點、是否支持 x402 支付、支持哪些信任模型。代幣持有者即為智能體所有者;代幣發生所有權轉移時,舊支付錢包信息會被清空,新持有者必須重新簽名證明控制權。


第二,聲譽註冊表,接收帶簽名的反饋,也就是鏈上公開評價系統。使用完智能體之後,用戶可以在鏈上留下評分,附帶任務標籤(例如搜索、評分)。智能體所有者無法給自己寫評價,評價支持撤回。任何人都可以在評價下方追加備註,退款記錄、垃圾警告都可以附加在評分旁邊。這是綁定智能體 ID 的公開評論區,不是某一個應用內部的私有星級系統。


第三,驗證註冊表,對接第三方獨立校驗。智能體發起驗證請求,驗證者智能合約返回 0‑100 的分數,同時附帶證據鏈接;證據來源可以是任務復跑結果、零知識證明,或是安全芯片出具的證明。


該規範本身不處理支付邏輯,文檔中也明確寫明這點。它只記錄智能體身份、外界評價、第三方校驗結果,支付交由其他協議完成。註冊表的數據質量並不理想。根據 8004scan 7 月統計,跨 29 條公鏈一共註冊 385998 個智能體,擁有超過 46 萬條評價。絕大多數 ID 只是空徽章;89.2% 沒有對外公布可調用的標準服務接口;僅有 8631 個智能體擁有可用服務,占比僅 2.24%。


來源:@8004_scan


5 月針對以太坊、BNB Chain、Base 鏈的爬蟲調研發現:鏈上評分無法在不同智能體之間橫向對比。大部分反饋沒有綁定任何人都可以核驗的任務結果,刷評價成本很低。標記過濾掉可疑評價之後,大量被評分的智能體已經沒有可用有效評價。該標準只統一評價數據輸出格式,哪些評價真實可信,交由外部系統處理。ENS、EigenLayer、The Graph、Taiko 都表示會接入該標準,但尚未開發評價過濾工具。


-- 價格

--
--
--

智能體真的完成工作了嗎?


Agentic Commerce 架構,由以太坊基金會與 Virtuals Protocol 聯合設計,目標實現自主 AI 智能體之間互相雇傭、協同工作、鏈上結算,全程無需人類中介。ERC‑8004 配合 ERC‑8183(托管標準)共同實現這套體系。ERC‑8183 標準化智能體之間任務發布、資金托管、結果核驗、結算全流程。


工作流程如下:發起任務的客戶端智能體發布任務,寫明任務描述、截止時間、預算,指定評估器。客戶端將資金存入智能合約,資金被鎖定,任何一方都無法單方面動用。


提供服務的智能體在鏈下完成計算,將最終結果上傳 IPFS、Arweave 這類去中心化存儲,鏈上只提交哈希或者資源定位符。評估器(可以是專門裁判智能體、自動化預言機、零知識證明驗證器)檢查交付成果。


評估器判定任務通過,則扣除手續費之後向服務方付款;判定失敗,則把資金退回客戶端。如果服務方失聯,或是評估器超過截止時間停滯,合約會觸發公開退款邏輯,資金退回客戶端,避免資產永久鎖死。


評估器也可以直接由客戶端本身擔任,文檔把這種模式作為無第三方場景下的常規方案。同時規範寫明:本協議不提供糾紛解決與仲裁機制,拒絕結果 / 超時到期即為最終判定。如果你選擇的打分機器人惡意坑騙你,沒有管理員、客服可以申訴。你求助無門;並且就上一層提到的問題,你也不能依賴鏈上評價去挑選可靠評估器,大部分評價都是虛假的。


UMA、Kleros、Bittensor 這類系統可以緩解評估器單點作惡風險,但會犧牲速度、抬高成本。純自動化托管結算可以秒級完成,手續費極低;而通過 UMA、Kleros 升級糾紛流程,需要挑戰窗口、質押保證金,還要引入人類參與投票。


資金是否完成轉移?


最近行業對這塊討論很多,這裡簡單說明。


x402 由 Coinbase 推出,是搭建在現有公鏈之上的一層協議,按請求扣費,使用穩定幣完成轉賬。


來源:@coinbase


另一套是機器支付協議 MPP,2026 年 3 月由 Stripe 與 Tempo 聯合發布,發布當天 Tempo 主網正式上線。MPP 是一套 HTTP 標準。伺服器返回 402 需要支付響應,附帶挑戰信息;智能體攜帶支付憑證重試請求;伺服器返回資源與支付回執。


資金實際流轉取決於底層通道。Tempo 鏈上單筆交易鏈上結算約 0.5 秒。面對一連串小額調用,智能體可以預先鎖定一筆資金,過程中持續記賬,最後統一上鏈清算,而不是每一次調用都發起鏈上交易。支付上限由本次會話鎖定額度或者訪問密鑰控制,不是「一次性授權、永久扣費」模式。


MPP 支持多種底層通道:Visa 發布卡片規範,智能體可以使用代幣化卡片支付;Lightspark 基於同一套 402 流程實現閃電網絡支付方案,同時配套 Visa 卡片計劃。已經接入 Stripe 卡片支付的商戶,可以直接接收 MPP 卡片支付,資金進入普通 Stripe 賬戶;閃電網絡是 MPP 規則下另一個可選通道。Stripe 同時支持 x402。x402 與 MPP 都復用 HTTP 402「需要支付」狀態碼,但二者屬於兩套不同協議。


內容創作者拿到報酬了嗎?


如果創作者拿不到錢,就不會再有新內容可供檢索。創作者無法盈利,就會停止發布作品,AI 智能體最終將耗盡新的閱讀素材。


Cloudflare、Parallel、OpenLedger 是該領域三個代表性項目。


Cloudflare 最初對爬蟲抓取網頁統一收取固定費用。這套方案過於粗糙,抓取首頁和抓取深度調查報導的扣費完全一樣。現在 Cloudflare 轉向按價值計費模式:只有當內容真正產生價值時,才向發布方結算報酬。同時,對於廣告盈利的站點,如果 AI 服務商拒絕付費,Cloudflare 會攔截 AI 爬蟲。


Parallel 於 5 月 19 日推出 Index 產品,借鑒合作博弈論中的沙普利值算法,計算每一條信息源對智能體最終任務結果的貢獻占比,據此完成分成。不再按點擊統一付費,而是通過數學模型衡量單篇文章對任務的實際貢獻。合作合作方包括 The Atlantic、Fortune、PR Newswire、PitchBook、ZoomInfo、Tracxn、RocketReach、Enigma、Fiscal AI。


目前 Index 僅在智能體使用 Parallel 自有搜索工具時才會進行結算。除非其他 AI 平台全部接入,否則它無法成為全網通用標準。


OpenLedger 是另一種方案,使用代幣體系。它統計數據集對 AI 模型的影響程度,用自家代幣向貢獻者發放報酬。這套方案面向 AI 訓練數據開發者,並非用來補償新聞記者的日常稿件。


我嘗試去查找這些項目實際付給創作者的真實金額數據。Cloudflare 沒有公開兌付數字;Parallel 也未披露;OpenLedger 以 OPEN 代幣結算,沒有對外公開獨立統計總兌付金額。因此,目前我們還沒有確鑿事實來評判這套機制的實際效果。


人類商業發展歷史中,收銀機反而是很晚才出現的產物。人類花了很多年建立口頭約定、本地聲譽體系之後,才發明低摩擦支付。而機器互聯網的發展路徑完全顛倒:它從誕生起就實現即時、流式全球結算。如今智能體經濟卻要手忙腳亂地去搭建鏈上小額糾紛法庭,防止兩個機器人因為幾美元的任務互相欺詐。


最後引用 Terry Pratchett 的一段話收尾:

「一味空談純粹邏輯,說機器只是執行收到的指令,固然說得輕巧。但人們有權期待,機器也該具備一點點常識。」

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com