作者:Zen,PANews
過去一年,機器人/Physical AI數據從一個相對隱蔽的基礎設施環節,迅速變成戰情焦灼的新賽道,資本正以驚人的速度湧入這個被稱為具身智能「賣鏟人」的賽道。
這種升溫在國內尤其明顯。僅2026年上半年,25家中國具身智能數據創業公司就合計獲得超過170億元融資。其中,光輪智能年內連續完成多輪大額融資;由智元機器人孵化的數據公司覓蜂科技也在成立後迅速籌集到數億元資金。
在海外市場,一批專門圍繞機器人訓練數據成立的初創公司也開始露頭。XDOF在今年6月宣布完成7000萬美元融資;7月底,Axis Robotics完成由Hack VC領投的1200萬美元種子輪融資。
Axis將自身定位為「Physical AI數據引擎」,目前以分佈式貢獻者網絡和網頁端仿真數據採集為重要切入點,並繼續向第一人稱視角、模型後訓練等數據形態擴展,已經通過瀏覽器遙操作收集超220萬條機器人軌跡數據,累計數據時長達28000小時。
不過,儘管資本已經充分進入,機器人數據仍是一個快速變化且遠未定型的市場。從數據需求最終會達到怎樣的規模,到真機、仿真和第一人稱視角等不同路線如何取捨,再到數據公司能否形成可持續的商業模式,許多關鍵問題仍處於探索階段。
圍繞這些問題,以及Axis自身的數據生產模式、技術路線和未來發展規劃,PANews與Axis Robotics創始人Chris Feng展開了一次對話。
Chris並非從機器本體或算法起家,而是從諮詢、投資和數據基礎設施一路進入機器人數據賽道。
真正讓他決定進入機器人領域的,是進入Physical AI時代後顯現的巨量數據缺口。
「以GPT-3為參照,其訓練需要約為1500萬小時的人類互聯網數據。」Chris表示,而機器人需要處理的物理世界遠比數字世界複雜,不僅需要識別和邏輯的能力,還要理解空間、動作、物體狀態以及動作之後會發生什麼變化。
因此,如果機器人領域要迎來自己的「GPT時刻」,所需要的數據可能達到1億小時甚至更高量級。而除了數據規模的明顯差異外,兩者的數據基礎更是完全不能相提並論。
在大語言模型出現以前,互聯網已經發展了數十年。各種網頁、書籍、論壇、代碼庫以及大量數字內容,在長期積累中形成了天然的數據資源。
而現實世界中的人類行為卻沒有經歷類似的系統記錄過程,人們每天都在做飯、整理物品、操作工具,但這些行為很少被連續記錄,更沒有被大規模轉化為能夠直接用於機器人訓練的標準化數據。
隨著VLA模型、世界模型等技術發展,機器人模型公司開始成為這類數據最直接的需求方,一些機器本體公司也在同步建設模型和數據能力。與此同時,機器人形態本身也在快速分化,從人形機器人、機械臂到針對工業和服務場景設計的專用設備,不同模型和本體又進一步產生了差異化的數據需求。
當需求規模不斷擴大後,傳統的數據生產方式很快暴露出局限性。
早期機器人公司通常依靠真機遙操作,由人工直接控制機器人完成任務,再記錄動作軌跡。這類數據與真實機器人最為接近,但生產速度慢、成本高,同時受到機器人數量、場地和操作人員規模的限制。
更重要的是,真實世界具有高度複雜性和多樣性,僅依靠企業內部有限的機器人和採集場景,很難覆蓋模型未來可能遇到的環境。如果機器人基礎模型最終需要千萬小時級別甚至更多的數據,僅靠持續增加機器人、場地和遙操作人員,難以實現經濟有效的線性擴張。
因此,如何以可控成本、可擴展的方式持續生產足夠多樣且真正能夠改善模型表現的數據,成為了Physical AI數據行業面臨的核心問題之一,也構成了獨立機器人數據公司正在爭奪的商業機會。
機器人數據還有一個更複雜的問題,不同來源的數據在真實性、成本、可擴展性以及跨本體復用能力上存在明顯差異。
Chris把目前幾條主要路線大致分成真機遙操作、仿真和人類第一人稱視角數據。如果以數據與機器本體之間的直接匹配程度來看,可以大致形成一個「金字塔」。
位於金字塔頂部的是真機遙操作。
操作者直接控制真實機器人完成抓取、放置、移動等任務,傳感器同步記錄機器人關節、末端執行器、視覺和動作信號。這類數據最大的優勢在於,其訓練數據本身就來自真實機器人,因此物理信息最完整,與目標本體之間的差異也最小。
但真機數據的成本和規模問題同樣突出。根據行業數據,一小時高質量真機遙操作數據的綜合成本可達200美元。更重要的是,這類數據通常與具體機器本體高度綁定,跨本體復用能力有限。例如,在Unitree G1上採集的動作軌跡,就不能直接適配不同形態的機器人。
處在金字塔中間位置的,是仿真數據。
機器人仿真是將真實機器人的尺寸、關節、動作範圍以及任務環境盡可能還原到虛擬空間中,再讓操作者或程序控制虛擬機器人完成任務。目前機器人研究和開發中常用的仿真平台包括Isaac Sim、MuJoCo等。
相比真實世界,仿真的突出優勢是規模化和可控性。現實中不可能為了採集數據重複搭建成千上萬個廚房、倉庫或工廠,但在虛擬環境中,同類場景可以被快速複製和並行運行。已有軌跡還可以通過改變光照、材質、攝像機位置、物體類型和空間佈局等參數,擴展到更多不同環境。
與此同時,仿真環境中的任務狀態也更容易被精確讀取。例如任務是否完成、機械臂是否發生碰撞、物體最終處於什麼位置,都可以直接從環境中獲得,這使得數據驗證和自動篩選更加容易。
不過,仿真數據的局限同樣明確:虛擬環境始終難以完整還原真實世界。摩擦、物體形變、接觸狀態、傳感器噪聲以及大量不可控因素,都可能導致模型在仿真中表現良好,卻在遷移到真實機器人後出現性能下降。如何縮小這種「仿真到現實」的差距,也一直是機器人研究中的核心問題之一。
另一條近兩年明顯升溫的路線,是人類第一人稱視角數據,其處在金字塔的底端。
這類方法試圖減少對昂貴機器本體的依賴,讓數據貢獻者佩戴頭部相機、GoPro,或者直接使用手機,記錄做飯、疊衣服、整理房間和操作工具等真實行為。
其基本邏輯是,如果未來機器人的視覺和動作邏輯與人具有較高相似性,那麼大規模記錄「人類如何與世界交互」,理論上可以為機器人基礎模型提供極其豐富的數據。
第一人稱視角數據最吸引人的地方在於潛在的規模和環境多樣性。相比部署大量機器人進行遙操作,讓普通人在家庭、工廠、商場等真實場景中記錄行為,採集成本和參與門檻都更低,也更容易覆蓋大量不同環境。
不過,Chris也指出,人類第一人稱數據存在一個很大的不確定性:它的訓練價值很大程度上取決於未來機器人的本體形態。
如果機器人採用輪式底盤、機械臂、專用夾爪等非人形設計,人類操作數據在動作層面的直接遷移價值就會明顯降低。即使未來人形機器人成為主流,人類動作也不能直接被機器人複製,手部和身體運動仍需要經過動作重定向,轉換成機器人關節和機械手能夠執行的軌跡。
還有一個經常被忽略的問題是視覺視角。第一人稱數據理想情況下應盡量接近人的視覺位置,但不同採集設備可能被安裝在頭部、胸前或其他位置。而視角變化,會明顯改變手、物體和攝像頭之間的空間關係,這些差異對於需要學習三維空間和操作關係的機器人模型而言是很大的挑戰。
因此,在Chris看來,真機、仿真和第一人稱數據並不存在簡單的替代關係。它們各自解決不同問題,真機保證了精度,仿真負責放大規模,人類視頻提供真實世界的場景多樣性。未來的機器人數據體系,更可能是不同數據來源之間的組合與互補。
此外,近期一些研究也開始弱化對「最優數據」的單一追求。Dyna Robotics最新發布的Dyna-2僅依靠超過100萬小時人類第一人稱視頻進行預訓練,就觀察到了從人類行為數據向機器人能力遷移的規模效應。Axis的研究也表明,經過篩選和處理的仿真軌跡同樣能隨著數據規模擴大持續改善模型表現。
相比單純追求單條數據與目標本體的高度匹配,規模、多樣性以及能否真正轉化為模型能力,正在成為重要指標。因此,機器人數據公司很難只靠單一採集方式滿足模型持續變化的需求。這也指向了一個更核心的問題:數據公司究竟只是按照客戶要求完成採集和處理,還是應該更深入地參與模型訓練所需數據的設計與生產?
Axis選擇的是後者,並將自身定位為「Physical AI數據引擎」。在Chris看來,「數據標註」和「數據生產」並不是同一層次的業務。
數據標註面對的是已經存在的數據,客戶決定標什麼、怎麼標,服務商負責按照規則執行;數據生產則需要更進一步,數據公司不僅要完成採集和處理,還要參與判斷模型究竟缺什麼數據,並圍繞訓練目標設計任務、組織採集,再根據模型表現調整下一輪數據。
例如,一個機器人模型要學習廚房操作,數據公司需要進一步判斷應該設計哪些任務,抓、推、拉、開、關等基礎動作如何組合,是否需要深度信息,攝像頭如何佈置,以及哪些失敗案例值得被重點採集。
Chris表示,Axis與Booster Robotics、擎羽科技等客戶的商業合作已由單純的數據交付升級為「圍繞模型訓練目標定制的數據生產方案」。例如在與Booster Robotics的合作中,Axis為Booster T1量身定制了深度適配其視覺輸入與動作空間的專屬基礎模型(Foundation Models)。這種模式支持特定任務在極少樣本下的快速遷移與迭代,從而極大降低了具身智能開發的門檻與工程適配成本。
這也是Axis強調「數據引擎」而非「數據工廠」的原因。按照Chris的描述,商業客戶可以先提出目標場景和能力需求,Axis再據此設計任務,並通過分佈式貢獻者網絡完成數據採集。
「除了向客戶交付數據,AXIS也在自己做數據集和模型驗證的學術研究。」Chris稱,Axis 團隊於上半年發布的 AXIS Franka 數據集是目前針對 Franka Research 3 機械臂規模最大的開源機器人操作數據集之一,包含 207 個多樣的操縱任務,超 5 萬條人類演示軌跡以及逾 6 萬個任務場景變體。
在訓練成果評估階段,研究團隊利用該數據集對最先進的VLA模型 π 0.5 進行了持續預訓練。實驗結果顯示,通過 AXIS-100% 數據快照訓練後的模型在 LIBERO-Plus 魯棒性基準測試中表現出色,整體成功率達到了 88.8%。
Chris還表示,AXIS Franka 數據集在提升模型應對現實干擾方面的顯著效果:在傳感器噪聲和相機視角偏移等挑戰下,模型的魯棒性分別提升了 13.7% 和 11.3%。其研究證實,隨著數據集快照從 25% 增長到 100%,模型的操縱泛化能力呈現出穩定的擴展趨勢,展現了數據規模與下游任務泛化能力之間的正向擴展關係。
機器人數據仍然是一個快速變化、尚未形成穩定範式的市場。
過去一段時間,行業關注點從真機遙操作逐步擴展到仿真、第一人稱視角等數據來源。隨著基礎模型進入更深入的後訓練階段,如何收集失敗狀態、糾錯過程和恢復軌跡,也開始成為新的數據需求。
「如果今天市場最需要第一人稱視角數據,我就只做第一人稱視角;半年以後大家不需要了怎麼辦?」因此,Chris不願意把Axis定義成一家只做某種數據的公司。
他的思路,是把相對穩定的底層能力與不斷變化的數據採集方式拆開。底層由分佈式貢獻者網絡、任務管理、數據驗證、清洗、增強和處理管線等基礎設施組成;上層則根據模型和客戶需求,接入不同的數據產品和採集方式。
目前,Axis已經從網頁端仿真數據採集切入,並逐步拓展到第一人稱視角數據和模型後訓練。Chris介紹,最新產品已經加入針對模型偏差和失敗狀態的糾錯數據採集,團隊已在推進 DAgger 等後訓練數據採集與處理,計劃年底前發布首個大規模 Human-Gated DAgger 後訓練數據集。
在他看來,隨著機器人模型持續迭代,數據合作夥伴的價值也會發生變化。衡量一家數據公司的能力,不能只看一次能夠交付多少數據,更要看其能否穩定生產高質量數據,是否擁有持續運轉的貢獻者網絡和數據處理工具,以及能否根據模型表現及時調整下一輪數據的內容和結構。
這種思路在一定程度上借鑒了Scale AI和Surge AI的發展路徑,其中Chris尤其關注Surge AI。他希望Axis未來能夠成為「機器人領域的Surge AI」。
在Chris看來,Surge AI的優勢並不只是擁有大量數據標註資源,而在於其業務始終緊跟模型需求變化,從大模型後訓練進一步延伸到智能體訓練環境等新環節。
這種不把自己綁定在某一種數據形態上,而是隨著Physical AI模型的訓練方式變化,持續調整所提供的數據和工具,正是Axis真正希望複製的能力。
與其它競品不同的是,Axis身上還有一個相對特殊的標籤------區塊鏈。
機器人數據的生產過程本身並不需要區塊鏈,仿真仍然運行在傳統機器人環境中,模型訓練也和其他AI公司沒有區別。區塊鏈真正發揮作用,主要出現在數據產生之後:Axis會為經過驗證的數據軌跡建立數據ID,並將任務、數據和貢獻者之間的關係記錄到Base上。
Chris表示,區塊鏈技術主要解決兩個問題。
首先是貢獻激勵。當數據由全球分佈式用戶生產時,不同用戶完成的數據數量和質量都不同。平台需要知道是誰貢獻了什麼,以及這些數據有沒有真正達到要求。對貢獻者來說,核心不在於做得多,而是誰提供了真正有效的數據。
其次來源追蹤。當前AI模型的訓練過程很像黑箱。外界通常只看到最終模型,卻很難知道某項能力究竟來自哪些數據,這些數據又是誰生產的。如果任務、軌跡和貢獻者的關係可以被持續記錄,那麼一條數據未來被客戶採購時,至少可以保留相對完整的來源記錄。
Axis目前已經上線積分體系,用於記錄和衡量用戶貢獻。Chris還提到,如果未來發行代幣,貢獻積分可能成為激勵依據;如果某位貢獻者的數據最終實現商業化,公司也考慮未來讓其參與收入分成。
不過,這些機制目前仍處於設計和完善階段。相比先構建一套代幣經濟,再為其尋找應用場景,Chris更強調先確定區塊鏈究竟能夠解決哪些實際問題。
「我從來沒有覺得自己是一家加密機器人公司。」
在他的定義裡,Axis首先是一家機器人數據公司,區塊鏈如果能夠幫助解決貢獻激勵和數據來源追蹤,就在這些環節使用;如果不能產生實際價值,也沒有必要為了「Crypto+AI」的敘事額外引入。
對於未來6至12個月的發展,Axis的路線圖主要集中在產品、社區增長和商業化三個方向。
產品層面,Axis計劃繼續擴充第一人稱視角數據的採集規模,並新增 UMI 數據和面向移動操作任務的遙操作數據,進一步擴大平台覆蓋的數據類型和任務範圍。
除了面向普通用戶的數據採集入口外,Axis還計劃向企業客戶和開發者提供任務生成API及數據處理工具,將部分底層的數據生產能力進一步產品化。
社區增長則是另一項重點。Chris表示,Axis希望在未來半年將社區規模擴大至目前的3倍,並進一步拓展不同區域市場。參與者也不再局限於普通數據貢獻者,而是希望吸引更多開發者、研究人員和產業從業者加入,將平台逐步擴展為一個圍繞Physical AI數據生產的開放生態。
商業化方面,Axis目前已在部分細分領域獲得標杆客戶,仿真數據和第一人稱視角數據也已經產生付費訂單。未來半年,公司為自己設定的目標是將年經常性收入(ARR)提升至50萬至100萬美元,並進入頭部機器人模型公司的供應商名單。
相比收入數字本身,進入頭部模型公司的供應體系或許更能檢驗Axis當前這套模式。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。





























![[獨家] 海外虛擬貨幣交易所國內「搜尋不可」...谷歌65個、蘋果56個](/public-static/22_d448f7b258.png?format=avif)