![]()
“本體告一段落,具身智能進入“數據時刻”?
6月13日,北京智源大會。
五位百億估值的具身智能公司CEO,坐在同一張桌子上。整場討論只有一個問題沒有分歧——數據。
不是融資節奏,不是本體成熟度,不是模型路線,是數據。
這個共識來得并不輕松。過去兩年,行業花了大量時間爭論“人形還是非人形”“VLA還是世界模型”,但當大家坐下來直面現實時,發現所有爭論的前提都被同一件事卡住了:沒有足夠多、足夠好的數據,以上一切都不成立。
但比“數量不夠”更隱蔽、也更拖效率的,是另一個問題——大量已經被采集到的數據,仍然無法直接用于訓練。原始視頻到訓練就緒之間,隔著漫長的工程鏈路:清洗、對齊、標注、質檢、格式轉換,每個環節都可能卡住。
行業不缺原始素材,缺的是把原始素材變成“訓練就緒”數據的工程能力。
高質量數據
已成具身智能的關鍵瓶頸
智源大會上,嘉賓們的判斷高度一致:算力和參數不是當前最缺的,模型架構固然重要,但在數據嚴重缺乏的情況下,架構意義有限。當前真正的瓶頸,是高質量、可擴展的核心態數據。
這個判斷首先建立在數量困境之上。
一組數字說明問題的嚴重性:全球高質量真實物理交互數據總量僅約50萬小時,而訓練通用具身智能模型需要千萬小時起步。50萬小時對千萬小時,差了一個數量級。
芯片可以多買,模型可以重訓,但物理世界的真實交互數據只能一分一秒地采集。沒有大規模、高質量的真實物理數據,通用具身智能就永遠停留在Demo階段。
![]()
為了理解這個困境的深層結構,需要拆開來看三個層面。
第一道墻:采集本身就很貴、很慢。
Ego-centric第一人稱視角數據,是具身智能最核心的訓練素材。它和機器人頭部感知高度一致,天然具備“第一人稱”的視覺分布。
但真機遙操作采集面臨三重限制:量產能力不足,造不出足夠多的機器人同時采數據;單臺設備昂貴,每采集一小時數據都要占用一臺高成本硬件;場景部署成本高,如果要做家庭場景數據,需要把笨重設備運到用戶家中。這些限制疊加在一起,導致高質量真機數據的產能極低。
行業已經在探索替代路徑——人手采集、觸覺手套、頭戴設備——但這些方案本身也處于早期,采集效率和數據質量仍在驗證中。每一種路徑都有其局限性,目前還沒有任何一種方案能夠單獨解決數據供給問題。
第二道墻:工具鏈高度碎片化。
傳統數據服務商的工具鏈各自為政。采集用一套工具,標注用一套,質檢用一套,格式轉換和訓練對接又是另一套。數據在不同環節之間流轉時,標準不統一、格式不兼容,大量時間被消耗在“把A工具的輸出變成B工具的輸入”這件事上。
而具身智能數據對時序對齊、因果關聯的要求,比傳統CV數據高得多。一段第一人稱操作視頻,手部動作和相機視角變化必須精確同步,語言指令和動作片段必須精準匹配。這意味著即便只是簡單的格式轉換,也可能因為時間戳錯位導致整段數據失效。
第三道墻:工程成本失控。
由于外部工具鏈不完整,模型訓練團隊被迫自行搭建數據管線。從原始視頻導入開始,到清洗、對齊、標注、質檢、格式轉換,最后導出為訓練框架能讀取的格式,整個流程高度依賴內部工程能力。這不是算法問題,是工程問題——而且是一個極度消耗人力和時間的工程問題。
有業內人士估算,這部分成本有時是數據采集本身的3到5倍。花1塊錢采數據,可能要再花3到5塊錢讓它變得“能用”。更隱蔽的代價是時間,算法團隊的大量精力被消耗在數據處理上,真正用于模型迭代的時間被嚴重壓縮。
數量不夠、工具鏈碎片化、工程成本失控——三重困境疊加在一起,形成了行業當前的尷尬局面:一方面大家都在喊“數據不夠”,另一方面大量已經采集的數據躺在硬盤里,離“能訓練”還有很長的路。
那怎么來解決這些問題呢?
數據“用不上”的難題
有了一條新解法
上面提到的三重困境——采集成本高、工具鏈碎片化、工程成本失控——行業并非無動于衷。
事實上,過去一年已經有不少公司在嘗試突破。
一批具身智能創業公司在探索數據采集的新路徑,有的試圖用低成本人手采集替代真機遙操作,給人發一雙手套或一個頭戴攝像頭,就能在家里采集操作數據;有的押注觸覺、力覺等多模態數據,希望為模型提供更豐富的物理信號;還有的選擇退回到更務實的路線,不追求通用數據,而是在某個垂直場景中打透,形成數據閉環。
但這些探索目前都還處于早期,采集效率和數據質量仍在驗證中。
就在這個節骨眼上,一條新的解法出現了——不是從采集端發力,而是從數據處理端入手。
6月22日,如祺出行旗下的“如祺數據”發布了一個具身智能數據平臺。它專注解決一件很具體的事:把Ego-centric第一人稱操作視頻,自動化地處理成模型可以直接使用的訓練數據。
如祺出行不是新玩家。這家出行服務公司早在2023年就開始布局全鏈路AI數據服務,此前在智能駕駛領域已完成能力驗證——客戶含小馬智行、理想、騰訊,2025年技術服務營收1.6億元,同比增長487%。
它的核心能力,除了憑借每年數億單打車需求積累的大量高價值、多模態真實出行場景數據外,還有“長期處理真實物理數據的工程方法論和基礎設施”。這套能力在智能駕駛領域已經跑通,現在被延展到了具身智能場景,目標是通過將數據處理過程標準化、自動化、可追溯,降低Ego-centric數據處理的邊際成本。
具體來看,這套數據平臺的核心,是一條覆蓋從導入到導出的全鏈路自動化流水線。
![]()
導入環節,平臺支持兩種模式:直接上傳已有預處理結果,或僅上傳原始MP4由后臺自動處理。上傳與算法執行解耦,團隊無需在本地維護復雜依賴環境。
![]()
AI預處理環節是整條流水線的技術核心。原始視頻依次經過三個階段:手部檢測——從單目圖像中恢復3D關鍵點與手部形狀;相機位姿估計——輸出連續準確的6DoF運動軌跡;手部3D姿態優化——將手部運動從相機坐標系映射到世界坐標系,最終輸出結構化的手部運動軌跡。
![]()
這三個階段解決的核心問題是:把晃動、遮擋、視角受限的原始視頻,變成在三維空間中可量化、可編輯的手部運動數據——這是從“原始素材”到“結構化數據”的關鍵一跳。
動作標注環節,平臺面向的是具身模型特有的需求:帶自然語言指令的連續動作序列,而非靜態目標框選。標注工作臺將當前幀及未來20幀的腕部軌跡投影到圖像上,幫助標注員提前感知手腕運動趨勢,精準判斷動作邊界。
審核質檢環節,系統自動生成五維質檢報告:切片完整性、手部檢測質量、相機軌跡質量、語義一致性、樣本分布均衡性。異常區域被自動高亮,審核員不再需要逐幀檢查。實測表明,單條視頻審核時間壓縮50%。
導出環節,平臺支持多種輸出格式——訓練框架原生格式(LeRobot、HDF5)、通用交換格式(JSON)、機器人中間件格式(ROS 2 MCap)。從標注完成到開始訓練,中間不需要再做任何格式適配工作。
這條流水線的價值在于:過去需要多支團隊、多套工具、數周時間才能走完的流程,被壓縮成了一條可追溯、可質檢、可規模化的管道。
![]()
簡而言之,如祺出行這套新解法,就聚焦在從采集到訓練就緒之間的關鍵數據工程環節。這也是顯示,面對具身智能數據困境,行業已逐步從“死磕采集”開始轉向思考如何從采集、處理、審核、標準化、輸出等全鏈條提升已有數據的“可用性”。
數據基礎設施
正在成為隱形戰場
從智源大會的討論來看,行業正在發生一個明確的轉向。
這個轉向背后的邏輯是,當硬件能力逐漸趨同,決定智能水平上限的是“具身大腦”的質量,而大腦的進化只能靠數據喂養。
頭部公司已經開始行動,10萬小時、100萬小時、千萬小時甚至上億小時的數據目標被相繼提出。這個節奏部分來自自動駕駛行業的路徑驗證——自動駕駛中,10萬小時可以訓練出可用模型,百萬小時接近較成熟狀態,千萬小時則用于突破長尾場景。具身智能的任務復雜度遠高于自動駕駛,對數據的需求只會有過之而無不及。
與此同時,數據形態和采集方式正在多樣化。核心邏輯正在從“越多越好”轉向“有效數據+場景匹配”,不是籠統地追求數據總量,而是在具體可落地的場景中持續積累高質量數據。
但無論走哪條路徑,都指向同一個結論:“萬臺落地”需要數據基礎設施先行。
6月9日,工信部與國資委聯合啟動專項行動,目標是年底推動“萬臺級規模落地”。萬臺機器人同時運行,意味著每一臺都需要模型驅動,而模型迭代需要源源不斷的訓練數據。這不是一次性的數據采集能解決的,而是需要持續運轉的數據生產管線,需要標準化的處理流程、自動化的質量控制和規模化的交付能力。
對于已沉淀出面向真實世界復雜數據的工程經驗,具備構建全鏈路AI數據服務能力的數據服務商而言,這無疑提供了一個巨大的機會,讓類似如祺出行這樣的公司可以加快將其物理AI數據能力,從智能駕駛等領域外溢至高增長的具身智能賽道。據接近如祺出行的人士透露,公司已在具身智能領域獲得商業化訂單。
寫在最后
回到智源大會那個圓桌。
五位CEO的共識是:數據是最大瓶頸。但如果我們把目光拉長,會發現這個判斷背后藏著一個更底層的邏輯。
每一次技術范式的轉移,都會經歷一個從“模型崇拜”到“數據覺醒”的過程。
互聯網時代,人們相信算法推薦可以解決信息過載,后來才發現用戶行為數據才是推薦系統的真正護城河。自動駕駛早期,行業沉迷于規則引擎和感知算法,直到Waymo和特斯拉用數十億英里的真實路測數據碾碎了所有“聰明算法”的優越感。大語言模型的爆發,本質上是Scaling Law的勝利,是海量文本數據堆積出來的涌現智能。
每一次,都是數據笑到最后。
具身智能正在進入這個拐點。本體已經階段性成熟,接下來是數據工程的漫長戰爭。日復一日的數據采集、清洗、標注、對齊,這些看似不性感的“臟活”,最終構成了具身智能行業必不可少的基礎設施。
歷史反復驗證了一件事:所有偉大的進步,最終都取決于那些最不起眼的基礎設施。電網、公路、通信基站、云計算,沒有這些“無聊”的東西,再聰明的算法也只是空中樓閣。
數據基礎設施,就是具身智能時代的電網。
當一萬臺機器人在真實場景中穩定作業時,人們不會記得是誰鋪設了第一條數據管道。但那個提前把管道鋪好的人,早已拿到了下一階段的門票。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.