![]()
“WAIC 2026:Physical AI興起,數據基礎設施成新戰場。
今年WAIC,一個直觀的變化是:展區里滿屏大模型演示屏變少了,取而代之的是大量實體機器人、機械臂、自動駕駛模擬器在"真動真干活"。
Physical AI,成為本屆大會的高頻詞。從開幕式主旨演講到各個分論壇,幾乎每一場都在討論"AI如何進入物理世界"——具身智能、自動駕駛、智能機器人,這些概念不再是遠景,而是正在發生的事實。
![]()
但細逛一圈會發現一個有意思的反差:展示概念的多,展示"能力底座"的少。 機器人在秀技能,大模型在秀理解力,但很少有人講清楚,這些東西是怎么訓練出來的?
一個核心追問浮出水面:AI學會了"思考",但它怎么學會"動手"?
這個問題,恰恰指向了Physical AI時代最底層、也最被忽視的一層——數據基礎設施。
Physical AI時代
為什么“數據基建”成了新戰場?
要回答這個問題,得先搞清楚Physical AI到底意味著什么。
過去十年,AI的核心能力是"看懂世界"——識別圖片、生成文本、推薦內容,這是數字世界的AI。它的本質是從海量互聯網數據中學習模式,完成信息層面的理解和生成。
而Physical AI的本質,是讓AI從"數字世界的觀察者"變成"物理世界的執行者"。具身智能、自動駕駛、智能機器人,都是Physical AI的典型形態。這些智能體需要在真實物理環境中感知、決策、執行,完成從"理解"到"行動"的閉環。
正如博登智能創始人趙捷所說:"AI正在從數字世界走向物理世界。"
前者是"看懂世界",后者是"動手改變世界",難度不在一個量級。
![]()
Physical AI對數據提出全新要求
為什么難度不在一個量級?因為數據的需求變了。
大模型時代的訓練數據,主要來自互聯網。文本、圖片、視頻,這些都是現成的、可批量獲取的。但Physical AI需要的是帶物理交互信息的數據:動作軌跡、力覺反饋、時序邏輯、物理約束……這些數據互聯網上沒有現成來源,必須到真實世界中去采集。
更關鍵的是驗證環節。
數字AI的驗證靠測試集跑分,準確率達標就算過關,但Physical AI的驗證必須放在真實環境中。仿真器跑得通,不代表真實機械臂能抓穩。真實世界存在無數仿真無法建模的變量:摩擦系數、光照變化、物體形變、意外干擾……
當前Physical AI數據基礎設施的三大痛點
更具體一點,行業目前有三個痛點最為突出:
真實場景數據無法規模化生產。
Physical AI訓練,需要大量真實環境下的交互數據。但采集這些數據需要場地、設備、機器人、人力,成本極高。
以具身智能為例,一臺機器人在真實場景中采集一小時有效數據,背后涉及場景搭建、設備調試、操作錄制、數據校驗等一系列復雜流程。大多數企業只能做到"小規模定制采集",無法形成規模化供給能力。因此,行業普遍面臨"數據饑渴"。
數據處理工業化程度低。
有了原始數據還不夠,必須將其轉化為模型可用的訓練資產,這就需要進行標注、清洗、對齊、結構化。
傳統數據標注模式依賴大量人工,面對視覺、力覺、時序等多模態數據,效率低、誤差大、標準不統一。一個復雜的4D點云標注任務,可能需要數小時的人工處理。數據生產還停留在"手工作坊"階段,完全跟不上模型迭代的速度。
模型驗證缺乏系統性機制。
行業普遍過度依賴仿真測試,但仿真環境是"理想化"的——光照完美、物理參數可控、場景可重復。但是,真實世界充滿了仿真無法窮舉的變量。缺乏系統性的真實環境驗證體系,導致模型一旦部署到現實場景就"水土不服"。
這三個痛點層層遞進:沒有規模化的數據來源,就沒有高質量的訓練素材;沒有自動化的處理能力,數據就無法高效轉化;沒有系統性的驗證機制,模型就始終停留在"實驗室階段"。
這三個痛點指向同一個結論:Physical AI的規模化發展,亟需一套專門為其打造的數據基礎設施體系。
這套體系至少要回答三個問題:數據從哪里來?數據怎么高效生產?模型怎么驗證才可靠?
如果說算力基礎設施是Physical AI的"發動機",模型基礎設施是"方向盤",那么數據基礎設施就是連接AI與真實世界的"高速公路"。沒有這條路,再好的車也開不進現實世界。
那么,誰在修這條路?
博登智能,為Physical AI鋪設
"實景高速路"
在這次的WAIC,我們關注到博登智能這家公司,就在做這樣一件“修路”的事情。
在WAIC 2026的"Boden Physical AI Lab"展區,博登智能展示的并非某個單一產品,而是一整套面向Physical AI的數據基礎設施能力體系。展區被命名為"沉浸式體驗實驗室",這個命名本身就在傳遞一個信號:它展示的不僅是技術,更是一套可供行業直接使用的完整能力。
![]()
這家公司2019年成立于寧波,總部位于浙江,目前已獲評國家級專精特新"小巨人"企業,完成數億元A+及A++輪融資,并已構建覆蓋具身智能、大模型與自動駕駛三大領域的客戶生態,與國內外頭部企業、科研機構及主流車企達成深度合作,形成多層次、高壁壘的產業布局。
博登智能做的事情,可以理解為:為AI進入物理世界修建"高速公路",包括采集真實世界數據的"路網"、加工數據的"工廠"、以及檢驗模型是否可靠的"質檢站"。
具體怎么修?博登給出了三條清晰的路徑。
構建真實世界場景網絡,解決"數據從哪里來"
Physical AI需要真實場景數據,但行業普遍缺場地、缺設備、缺規模化采集能力。
博登的解法是:在寧波、湖州、馬鞍山,博登建成了三大具身機器人創新中心,總面積超過3萬平方米,覆蓋家庭、零售、工業、辦公、倉儲等上百類真實應用場景。目前,三大中心部署了超過500臺多型號實體機器人,以及數千套自研Ego數據采集設備。年產50萬小時真機訓練數據、百萬小時級Ego場景數據,實現了真實世界數據的規模化穩定供給。
![]()
規模和產能,是這道題最難的部分,也是博登最深的壁壘。
有了數據來源,下一個問題接踵而至:這些原始數據如何高效地轉化為模型可用的訓練資產?
全自動化數據引擎,解決"數據怎么高效生產"
博登自研了BRIC數據采集平臺、BASE數據標注平臺、Blink數據基礎設施平臺三大核心平臺,形成從采集、治理、標注到交付的全自動化流水線。平臺深度融合多模態大模型與智能體能力,內置超過200個自動化預標注模型。
據測算,借助這套系統,數據生產效率提升7倍,綜合交付準確率超過99%,成本降低約40%。
什么是"自動化預標注模型"?簡單說,就是讓AI先對原始數據做一輪初步標注,再由人工進行校驗和修正。這套"自動預標注+人工校正"的協同流程,將大量重復性、標準化的工作交給機器,讓人只做最關鍵的質量把控。
現實世界驗證體系,解決"模型敢不敢真部署"
如果說前兩個能力是"生產數據",那么第三個能力就是"檢驗模型",這是博登最值得關注的核心能力。
博登率先構建了現實世界驗證體系,圍繞真實場景行為一致性、時序邏輯一致性、物理規則約束、長尾場景魯棒性四大維度,對模型進行系統性的真實環境評估。
這套驗證體系的價值在于,它不是簡單地"把模型放到真實環境里跑一遍",而是針對Physical AI最容易出問題的環節進行了定向設計。比如時序邏輯驗證,解決的是"模型在連續動作中是否保持一致性"的問題;物理規則驗證,解決的是"模型的決策是否違反物理約束"的問題。每一個維度,都對應著真實部署中的一類常見故障。
效果是什么?其最大的價值,是讓模型從"可訓練"走向"可部署、可穩定運行"。
三塊能力各自獨立又相互支撐,但它們真正的價值在于"協同"。這就需要一個統一的平臺將它們整合起來,形成系統化的輸出能力。
Boden Cloud統一平臺輸出全鏈路能力
博登通過Boden Cloud統一平臺,將數據采集、治理、標注、訓練、驗證全鏈路進行云化、標準化、工程化封裝,實現一站式交付。
客戶不需要分別對接多個系統,不需要自己搭建采集管理平臺、不需要單獨部署標注工具、不需要自研驗證框架。通過一個平臺,即可調用從數據采集到交付的全鏈路能力。
有了平臺化的能力輸出,博登的布局不止于技術和產品層面,還在向產業生態的上游延伸。
既在"做事",也在參與"定規則"
在產學研協同上,公司聯合均普智能、上海交通大學MINT實驗室開源了RW-RL-Dataset數據集,包含超過1000小時的真實機器人強化學習數據,為全球具身智能研究提供關鍵基礎設施支撐。這是持續構建行業影響力、推動數據共享生態建設的長期布局。
在標準引領上,博登智能已參與20余項國家及行業標準制定,并牽頭建設浙江省高端數據標注基地試點項目。從"技術提供者"到"標準制定者",這是一家基礎設施企業在產業演進中的必經之路。
梳理完博登的整體能力體系,我們還需要回答一個更大的問題:這套數據基礎設施到底有多大的產業價值?它的市場空間究竟有多大?
夯實數據基礎設施
打開Physical AI的"天花板"
Physical AI數據基礎設施的價值,可以從三個場景來理解:
具身智能需要真實環境交互數據,來訓練機器人的操作技能。沒有高質量的真實數據,機器人在實驗室里再聰明,到了真實場景也無法穩定工作。
大模型正在從"文本世界"向"多模態世界"拓展,需要跨模態真實數據,來提升對物理世界的理解能力。數據的質量和多樣性,直接決定了大模型在現實場景中的泛化能力。跨模態數據的治理、對齊和標注,是模型能力躍遷的關鍵基礎設施。
自動駕駛需要海量道路場景數據,尤其是長尾事件覆蓋。真實道路數據的規模和質量,決定了自動駕駛系統的安全上限。
這三個領域看似不同,底層依賴的卻是同一套能力,也就是真實世界數據基礎設施。
它是Physical AI產業落地的"最大公約數",任何一個領域的突破,都需要這套能力作為前提。
AI第三大核心產業層正在形成
此外,從產業演進的角度看,AI基礎設施經歷了清晰的遞進:
·第一層:算力基礎設施——芯片、云計算,解決"算得動"的問題
·第二層:模型基礎設施——大模型平臺、開發工具,解決"用得上"的問題
·第三層:數據基礎設施——真實世界數據生產、治理、驗證,解決"訓得好、落得穩"的問題
正如行業分析所指出的:"真實世界AI基礎設施,是繼算力基礎設施、模型基礎設施之后,AI產業的第三大核心產業層。"
每一層都對應著巨大的市場空間,而Physical AI數據基礎設施這個市場,才剛剛開始形成。
為什么是說這個市場的發展空間巨大?因為這不是一次性的交易,而是伴隨產業全周期的持續性需求。只要Physical AI在持續演進,就需要源源不斷的真實世界數據輸入和驗證反饋。
三大賽道(具身智能、大模型(包括相關的Agent應用)、自動駕駛)產業化進程加速,對數據基礎設施的需求是持續性剛需。
但具備規模化真實場景網絡、全自動化數據引擎、現實世界驗證體系綜合能力的企業,全球范圍內都極為稀缺。
為什么稀缺?
因為這三種能力分別對應著不同的能力基因:場景網絡需要重資產投入和工程化能力,數據引擎需要AI技術和自動化能力,驗證體系需要系統化測試和質量保障能力。能夠同時具備這三種能力的團隊和企業,本身就是極小概率事件。
博登搭建的場景網絡、自動化數據工程體系、全維度真實場景驗證能力,構成了稀缺的核心產業資源。
這是一個"需求高速增長、供給高度集中"的賽道,資源向頭部集中的趨勢會越來越明顯。
物理AI的“登月時刻”
才剛剛開始
回望信息技術演進史,每一個重大時代更迭,都伴隨著基礎設施的重構。
互聯網時代,人們先鋪光纜、建數據中心,然后才有了電商、社交、云計算。移動互聯網時代,先有智能手機普及和4G網絡覆蓋,然后才跑出了滴滴、美團、TikTok。AI時代也不例外——先有GPU集群和云計算撐起的算力層,有大模型平臺構成的模型層,然后,輪到數據基礎設施了。
這不是巧合,是規律。
每一輪技術變革,都是從“底層基建”開始的。先修路,再跑車。先建發電廠,再普及電器。先鋪設通信網絡,再誕生應用生態。物理世界的基礎設施建設邏輯,在數字世界同樣成立——甚至更加苛刻,因為AI不僅需要“連接”,還需要“感知”和“行動”。
Physical AI時代的數據基礎設施,本質上是在做一件前所未有的事:把真實世界“翻譯”成AI可以理解的語言,再把AI的決策“執行”回真實世界。
這件事的難度,不亞于當年人類第一次把代碼寫在紙上、第一次用二進制與機器對話。
Physical AI的“登月時刻”,不是機器人第一次在實驗室里完成演示的那一刻,而是它能夠在真實世界中穩定運行、規模化部署、被千行百業信任和依賴的那一天。
那一天還很遠,但路已經有人在鋪了。
文:月滿西樓數據猿
責編:凝視深空數據猿
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.