七個月前,在CES現場,專業記者們追著問的還是:這臺機器人用了什么模型?多少自由度?價格多少?
七個月后,當機器人大講堂編輯部再次走進WAIC具身智能展館,發現整個行業已經換了一套語言。
展臺上,大家嘴里反復出現的,是另一批詞:部署態、WRAM、VLA、WBI、全棧閉環....有些詞我們甚至都覺得很陌生。
而且有意思的是,這些詞半年前幾乎沒人提,到了今年,它們卻迅速成為行業“黑話”。
如果說每一年機器人行業都會誕生一些新概念,那么2026年的特別之處在于,可能這些新詞,不再只是學術以及營銷概念,而是在描述機器人真正開始進入產業化的新階段。它們共同記錄著一個行業,從論文逐步走向技術棧,從Demo走向真實部署的全過程。
于是,我們分四個板塊,梳理了2026年前8個月機器人行業最值得關注的22個關鍵詞,希望通過這份"熱詞圖鑒",幫助大家讀懂這半年來的機器人與具身智能。
![]()
01.
機器人大腦篇:從VLA到WBI,到底升級了什么?
如果說今年行業哪一類熱詞更新最快,那么一定是“具身大腦”。僅僅半年時間,從VLA、WBI、WRAM,到世界模型,再到,幾乎每隔幾個月,行業都會誕生一個新的技術概念。對于很多不在一線接觸具身智能的人來說,這些縮寫越來越多,也越來越難懂。但實際上,機器人大講堂認為,它們并不是彼此替代的關系,而是在不斷回答同一個問題:機器人,究竟應該怎樣思考?沿著這條問題,我們也可以讀懂2026年機器人大腦的發展路線。
(1)為什么WAIC之后,大家都在討論全身智能(WBI)?
今年WAIC結束后,一個此前并不算大眾熟悉的概念迅速進入行業視野——WBI(Whole-Body Intelligence,全身智能)。相比VLA、世界模型這些已經討論了一兩年的技術路線,WBI更像是一次新的思考方式。它沒有聚焦某一個模型,而是試圖重新定義機器人的整個智能系統。
它到底是什么?按照【源策未來Archon Robotics】創始人李弘揚在RSS 2026 Early Career Talk提出的定義,WBI并并非單獨的推理決策或者執行大模型,而是一套系統級預訓練范式。過去,人們往往把具身智能拆分級架構,但本質還是大腦負責理解任務,控制器負責運動,末端負責感知,最后再把這些能力拼接起來。而WBI希望做的,是從訓練開始就把這些能力放到一起學習。
它將機器人智能劃分為四層能力棧:S2任務語義理解;S1人形基礎能力(身體先驗);S0.5:意圖到全身運動生成(UTC);S0:實時平衡、接觸與控制。
換句話說,在這套框架下,機器人學習的不只是"怎么抓住杯子",而是同時理解為什么抓、怎樣抓、抓住以后身體如何配合。過去幾年,機器人行業最大的爭議之一,就是"腦子越來越聰明,身體卻跟不上"。大模型會思考,卻不會控制身體;運動控制越來越成熟,卻缺少高級認知。WBI希望解決的,正是這種"腦身分離"的問題,把認知、身體和環境真正統一起來。
但與其說是新技術路線,不如說WBI真正提出的,是一種新的目標,也就是未來機器人應該先擁有一個聰明的身體,才能更好落地。
(2)世界推理動作模型(WRAM):機器人不僅要理解世界,還要推演世界
如果說WBI討論的是機器人最終應該長成什么樣,那么智元機器人CTO姚卯青在WAIC 2026智啟具身論壇所提出的WRAM回答的,則是機器人今天應該如何思考。今年WAIC期間,智元提出的WRAM(World Reasoning Action Model,世界推理動作模型)這一概念熱度非常高,迅速成為論壇和媒體討論的焦點。
它到底是什么?簡單來說,WRAM是在VLA與世界模型基礎上的融合架構。
其中,VLA負責理解語言、視覺和任務語義;世界模型(WAM)負責預測物理世界未來的狀態;WRAM則試圖把理解與推理統一起來,讓機器人能夠邊理解任務、邊預測結果,再完成動作執行。
如果打一個比方,VLA像一位會看地圖行動的老司機;世界模型像一位能夠提前預判路況的老司機;而WRAM,則希望讓機器人成為既會看導航,又會根據實時路況靈活調整路線的駕駛者。
相比提出一個新的縮寫,WRAM更大的意義在于,它回應了今年行業爭論最激烈的話題——VLA會不會被世界模型取代?智元給出的答案是融合。其認為,機器人真正需要的,不只是那條技術路線,而是如何更好理解世界、預測世界,這就需要把兩種能力統一起來。
WRAM最大的意義,不在于發明了一種新架構,而是在告訴行業:未來機器人的競爭,不再是誰理解得更多,而是誰能夠預測得更遠。
(3)世界模型(WAM):機器人開始擁有“預判能力”
如果說WBI代表著機器人大腦未來的發展方向,那么世界模型(World Model,或World Action Model)則是今年推動整個行業快速升級的核心技術之一。
事實上,今年上半年,世界模型幾乎成為所有機器人大會繞不開的話題。從ICRA到WAIC,從智元的Genie Envisioner-Sim 2.0,到它石智航將整條線束裝配場景搬進展臺,再到蘇度展示基于純仿真的零樣本抓取能力,越來越多企業開始把世界模型視為下一階段具身智能的重要底座。
它到底是什么?簡單來說,世界模型就是讓機器人在真正行動之前,先在"腦海里"完成一次推演。過去,大多數機器人看到一個杯子,只知道"抓住它"。但世界模型會進一步思考,如果從這個角度抓,會不會碰倒旁邊的瓶子?杯子會不會滑落?抓起來以后,該往哪里放?這個過程,本質上是在模擬現實世界未來可能發生的一系列物理變化,包括重力、摩擦、碰撞、形變以及物體之間的相互作用。
如果用一個生活化的比喻,VLA像是在回答一道選擇題,而世界模型更像是在做一道推演題。它不只是告訴機器人“應該怎么做”,更重要的是提前預測“做完之后會發生什么”。
WAM概念爆火的原因很簡單。過去幾年,大模型已經讓機器人擁有了一定的理解能力,但機器人真正走進工廠后,一個新的問題暴露出來,那就是理解,不等于會干活。因為現實世界遠比互聯網上的一張圖片復雜。工件可能發生偏移,桌面可能突然多出一個障礙物,零件可能因為摩擦產生細微變化……
這些都需要機器人實時預測,而不是照著固定動作執行。因此,今年世界模型的快速升溫,也意味著機器人行業開始從語言智能邁向物理智能,世界模型真正模擬的不是畫面,而是現實,只是對于仿真器和芯片的要求會越來越高。
(4)VLA:機器人大腦的“主流方案”
如果沿著時間繼續往前追溯,那么今天幾乎所有機器人大腦,都繞不開一個名字——VLA(Vision-Language-Action,視覺—語言—動作模型)。過去一年,它幾乎成為具身智能最主流的技術路,到現如今談論落地,VLA依然是許多企業堅持的核心方向。
VLA可以理解為一種把視覺、語言和動作統一到一個模型里的多模態架構。機器人首先通過攝像頭"看見"環境,再理解人類語言指令,最后生成對應的動作。
例如把桌上的紅色杯子放進紙箱這類任務,其實機器人需要同時完成識別什么是杯子;理解“紅色”對應哪個目標;判斷紙箱的位置;規劃抓取動作;最終完成放置,這一系列步驟。過去,這些能力往往由多個獨立模塊完成。而VLA第一次把它們統一到同一個模型里,也因此成為具身智能發展的重要里程碑。
今年以來,隨著機器人進入越來越復雜的真實場景,VLA也逐漸暴露出自己的局限。因為它更擅長理解并實現具體任務,卻缺少對真實物理世界的長期推演能力,在開放式環境中的表現略顯局限。
于是,今年行業開始圍繞世界模型展開新的探索。但值得注意的是,到了WAIC,這場關于誰取代誰的討論已經發生了變化。
曾經Jim Fan 4月GTC拋出,業內迅速流傳的那句:VLA已死,WAM當立,再WAIC 2026逐漸由共識反轉成融合共生:VLA負責理解世界,世界模型負責預測世界,兩者并不是競爭關系,而是互補關系。這也使得VLA沒有過時,它只是開始承擔自己更擅長的工作,理解、以及更好的執行,而不是預測未來。
(5)第四代、第五代多模態大模型:機器人大腦的下一站
極智嘉具身智能首席科學家趙昊WAIC 2026提到了第五代多模態大模型的新概念,其認為如果說WRAM回答的是“今天的機器人大腦應該怎樣構建”,那么第四代、第五代多模態大模型討論的,則是“未來機器人應該怎樣學習”。
WAIC期間,趙昊提出了機器人多模態基礎模型的代際演進觀點。在他看來,VLA即第二代多模態大模型,通過對圖像與語言聯合訓練的多模態模型進行動作微調。所謂World Action Model則屬第三代多模態大模型,典型如視頻生成模型;今年CVPR兩篇Best Paper中,一篇指向第四代多模態大模型,是混合訓練了視頻Token、文本Token與圖片Token;另一篇來自DeepMind的D4RT,實現了4D Token,預示第五代多模態大模型將會是4D Token、3D Token、視頻、文本與圖片Token的混合訓練。屆時在第五代多模態大模型的基礎上,以動作數據進行微調,有望迎來具身智能的“GPT時刻”。但目前業界仍主要處于數據積累階段。
這一判斷反映出行業對于機器人大腦底層訓練范式的新探索:動作數據微調只是最后一環,底座是多模態Token的混合訓練,未來機器人的學習對象,不再只是圖像和語言,而是真實世界本身。
(6)大小腦協同(快慢思考雙系統):讓機器人既能思考,也能快速行動
當機器人大腦越來越聰明,一個新的工程問題也隨之出現:大模型思考得夠快嗎?現實中,機器人控制關節、電機和力反饋,往往需要毫秒級響應;而大模型完成一次復雜推理,卻可能需要數百毫秒。
因此,越來越多企業開始采用大小腦協同架構,也被稱為快慢思考雙系統。其中,大腦(云端/邊緣)負責世界模型/VLA、任務理解、長時序規劃;小腦(機載本地)負責運動控制、柔順力控、全身平衡、緊急安全制動。解決大模型百毫秒級推理與伺服實時控制的時序不匹配問題。兩套系統分工協作,讓機器人既能夠完成復雜決策,又能夠滿足實時控制需求。這一架構與人類神經系統頗為相似,人腦負責思考目標,小腦負責協調動作,兩者共同完成一次完整行為。這也意味著未來機器人比拼的不再是誰擁有更大的模型,而是誰能夠讓會思考的大腦與會行動的小腦真正協同工作。
![]()
02.
系統架構篇:機器人正在建立自己的操作系統
如果說機器人大腦篇討論的是機器人如何思考,那么系統架構篇關注的,則是另一個更現實的問題:機器人如何把智能真正變成生產力,真正走向落地?
過去幾年,機器人行業更多關注單點能力,例如更靈活的機械臂、更精密的控制器、更大的模型、更高的算力。但隨著具身智能進入深水區,一個新的共識正在形成,那就是未來機器人競爭,靠某一個模型完全靠不住,其屬于完整的系統架構。從Physical AI到具身原生,從Agent+Skill到全棧閉環,2026年以來,一系列新概念正在重新定義機器人的技術底座。
(1)Physical AI(物理AI):AI開始走出屏幕
由英偉達CEO黃仁勛GTC提出后多次強調,并成為2026年具身智能領域的重要產業敘事。大意是指AI走出屏幕,住進物理身體里。這是所有新詞的母容器。WAIC官方口徑也把機器人改叫物理智能伙伴,意指可自主協作、可長期迭代、可替代重復勞動。
不少業內人士認為,如果說過去十年的AI,主要發生在數字世界,那么Physical AI代表的下一階段是讓AI進入物理世界。簡單理解,就是讓人工智能具備理解、交互和改變現實世界的能力。
因為傳統AI主要處理文字、圖片、代碼、數據等,而Physical AI面對的是空間、物體、運動、力、環境變化。也就是說,它不再只是回答問題,而需要完成真實任務。比如:機器人如何拿起一個杯子?如何避開障礙物?如何理解一個工廠環境?如何長期完成重復工作?這些問題,都屬于Physical AI需要解決的范疇。
Physical AI火爆不僅僅得益于大佬帶貨,另一部分原因在于大模型的發展,讓AI擁有了強大的認知能力;機器人硬件的發展,讓AI擁有了進入現實世界的具身智能載體。兩者結合,形成了新的技術方向。
在不少人看來,如果說ChatGPT改變的是人與信息交互的方式,那么Physical AI改變的,將是人與物理世界交互的方式,也會帶來一個更加宏大的未來。
(2)具身原生(Embodied-Native):機器人不能只是“大模型外掛身體”
具身原生(Embodied-Native)由螞蟻靈波團隊提出,并引發行業對于機器人基礎模型路線的討論;同時Generalist CEO Pete Florence在《Going Beyond World Models&VLAs》演講也提出“超越世界模型和VLA”的觀點。
過去,很多人設想先訓練一個強大的語言模型,然后讓機器人接入這個模型,機器人就會擁有智能。但具身原生提出了不同觀點,其認為機器人智能不應該建立在數字世界模型之上,而應該從物理世界重新訓練。反對在LLM上微調當機器人腦,主張為物理世界從零訓練原生模型。
原因在于互聯網AI學習的是文本、圖片和視頻,但機器人面對的是重量、摩擦、碰撞、空間關系、身體限制等。兩者的數據分布天然不同。
螞蟻靈波沈宇軍舉了一個"開門見貓"的例子——不透明玻璃門后有只貓,數字世界視覺模型能"看見"貓,但機器人物理上夠不到,因為數字模型的設計目標(畫質/創造性)和物理世界(快/合理)天然不一致。但機器人真正面對的問題是:門能不能打開?距離是多少?機械臂夠不夠得到?抓取角度是否合適?這就是數字智能和物理智能之間的鴻溝。
具身原生實際上提出了一個更底層的問題:機器人是不是應該擁有自己的“大模型”,而不是成為互聯網大模型的一個應用場景。這也意味著ChatGPT學習的肯呢個是人類留下的文字世界,而機器人需要學習的是物理世界本身。
(3)Agent+Skill:未來幾年機器人落地的現實路徑
WAIC 2026期間,蘇度、螞蟻靈波、原力靈機等企業均展示原子能力的類似思路。如果端到端大模型代表機器人未來的終極形態,那么Agent+Skill更像是當前產業落地階段的工程方案。
簡單來說,當面對復雜任務時,上層Agent負責拆解任務,并調用不同Skill完成執行,Agent負責“大腦”,Skill負責“技能”。通過把抓/插/擦每個動作訓成泛化policy,機器人不需要每一次任務都從零思考,而是將抓取、插拔、擦拭、搬運等動作訓練成可復用的原子能力。Agent+Skill通過模塊化方式,讓機器人更容易適配場景。
因為機器人最大的挑戰不是完成一次動作,而是在不同場景中穩定完成任務,例如用戶要求整理桌面,機器人不會直接生成一個復雜動作。而是拆解識別物品、抓取、分類、移動、擺放。因此每一個步驟調用對應Skill就能更高效、精準完成。這種路線也被評價為端到端是詩和遠方,Agent+Skill是未來2-3年落地最優解,未來上層Agent調度與WRAM/WBI有望形成"短期vs長期"雙軌。
(4)UTC(Unified Trajectory Control):連接“大腦”和“身體”的關鍵層
UTC(統一軌跡控制)來源于近年來機器人運動生成相關研究,并成為WBI體系中的關鍵組成部分。SONIC、BFM等工作在2025年提出,主要負責把意圖轉化為可行的全身運動(運動生成+BFM身體先驗)銜接"大腦WRAM"與"小腦WBC"的中間層,是WBI概念里最工程化的一環。
機器人一直存在一個脫節的問題,大模型知道“應該做什么”。控制系統知道“關節如何運動”。但兩者之間缺少一個中間層。UTC解決的就是如何把高層意圖轉換為可執行的全身運動軌跡。例如:大腦輸出指令:拿起桌上的水杯。UTC規劃手臂、身體、關節如何協調運動。小腦控制電機完成動作。
未來機器人不會只是機械執行固定動作,而需要面對復雜環境。因此,需要一個能夠連接任務理解、動作規劃、身體運動、實時控制的中間層。UTC就是這一層。如果說大模型負責告訴機器人“去哪里”,那么UTC負責告訴機器人“怎么走過去”。
(5)全棧閉環:機器人競爭,從單點技術進入系統戰爭
隨著具身智能進入產業化階段,ICRA 2026、WAIC 2026期間,行業逐漸形成一個新的共識:未來沒有任何一家企業能夠只靠單一能力贏得競爭。所謂“全棧閉環”,簡單來說,就是覆蓋機器人從研發到落地的完整鏈路:數據采集→仿真訓練→模型訓練→真機部署→效果評測→數據回流→再訓練優化。
過去機器人產業鏈更像是一條線,硬件廠商負責機器人本體;軟件公司負責算法;應用企業負責場景。不同環節之間相對割裂。但具身智能時代,機器人需要持續學習。一次部署不是終點,而是下一輪訓練的開始。因此,企業必須建立完整閉環。機器人在真實場景執行任務;產生新的動作數據;模型根據數據優化;機器人能力再次提升。這也是為什么今年行業越來越重視數據平臺、仿真平臺、真機訓練、部署場景。
因為具身智能最大的挑戰,不是讓機器人完成一次動作。而是如何讓機器人持續進化。大模型時代,互聯網企業依靠海量文本和圖片數據形成能力躍遷。而機器人時代,數據來源于真實世界。每一次抓取失敗。每一次動作偏差。每一次環境變化。都是機器人學習的重要素材。因此,全棧閉環正在成為機器人企業的新競爭壁壘。這也使得現在競爭開始轉向:誰擁有更多真實場景?誰能夠獲得更多高質量數據?誰能夠建立更快的數據反饋循環?未來機器人公司的核心資產,可能不是某一臺機器人,而是一套能夠讓機器人不斷進化的閉環系統。
(6)涌現時刻/GPT時刻:機器人什么時候迎來自己的ChatGPT?
2026年,關于具身智能是否會迎來類似ChatGPT的“GPT時刻”,成為行業最具爭議的話題之一。一方面,智元機器人等企業認為,隨著數據規模提升和模型能力增強,具身智能可能在2027年底至2028年前后出現能力涌現;另一方面,也有業內人士認為,機器人并不存在類似ChatGPT那樣明確的單一時間節點。
業內認為,所謂“GPT時刻”,來源于生成式AI的發展經驗。2022年ChatGPT發布后,人們第一次直觀看到大模型能力并不是線性增長。當參數、數據和訓練方式達到一定規模后,模型突然展現出此前沒有的新能力。這種現象,被稱為“涌現”。于是,機器人行業也開始討論,機器人是否會出現自己的GPT時刻?是否存在某一天,機器人突然擁有接近人類水平的通用能力?
但機器人和ChatGPT有一個根本區別:ChatGPT面對的是數字世界,機器人面對的是物理世界。語言模型可以通過互聯網文本快速學習;機器人卻需要面對是真實環境變化、復雜物理規律、身體限制、長程以及長期任務執行等。
因此,機器人領域對于“GPT時刻”的看法更加謹慎。有人認為隨著百萬小時級機器人數據積累,能力躍遷可能出現。也有人認為機器人智能不會像聊天機器人一樣突然爆發,而會隨著不同場景逐漸解鎖。它實際上代表了行業對于終局的想象買那就是機器人最終會不會成為一種通用智能?還是會長期停留在特定任務自動化?這不僅是技術問題,也是產業可能性的大問題,決定了機器參與現實世界的方式。
![]()
03.
產業落地篇:機器人開始從“會展示”走向“能工作”
隨著具身智能進入2026年,行業在政策和資本的推動下,關注開始逐漸轉向,機器人,什么時候才能真正進入生產環境,像一個員工一樣持續工作?這也是為什么今年以來,“部署態”“作業模式”“實景實訓”“落地深水區”等一批產業關鍵詞開始密集出現。這些詞背后,實際上對應著具身智能產業邏輯正在從技術展示階段,進入產業驗證階段。如果說過去幾年行業競爭的核心是“誰能造出機器人”,那么接下來競爭的核心將變成“誰能讓機器人真正創造價值”,并且越來越有價值。
(1)部署態元年:機器人產業從研發階段進入運營階段
2026年4月,在智元合作伙伴大會上,智元機器人董事長鄧泰華提出,將2026年定義為“部署態元年”。隨后,在7月智元與愛仕達舉行技術合作相關活動期間,“部署態”再次成為行業討論的重要關鍵詞。所謂“部署態”,并不是簡單指機器人完成交付,而是代表機器人從研發驗證階段進入長期運行階段。
過去,機器人產業更多關注的是“開發態”。企業需要證明機器人是否具備某項能力:能不能行走?能不能抓取?能不能完成動作?能不能在實驗環境中運行?但進入部署態之后,評價標準發生了變化。因為企業真正關心的問題變成:機器人能否每天穩定運行?能否適應生產環境變化?能否持續完成任務?能否形成經濟價值?
這意味著機器人產業的競爭邏輯開始發生轉移。過去,機器人更像是一件產品;而未來,機器人更像是一套持續運營的生產系統。這一變化也解釋了為什么越來越多企業開始從單純制造機器人本體,轉向構建包括模型、數據、場景和服務在內的完整解決方案。
因為真正進入產業之后,機器人面對的并不是一次展示,而是數千小時、數萬次甚至更長周期的持續工作。“部署態”的出現,本質上意味著機器人第一次開始接受工業世界的考核。
(2)作業模式:機器人產業真正的“上崗標準”
如果說“部署態”更多來自企業視角,那么“作業模式”則代表了政策層面對機器人產業下一階段發展的判斷。2026年6月,工信部、國資委聯合發布《2026年度人形機器人與具身智能實景實訓專項行動》,其中提出推動人形機器人和具身智能進入“作業模式”。
因為在過去的機器人行業里,常見的表達通常是:演示、測試、驗證、交付。但“作業模式”換了一種語言。它強調的不是機器人有沒有完成一次動作,而是機器人能不能像真實生產人員一樣,持續承擔工作任務。
比如,在制造業場景中,機器人需要每天完成裝配、檢測、搬運等工作;在物流場景中,需要長期處理復雜訂單和環境變化;在服務場景中,則需要面對不斷變化的人機交互需求。
這背后反映的是行業認知的一次變化:機器人真正的價值,不在于完成一次驚艷的Demo,而在于完成10000次穩定運行。因此,“作業模式”的提出,也意味著機器人產業開始從“展示能力”進入“驗證可靠性”的階段。
(3)機器人學校:機器人真正的數據來源正在走向現實世界
機器人為什么難?過去很多人認為,機器人最大的挑戰是硬件。但隨著大模型進入機器人領域,行業逐漸發現,真正限制機器人發展的,可能不是單純的硬件能力,而是缺少足夠真實、高質量的數據。
這也是能提供“實景實訓”的“機器人學校”成為今年重要關鍵詞的原因。按照相關政策規劃,實景實訓空間將成為推動具身智能發展的重要基礎設施,通過真實環境訓練機器人,形成“實景訓練—數據積累—模型優化—能力提升”的閉環。
與傳統實驗室研發不同,實景實訓強調機器人進入真實生產環境。因為現實世界存在大量實驗室無法模擬的不確定因素。例如零件位置變化;材料差異;環境干擾;動作失敗。這些數據,對于機器人提升泛化能力至關重要。
某種意義上,未來機器人企業之間的競爭,可能不只是模型參數競爭,而是現實世界數據競爭。誰擁有更多真實場景,誰能夠獲得更多失敗經驗,誰就更有可能訓練出更強大的機器人。
這也是為什么今年越來越多企業開始布局:機器人訓練場、數據平臺、真實產線、仿真系統。因為對于具身智能而言,工廠不只是應用場景,更是機器人持續學習的“學校”。
(4)落地深水區:機器人真正的挑戰才剛剛開始
不過,當機器人真正進入產業之后,一個更深層的問題也逐漸暴露出來。機器人并不是不會動,而是距離真正完成復雜任務還有很長距離。行業將這一階段稱為“落地深水區”。
過去,人們經常用“手腦鴻溝”描述機器人當前面臨的問題。機器人的“身體”已經越來越強:能夠行走。能夠移動。能夠完成簡單抓取。但它的“大腦”和“手”之間仍然存在距離。例如,一個機器人可以拿起一個固定位置的盒子,但如果任務變成從雜亂環境中找到目標物品、判斷不同材質,被干擾、打斷,或者連續完成多個步驟,難度會快速增加。
這也是為什么今年行業同時關注世界模型、觸覺、靈巧手和數據閉環。因為機器人真正進入現實世界后,面對的不是一個標準化程序,而是一個不斷變化的環境,這也是深水區的持續性難題。
![]()
04.
數據與觸覺篇:機器人最后的競爭,開始從模型轉向數據
過去幾年,人工智能行業有一個非常明確的共識:模型越大,能力越強。互聯網大模型時代,企業競爭圍繞參數規模、算力投入和訓練數據展開。誰擁有更多數據,誰就更有機會訓練出更強大的模型。
但進入具身智能時代,行業開始發現,機器人面對的問題比數字世界復雜得多。因為機器人學習的對象,不再只是文字和圖片,而是整個物理世界。它需要知道一個杯子的重量是多少、不同材質的表面摩擦力有什么區別、抓取時應該使用多大力度;物體受到外力后會如何變化。
這些信息,并不是互聯網數據能夠直接提供的。因此,2026年前8個月,機器人行業出現了一組非常重要的新關鍵詞:數據規模化元年、觸覺元年、靈巧手產業化突破、最后一厘米。它們共同指向一個變化:機器人競爭的核心,正在從“誰的模型更大”,轉向“誰擁有更多真實世界經驗”。
(1)數據規模化元年:機器人開始進入“數據戰爭”
2026年WAIC期間,光輪智能CEO楊海波提出“2026年是具身智能數據規模化元年”。與此同時,行業內越來越多企業開始將數據能力視為具身智能發展的核心基礎設施。
如果說過去幾年機器人行業最關注的是:模型、算法、硬件。那么今年,一個新的關鍵詞開始進入產業中心:數據。原因很簡單。機器人不同于傳統AI。對于語言模型而言,互聯網已經提供了海量文本;對于視覺模型而言,公開圖像數據已經非常豐富。但機器人需要的數據,是另一種完全不同的數據:機械臂如何調整姿態?手指接觸物體時產生怎樣的反饋?機器人失敗時應該如何恢復?這些數據只能來自真實交互。因此,具身智能的發展天然面臨一個數據瓶頸。
今年行業出現一個明顯趨勢:機器人數據規模正在快速擴大。過去,很多機器人訓練可能只依賴幾十小時、幾百小時數據;而現在,行業開始向百萬小時級甚至更大規模邁進。例如,戴盟機器人發布Daimon-Infinity數據集,計劃持續擴大具身數據規模;與此同時,光輪智能憑借具身數據基礎設施能力獲得市場關注,進一步說明數據正在成為機器人產業新的競爭資源。
但機器人數據和互聯網數據最大的不同在于:它不是簡單復制。而是不斷試錯。一個機器人完成一次成功抓取,價值有限。但一次失敗:為什么沒抓住?為什么滑落?為什么碰撞?為什么動作規劃錯誤?這些失敗經驗,這些壞數據,反而是模型能力提升的重要來源。因此,未來機器人企業的核心資產,可能不只是機器人數量,而是機器人持續產生數據的能力。AI時代的數據是燃料,而具身智能時代的數據更像是經驗。
(2)數據金字塔:機器人不會只靠一種數據學習
隨著數據重要性提升,另一個概念也開始受到關注:數據金字塔。這個概念最早由Agility Robotics CTO Pras Velagapudi在GTC相關分享中提出,強調機器人訓練需要不同層級、不同來源的數據共同支撐。
簡單來說,機器人訓練數據并不是單一來源,而是一座金字塔。底層是互聯網視頻、人類行為數據。中層是仿真環境生成的數據。頂部是真實機器人采集的遙操作數據。三類數據各有價值。互聯網數據規模最大,可以幫助機器人理解人類行為;仿真數據成本較低,可以快速生成大量訓練樣本;真實機器人數據最接近實際應用,可以解決最后的適配問題。
這也意味著,未來機器人訓練不會簡單復制ChatGPT模式。機器人不可能只靠讀取互聯網知識獲得能力。因為現實世界中的很多關鍵經驗:例如如何控制力度、如何恢復失敗、如何適應不同環境,都必須通過真實交互獲得。因此,行業開始強調:異構預訓練。也就是讓機器人同時學習:人類經驗、仿真經驗、機器人自身經驗。
不過,在數據規模擴大的同時,行業也出現了一種冷靜聲音。ICRA 2026期間,Ken Goldberg提出,機器人領域的數據積累與大模型時代仍存在巨大差距,機器人真正擁有類似互聯網AI的數據規模,還需要長期積累。這意味著數據規模化元年,并不意味著機器人數據問題已經解決。恰恰相反,它意味著行業剛剛開始進入數據競爭階段。
(3)觸覺元年:機器人開始擁有“觸感”
如果說數據解決的是機器人如何學習,那么觸覺解決的是機器人如何感知。2026年,行業越來越多聲音認為:機器人正在進入觸覺元年。過去,機器人感知主要依賴視覺。攝像頭告訴機器人:物體在哪里、是什么顏色、是什么形狀、但視覺存在天然限制。機器人可以看到一個蘋果,卻不知道、它有多硬、表面是否光滑、抓取力度是否合適。
而人類之所以能夠完成復雜操作,很大程度依賴觸覺、我們拿起玻璃杯時,會自然調整力度,握住紙張時,會減少力量;觸碰不同材質時,會立即調整動作。這些能力,是視覺無法替代的。因此,觸覺正在從過去的“輔助傳感器”,逐漸成為機器人智能的重要組成部分。
今年行業普遍認為未來真正具備泛化能力的機器人,必須同時擁有視覺、語言、觸覺、動作,最終形成完整感知閉環。這也是為什么越來越多企業開始布局觸覺傳感器、觸覺芯片和觸覺數據。例如,華威科、他山等一些企業正在推動觸覺數據集建設,因為視覺讓機器人知道世界是什么樣,觸覺讓機器人知道世界是什么感覺。
![]()
05.
結語:機器人行業,正在重新定義自己的語言
回看2026年前8個月機器人行業出現的這些新詞,會發現一個有意思的現象:它們并不是簡單的概念更新,而是在記錄一個產業正在發生的結構性變化。
從WBI、WRAM,到Physical AI、具身原生;從部署態、作業模式,到數據規模化元年、觸覺元年,這些過去并不常見的詞,如今正在成為機器人行業交流的新語言。
而語言的變化,往往意味著產業階段的變化。當行業開始討論WBI(全身智能),意味著機器人競爭的重點,已經不只是擁有一個更強的大腦,而是讓認知、身體和環境真正融合;當行業開始討論WRAM、世界模型,意味著機器人正在從理解世界走向預測世界;當行業開始討論部署態、作業模式,意味著機器人開始接受真實產業環境的考驗,而不是停留在實驗室和展廳之中。
這也是為什么今年大量新概念出現的背后,本質上都是同一個方向——機器人正在從“被制造出來”,走向“能夠持續成長的智能體”。當然,今天的具身智能仍然處于早期階段。數據規模還需要持續積累,模型能力仍需要突破,靈巧操作和泛化能力仍然是行業難題,機器人距離真正意義上的通用智能還有很長的路要走。
但不可否認的是,2026年的一個重要變化已經發生:機器人行業開始擁有自己的技術語言。過去,機器人更多借用了自動化時代的敘事:精度、速度、自由度、負載。
如今,它開始建立屬于具身智能時代的新詞匯:世界模型、全身智能、物理AI、數據閉環、部署態。這些詞背后,連接的是機器人從實驗室走向現實世界的一條完整路徑。
這些新詞不會是終點。多年以后,當人們回顧具身智能真正走向產業化的階段,或許記住的不只是某一款機器人產品,也不只是某一家企業的發布會。
他們可能會發現:正是這些不斷出現的新詞,記錄了機器人從“會運動”到“會思考”,再到“會工作”的關鍵轉折。機器人行業正在換一套語言,而語言的背后,是一個產業正在換擋。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.