![]()
新智元報道
![]()
過去一年,具身智能賽道正經歷著前所未有的「冰火兩重天」。
一方面,一級市場熱錢持續涌入,單筆融資金額屢創新高。
但另一方面,也有企業陸續啟動 IPO 進程、尋求二級市場融資。
而放眼全球,具身智能行業的頭部玩家們,早已敏銳捕捉到風向的轉變。
特斯拉、Figure這些公司在做什么?他們幾乎不約而同地把競爭推向了另一個層面——Physical AI。
特斯拉直接將自動駕駛FSD的底層架構復用至Optimus機器人,試圖通過「端到端」神經網絡,實現從視覺輸入到動作控制的映射,如今已經在工廠執行電池分揀。
![]()
Figure AI則通過深度綁定OpenAI,將頂尖VLM注入鋼鐵軀殼,讓Figure 01/02機器人具備自主推理、語義理解能力,進駐寶馬的汽車生產線。
他們的Helix VLA模型,走的是快慢腦雙系統架構,目標不是賣機器人,是賣勞動力。
這些企業路徑不同,但都指向同一個判斷:機器人未來的核心,是AI能不能通過這副身體理解現實世界、適應現實世界,并最終改變現實世界。
這種現象的邏輯,其實都藏在資本的周期里。大多數私募基金的投資年限是「3+2」模式(三年投資,兩年退出),如今已經到了GPLP們迫切需要變現的節點。
資本的倒逼,讓行業面臨一個現實的分水嶺:過去那個靠電機扭矩有多大、后空翻有多穩來證明「機器能動」的故事,已經講到頭了。
企業必須講出下一個更宏大也更切實的故事——「機器能干活」。
如果只是在一個無干擾臺面上,按部就班地執行機械化工作,根本用不著大模型。
具身智能真正的未來,是走向AGI,是在開放、未知、充滿長尾變數的真實世界中執行高度泛化的任務。
而開啟這個時代的鑰匙——是具備系統提升機器人工作能力的技術體系。
為什么走向AGI
必須是「體系化躍遷」?
什么是真正的體系?
近期行業內有一次動作極具代表性。
高德正式宣布其全棧具身技術體系ABot 完成升級,一次性發布了五款新模型(N1、M0.5、ER、AgentOS、C0),并在17項權威基準中拿下SOTA。
![]()
它提供了一個極佳的產業切片,向外界展示了全球首個全棧具身技術體系是如何將世界模型、基座模型與具身Agent架構耦合為一個「有機生命體」,并實現落地的。
ABot最早發布于今年4月,彼時高德自研的機器導盲犬高德途途首次登上機器人半馬的舞臺,并展示了其出色的開放環境全自主導航能力。
途途背后的技術支撐就是高德ABot全棧具身技術體系。相比于單個模型能力研究,高德從一開始就搭建了一個為機器人實現高階智能的底層平臺。
其中的每一款模型都有其對應的功能和角色。這是一個具備完整分工且能「自己長本事」的閉環飛輪。
![]()
在開放環境中,任意一個通用任務,都需要機器人同時調配多個能力進行編排和協同,最后落地執行。
以最常見的家庭場景為例,RoboCasa-365等權威基準需要將日常任務拆解為數百個涉及語義理解、長程規劃和位移操作的任務,然后進行對應的能力評估。本質是因為,想在家庭場景完成作業,單一的手或者腳足夠靈活,還遠不足以支撐。
用戶需要的是完整的智能,而非只具備手臂或者下肢局部能力的「瘸腿」智能。
而ABot這類架構,正是針對這個痛點而打造。
![]()
三層架構,一個飛輪
高德ABot體系的核心,是一個精密咬合、可自進化的三層結構。
最上層是「具身大腦」,由通用具身大腦ER和機器人Agent操作系統AgentOS構成,負責環境感知、任務推理、高層決策調度與記憶沉淀。
中間層是「運動雙核」,由N1和M0.5組成,分工管「腳怎么走」和「手怎么干」。
最底層是「訓練與仿真環境」,以世界模型ABot-World和3D世界模型ABot-Earth持續提供仿真和訓練。
這三層架構決定了ABot的每一次迭代,都不是孤立地點亮某個新技能,而是像生物進化一樣,隨著任務和部署的增多進行整體演進。
這樣的進化能力更類似于人類成長的節奏,在一個人中學階段學習的是一元二次方程,大學階段掌握的則是微積分。每一步的成長,都是完整且高度統一的。
而在這套架構之外,高德途途和它自帶的ABot-C0則扮演端到端能力驗證的外化本體。讓ABot每一個能力的提升都能在本體上有完整呈現。
為什么一定要做這么完整的架構?
因為只有體系跑起來,仿真訓練、物理交互與記憶調度才能彼此反哺。
在單點研究的機構里,研究大腦的和死磕靈巧手的彼此割裂。
但在完整的體系內,手和腳的能力,能夠被一體調用;它們沉淀的知識和經驗,會反向轉化為記憶回饋給大腦,大腦再將記憶用于模型的專項訓練,從而訓練更好的模型和更聰明大腦。
![]()
飛輪每轉一圈,整體智能水平就抬高一層。 手和腳的能力提升是同步的——腳走得好,手也不會差。整個系統是一個內循環,逐步向AGI靠近。
從高德此次全新發布的五款模型背后,我們能夠完整看到這套體系究竟是如何應用于機器人,并實現它們質變升級的。
這五款模型類似于高德為機器人打造的「數字靈魂」,它們完整地映射在機器人的五大仿生單元。
雙腳(ABot-N1):通用導航基座模型,負責空間感知與移動。
雙手(ABot-M0.5):通用操作基座模型,負責精細化物理交互。
大腦(ABot-ER):具身大腦,負責統一的邏輯推理與環境認知。
中樞(ABot-AgentOS):執行中樞,負責記憶調度與任務下發。
運動神經(ABot-C0):運控系統,將ABot體系的決策穩穩傳導至機器人的軀體動作上。
體系化帶來的三大「表征」
當這五大「數字靈魂」在三層架構的驅動下精密咬合、協同運轉時,便不再是冷冰冰的代碼與模型,而是化身為對復雜物理世界有強大適應力的物理智能體。
這種從底層架構向物理世界的全面映射,超越了傳統單點突破的機器人研發模式,并最終外化為傳統機器人整體性的物理表征。
表征一:「身隨眼動」
相比于讓機器人實現一些高難度的動作,高德的ABot-N1更聚焦于讓機器人合規安全的走進人類生活當中。
![]()
ABot-N1在R2R-CE等5項權威基準取得SOTA
讓機器人真正走向開放世界,最大的攔路虎就是機器人無法直接使用常規的導航地圖。常規導航用于人類出行,地圖精度有限。
但是由于人類具備空間常識和安全意識,即便出現地圖偏差和定位漂移,也不影響正常使用,而機器人如果進入開放環境遇到這種問題,將對安全性造成巨大風險。
高德的解法是,為N1導航基座設計了「快慢雙系統」架構。慢思考負責長程路線規劃,快思考負責實時控制。
![]()
ABot-N1開放環境全自主導航克服定位偏差
一旦判定導航路徑或定位有誤差,「慢系統」會立刻通過本體系下的視覺感知,讓機器人靠像素-語言雙思維鏈來實時行駛在合規路面。
在實際導航任務中,快慢雙系統異步協同,讓機器人在僅有低精度SD地圖時,既能準確抵達指定坐標目標,又能沿人行道、斑馬線安全通行,而不是像純度量式策略那樣為了到點而抄近道橫穿車道、踩踏綠化帶。
更關鍵的是,N1首創了「Think-and-Point」,不僅消除了部署黑箱,還讓機器人在每一次自主導航中收集交互數據,并結合空間幾何知識,在ABot體系中內化出屬于自己的「空間直覺」。
依靠這種直覺,它在開放環境自主導航任務中創下92.9%的成功率,做到了城市級的長程自主導航。
值得一提的是,ABot-N系列工作已經入選了CVPR年度最佳論文的候選。在此基礎上,ABot-N1不僅延續了一套權重對出行導航全場景任務集的完整覆蓋,還在R2R-CE等5項權威基準均刷新了SOTA。
表征二:「手腳并用」
一個合格的具身智能體不僅要能「走出去」,還要能「能干活」,移動操作是通用機器人邁向真實物理世界的關鍵能力。
在真實的移動操作任務中,傳統機器人往往是單線程結構,左手、右手、底盤線性串聯,如果一步卡住就會直接死機。
體系化的最大亮點之一,就在于「解耦」。
ABot-M0.5將運動與操作拆分為互不干擾的雙動作流,并引入「幀級隱式動作」,讓機器人在極細的時間顆粒度上實現眼、手、腳的實時對齊。
![]()
ABot-M0.5全自主進行移動操作
這既解決了單一動作空間中移動與操作相互干擾的問題,還保證了模型能捕捉一些微觀且高頻的物理交互,從而保證任務的執行質量。
面對訓練和推理環境不同,造成的長程任務執行過程中的誤差累積問題,ABot-M0.5通過ABot體系激活了「數據回流」機制進行了解決。
ABot-M0.5具備獨特的「夢境自愈(Dream-Forcing)」能力,這個機制強迫模型在預測的含噪畫面中繼續生成動作,避免細小偏差導致任務失敗。
這些數據源自模型自造,它們會通過ABot的數據回流機制,沉淀為整體記憶和共享經驗,持續強化模型訓練。數據顯示,ABot-M0.5在RoboCasa-365復雜任務測試中大幅領先前代SOTA達20.4%。
![]()
ABot-M0.5在LIBERO、Robo-Twin等4項權威基準中均取得SOTA
表征三:「過目不忘」
在具備了優秀的四肢能力后,機器人在真實且復雜環境中,還需要一個完整的機器人操作系統,來統一進行決策和能力調配。
依靠頂層的ABot-ER與AgentOS,機器人擁有了從「想明白」到「做得到」的完整閉環,以及終身記憶的能力。
其中,ABot-ER是面向真實環境的通用具身大腦,統一支撐機器人從感知到決策全流程。它讓機器人不只是識別畫面中的物體,而是能夠「想明白」物體、空間與任務之間的關系,并做出合理判斷。
![]()
ABot-ER取得3項SOTA,并登頂數十家機構聯合發布的Embodied Arena 2D-EQA
AgentOS則將規劃與執行從本體中解耦,通過插件式Skill接入,讓同一套系統能適配各種異構機器人。
同時,它自帶跨任務、跨時間的多模態記憶,能在失敗中定向優化記憶存儲,并將沉淀的數據轉化為整個ABot體系的共享資產。
![]()
ABot-AgentOS多模態終身記憶 過目不忘
憑借系統級的經驗反哺,機器人真正能夠跨本體和跨任務做到舉一反三、過目不忘。
![]()
ABot-AgentOS在Locomo等五大權威基準上均取得SOTA
所有的物理表征,都將在具身機器人進行能力外化的呈現,這個部分高德選擇了其自研的高德途途和運控系統ABot-C0。這也是支持機器人行動的運動神經。該模型通過構建四足機器人統一的行為基座,實現了ABot能力的端到端驗證。
![]()
ABot體系支持異構機器人協作
以上這三大表征絕非孤立技能,而是ABot三層架構「飛輪」高速運轉的必然結果。
它們完美印證了這套體系的進化邏輯:手、腳與大腦在真實物理交互中獲取經驗,在仿真環境里持續訓練,最后通過統一的記憶調度完成閉環反哺。
高德途途在現實世界中的端到端成功外化,正是最強有力的證明。
ABot不是在機械地堆砌機器人功能,而是在按照生命的進化節奏,孕育一個能自主生長、不斷逼近AGI的完整物理智能體。
把二十年時空數據
變成具身智能的基座
一個做地圖導航的公司,為什么能殺入具身智能的核心圈?
如果把「體系化」的三道門檻拆開,答案很明顯。
在數據端,相比純模型驅動的廠商在實驗室里死磕合成數據,高德背后是積累了二十年的龐大時空基座。
機器人本質上是物理空間的Agent,高德對空間的理解、環境的拓撲結構、語義信息的豐富維度,是其他廠商難以企及的天然養料。
在架構端,高德從一開始切入具身智能,就不是為了造某一臺特定的機器人。它的ABot是一套完整的、解耦的全棧架構,各司其職,又通過總線互通。
這意味著,今天在四足狗上驗證的經驗,明天可以直接遷移到雙足人形上,而不需要推倒重來。
在工程化上, 從掃街榜再到具身智能,高德在轉型空間智能公司的過程中,積累了極度深厚的AI工程化經驗。
在場景端,無論是高德途途的場景驗證,還是城市級長程任務導航的實際案例,高德的體系是在真實泥濘的路上跑出來的。
把這些維度串起來,會看到一個完整的增強回路。
四者彼此咬合,才能構成一個「越跑越強」的體系——而這,恰恰是單點突破玩家很難復制的。
![]()
中場戰事,剛剛拉開帷幕
回到開篇的問題:為什么具身智能的下半場,從體系開始?
因為物理世界從不按實驗室的套路出牌。用單點參數的領先去擊穿物理世界的復雜性,本身就存在風險。
放眼當前的具身智能賽道,行業共識正在發生劇變。
資本催熟的「純硬件故事」已經講完,全球最聰明的頭腦都在向同一個方向聚焦:單打獨斗的時代結束了,體系化作戰才是破局的關鍵。
高德ABot架構的誕生,正是在這一行業敘事下應運而生,它與全球頂尖玩家的探索不謀而合。
它向外界證明了,可以不用再去迷信孤立的「超級大腦」或單個「靈巧手」,而是回歸生命進化的本質,去構建一個精密咬合的閉環生態,才是打破莫拉維克悖論的最佳解法。
通往AGI之路上,比拼的不再是誰的長板更長,而是誰的系統能轉得更穩、迭代得更快。
誰能率先構建出靠「閉環飛輪」自我進化的生態體系,讓機器人在物理交互不斷升級,誰就真正拿到了具身智能下半場的入場券。
泡沫退去,真正的洗牌,才剛剛開始。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.