![]()
2026 年上半年,中國具身智能行業(yè)的熱度很難用“風口”一個詞概括。人形機器人在往量產(chǎn)走,VLA 大模型在迭代,各地政府也開始建“素材工廠”,幾個信號碰到一起,“具身智能元年”不再只是一句口號。
但有一個問題一直在。這個行業(yè)的真實水位到底在哪里?模型跑通了 Demo,離進產(chǎn)線干活還有多遠?各家大廠的投入,真想入場還是先占個座?
6 月到 7 月,筆者陸續(xù)北京去靈初智能、深圳艾歐智能、蘇州樂享科技,加上一場靈生科技的深度交流,以及 WAIC 2026 上具身智能主題的幾場圓桌。四家公司的業(yè)務(wù)從 VLA 大模型訓練、遠程操控、人形機器人量產(chǎn)到世界模型研發(fā),從基礎(chǔ)研究一路延伸到工程化交付。
穿過這些走訪,也摸到了幾處暗礁,一個更真實的行業(yè)輪廓慢慢出來了。
大廠入局
進入四家創(chuàng)業(yè)公司的走訪之前,有必要先梳理一下大廠在具身智能領(lǐng)域的布局。各家進入的路徑差異明顯,但放在一起,能大致看清行業(yè)當前的幾個方向。
最引人注意的一類是自研機器人本體的公司。小米的 CyberOne 從 2022 年亮相至今仍在迭代,延續(xù)的是消費電子加智能家居;比亞迪偏向工廠場景,把機器人嵌入自己的產(chǎn)線降本。智元選了一塊更難的骨頭,其合伙人姚卯青在 WAIC 圓桌上透露,上個月剛在南昌完成了一個六天的產(chǎn)線實操,六萬多件產(chǎn)品,成功率做到 99.99%。
越疆科技的創(chuàng)始人劉培超是另一條路線,他在 WAIC 上透露,“手臂現(xiàn)在能做到 10 萬小時無故障運行,人形機器人能不能先做到 5 萬小時?”劉培超的判斷是,大腦是技術(shù)問題,身體是工程問題。越疆不從零造人形機器人,而是從已經(jīng)很成熟的協(xié)作臂出發(fā),逐步往上疊具身大腦。先把可靠性做扎實,智能是下一步的事。
還有一類玩家?guī)е约旱墓?yīng)鏈優(yōu)勢入局。博世中國戰(zhàn)略副總裁劉敏在圓桌上判斷,“去年行業(yè)解決了運動性的問題,今年操作性在探索迭代。”博世把汽車供應(yīng)鏈的可靠性標準(16949)帶進了機器人領(lǐng)域。不過智元合伙人姚卯青在同一場圓桌上也提醒,今天大多數(shù)機器人零部件的可靠性“還沒有經(jīng)過充分的時間檢驗”。汽車供應(yīng)鏈的可靠性標準移植過來有用,但需要時間來驗證。
騰訊的打法跟以上三家都不一樣。Robotics X 實驗室做前沿研究,張正友在 WAIC 上發(fā)布了五項新成果,包括端側(cè) VLA 模型和具身原生智能體框架 Apexio。Tairos 平臺走開放路線,核心模型開源,SDK 標準化,跨本體適配。騰訊想做的是具身智能時代的 Android。
這讓人想起它在移動互聯(lián)網(wǎng)時代錯失操作系統(tǒng)的經(jīng)歷,只是這一次物理世界的操作系統(tǒng)更依賴云基礎(chǔ)設(shè)施。商業(yè)化落點也順著這條線展開,騰訊云以“數(shù)字基座層”的身份,為全產(chǎn)業(yè)鏈提供算力、存儲、網(wǎng)絡(luò)和仿真平臺。
幾種打法同時存在這件事,已經(jīng)說明具身智能是條需要分層協(xié)作的產(chǎn)業(yè)鏈,每一層現(xiàn)在都還有缺口。
靈生科技:世界模型還在 GPT-3 階段
靈生科技合伙人蔣玉驊做的是世界模型訓練。他在交流中提到了一個觀點,大致描述出了當前具身智能的技術(shù)水位,“具身領(lǐng)域,目前普遍的世界模型大小都在 10B 以下,甚至沒有人畫出從幾十兆到幾百億參數(shù)的 Scaling Law 曲線。對比大語言模型,具身智能大概相當于 GPT-3 之前的階段。”
當外界被各種機器人跳舞、翻跟頭的 Demo 包圍時,底層模型的成熟度其實遠低于預期。蔣玉驊說,靈生走的是一條“數(shù)據(jù)和模型雙向驅(qū)動”的路線,自己有素材工廠保證數(shù)據(jù)供給,訓練模型,模型再反哺數(shù)據(jù)篩選和質(zhì)量提升,生成的合成數(shù)據(jù)又喂回訓練管線。
靈生同時在做兩種模型,WAM(世界動作模型)負責機器人的決策和動作執(zhí)行,部署到本體上完成擰螺絲、疊衣服這類任務(wù)。AC-WM做的是數(shù)據(jù)飛輪的事,對已有數(shù)據(jù)做質(zhì)量打分,標出哪些該優(yōu)先訓練、哪些該剔除,同時生成新的合成數(shù)據(jù)反哺訓練。數(shù)據(jù)來源也分三種,無本體的 EGO 和UMI 數(shù)據(jù)、跨本體的機械臂和靈巧手數(shù)據(jù),以及本體的真機數(shù)據(jù)。三種來源放在一起,覆蓋面廣,數(shù)據(jù)治理的復雜度也跟著上去了。
這條路最大的卡點是數(shù)據(jù)基礎(chǔ)設(shè)施,不是模型架構(gòu)。蔣玉驊的原話是,“GPU 空轉(zhuǎn)不是因為算力不夠,而是 CPU 加載數(shù)據(jù)跟不上。”具身智能的數(shù)據(jù)和 LLM 訓練是兩回事。LLM 吃的是規(guī)整的 JSONL 文本,具身智能面對的是大量碎片化的小文件,視頻切片、點云、觸覺反饋、動作序列。傳統(tǒng)對象存儲在讀寫這類數(shù)據(jù)時,數(shù)據(jù)加載是比 GPU 計算更緊的一環(huán)。
存儲能力因此成了具身智能企業(yè)突破工程化瓶頸的一道坎。騰訊云存儲產(chǎn)品線負責人陳崢在交流中說,騰訊云存儲團隊兩年前就開始接觸具身智能賽道,他的判斷是,具身智能未來一到兩年的數(shù)據(jù)量增長會很快。陳崢說,各地省政府包括很多具身客戶都在建素材工廠。
為此騰訊云推出了一個叫 Agent Bucket 的方案,本質(zhì)上是在對象存儲之上疊加了一個向量存儲和多模態(tài)檢索層,數(shù)據(jù)上傳時自動做預處理(視頻抽幀、VAE 壓縮、文本編碼),讓 GPU 調(diào)用數(shù)據(jù)時不再被 I/O 卡脖子。蔣玉驊的說法是,這套方案“幫助克服了 GPU 加載數(shù)據(jù)的瓶頸”。
問題是,如果行業(yè)還在 GPT-3 階段,或許還有更重要的問題有待突破。數(shù)據(jù)策略上,預訓練階段要的是低成本、大規(guī)模、高多元性,精度要求不高;后訓練階段才需要高成本精確標注,簡單任務(wù)“幾十條上百條就夠”。關(guān)于李飛飛“世界模型被濫用”的說法,蔣玉驊的回應(yīng)是,具身場景的世界模型要處理從語言指令到動作的映射,而不只是畫面預測。
靈生做的事偏底層,離研究更近。下一站的靈初智能更靠近產(chǎn)業(yè),訓練的是能在產(chǎn)線上干活的 VLA(Vision-Language-Action)大模型。
靈初智能:VLA 大模型的“通信焦慮”
創(chuàng)始人之一的陳源培解釋了靈初從成立第一天就堅持人類數(shù)據(jù)路線的原因。他表示,互聯(lián)網(wǎng)數(shù)據(jù)太臟、真實世界搬不進數(shù)采廠、仿真有天然的誤差,“看來看去,目前真正能持續(xù) scale 的,還是人類數(shù)據(jù)。”所以靈初從一開始選的就是靈巧手,不是夾爪。
路線選定了,但數(shù)據(jù)量大不等于數(shù)據(jù)有用。
陳源培透露,10 萬小時的人類數(shù)據(jù),有時候可能跟 1,000 小時是等效的。如果給數(shù)采方下發(fā) 1,000 個任務(wù)、每個任務(wù)采 100 小時,和每個任務(wù)采 1 小時,訓練效果差不多。“什么叫高質(zhì)量數(shù)據(jù),這件事現(xiàn)在行業(yè)里其實還沒有標準答案,我們也還在持續(xù)探索。”數(shù)據(jù)處理的瓶頸遠大于采集。
靈初目前幾個數(shù)采廠一天能產(chǎn)幾千小時數(shù)據(jù),下半年全面啟動后會到上萬小時,但一條數(shù)據(jù)處理管線跑下來,處理 1 小時數(shù)據(jù)的用時可能比數(shù)據(jù)本身的時長還長,算力開銷巨大。
這些數(shù)據(jù)最終要喂給模型訓練,靈初的模型訓練直接跑在高性能計算集群 HCC 上,底層是星脈網(wǎng)絡(luò),最大彈性支持 10 萬張 GPU 卡,自研協(xié)議棧做拓撲感知流量調(diào)度,AllReduce 通信負載率做到 90% 以上,網(wǎng)絡(luò)故障能做到 1 分鐘以內(nèi)發(fā)現(xiàn)、3 分鐘定位、5 分鐘完成自愈。具身 VLA 模型同時處理視頻、文本和動作序列,單次迭代數(shù)據(jù)量比純語言模型大得多,通信壓力也更大,網(wǎng)絡(luò)一旦抖動,GPU 就得空轉(zhuǎn)。
不過,跑通訓練只是開頭。靈初一開始用在市面上買來的整機做落地測試,客戶要求節(jié)拍做到 400,他們剛開始只有 90。“感覺能做到 200,但換了自己的整機之后現(xiàn)在已經(jīng)接近 450 了。”陳源培說,不是整機廠商做不到,而是一款整機不可能有很多版本,市面上買到的都不完全符合落地需求,只能自己設(shè)計了一款“小而全”的整機,核心零部件代工,產(chǎn)品定義和設(shè)計自己做。“這跟靈初最初‘不做整機、只做靈巧手’的策略確實不一樣,但這是我們在實際落地過程中一步一步迭代出來的。”
靈初還有一個做法,把世界模型當成了數(shù)據(jù)質(zhì)量的評估器。陳源培的解釋是,“我可以用世界模型判斷數(shù)據(jù)到底好不好,能轉(zhuǎn)出機器人執(zhí)行數(shù)據(jù)就好,轉(zhuǎn)不出就差。”這個邏輯反過來驅(qū)動了數(shù)采員的操作標準和數(shù)據(jù)處理流程,用模型來判斷哪條數(shù)據(jù)值得訓、哪條該扔掉。代價是吃算力,但比人工定規(guī)則可靠。
通信短板補上以后,按說可以上更多 GPU、訓更大的模型。但現(xiàn)實是,具身 VLA 模型的規(guī)模目前普遍卡在 10B 以下,蔣玉驊在交流中就提到過這個行業(yè)天花板。當下連模型本身都還不夠大,遠沒到需要擔心分布式訓練 Scaling Law 的階段。
堆算力的邊際效益沒有想象中高,數(shù)據(jù)質(zhì)量和數(shù)量才是更緊迫的約束。
商業(yè)化方面,陳源培的判斷分三波,第一波是硬件,不管有用沒用,造出來能唱歌跳舞就能賣一筆錢;第二波是數(shù)據(jù),現(xiàn)在的數(shù)據(jù)市場火熱,可以做素材服務(wù)和數(shù)據(jù)售賣;第三波才是真正的產(chǎn)品交付。“終局一定是以產(chǎn)品交付為主。過程中的東西可以適當變現(xiàn),但長期數(shù)據(jù)行業(yè)一定會趨于平穩(wěn),真正起量的是產(chǎn)品落地。”靈初今年已經(jīng)簽了幾個大訂單,部分場景的 POC 達到了驗收標準。
靈初要解決的是機器人大腦的訓練問題,到了深圳的艾歐智能,關(guān)注的方向則是機器人有了大腦之后,數(shù)據(jù)從哪里來,怎么管,怎么用。
艾歐智能:數(shù)據(jù)基礎(chǔ)設(shè)施的“中間層”
艾歐智能聯(lián)合創(chuàng)始人丁哲章給公司的定位是“數(shù)據(jù)基礎(chǔ)設(shè)施”,連接本體、模型和場景的中間層。“今天具身行業(yè)本體公司很多、模型公司很多、場景方也很多,但真正把三者串聯(lián)起來的落地案例還是很少,就是因為中間這一層是缺失的。”
艾歐把數(shù)據(jù)工具鏈分成了三套:面向預訓練的真實世界人類數(shù)據(jù)采集系統(tǒng),面向后訓練的 TeleXperience 機器人遙操作數(shù)據(jù)采集系統(tǒng),以及面向規(guī)模化運營部署的數(shù)據(jù)回流與管理平臺。
遠程操控是其中的關(guān)鍵技術(shù),艾歐在 2025 年 WBCD 挑戰(zhàn)賽上實現(xiàn)了“人在深圳、機器人在美國”的跨境遙操作,拿下了最佳應(yīng)用獎。TRRO 方案在局域網(wǎng)內(nèi)端到端延遲小于 30 毫秒,跨域公網(wǎng)小于 100 毫秒,大致是人眨一次眼的時間。遠程操控如果延遲超過這個閾值,操作者看到畫面再做出反應(yīng)時,機器人可能已經(jīng)撞上了工件。100 毫秒是遠程操控能不能從 Demo 走進產(chǎn)線的一道物理門檻。
但丁哲章對行業(yè)節(jié)奏的判斷,比技術(shù)參數(shù)更能說明問題。他把具身智能過去幾年的進展分了幾個階段,2022 年前后是 PPT 階段,2023 年把本體做出來放那兒還不能動,2024 年將將能動起來、具備運動等基礎(chǔ)能力,去年開始進入部分場景、展示部分自主能力。至于今年能不能看到“在更多場景中展示更強的能力”,他對此存疑。
“現(xiàn)在有個比較明顯的斷層,場景方對具身機器人的預期,和本體、模型現(xiàn)在真正能做到的程度之間,是有差距的。”丁哲章說,今年聊落地這件事的需求數(shù)量確實變多了,但落地案例有沒有同步變多,“這件事要打個問號”。他舉了自動駕駛的類比,2016 年行業(yè)宣稱 2025 年做到 L5 全自動駕駛,十年過去,今天只是“差不多可用”。具身也會經(jīng)歷同樣的過程,高預期先來,然后調(diào)整,然后慢慢貼近現(xiàn)實。
艾歐的策略是“漸進式落地”,讓機器人先做 20% 到 40%,人用遙操作補剩下的,先運轉(zhuǎn)起來再迭代。丁哲章說,他們一直在和場景方同步一個理念,“現(xiàn)在的機器可能沒有你想象的那么聰明,你需要接受這種中間狀態(tài)。”
除了遙操數(shù)據(jù),人類數(shù)據(jù)稀缺的格局也在變。丁哲章透露,早期不管什么數(shù)據(jù)都要采,連抓一張紙巾的動作都缺數(shù)據(jù)。現(xiàn)在基礎(chǔ)能力有了填補,但一旦要滲透到具體場景,比如讓機器人做按摩、去加油站加油,專有任務(wù)的數(shù)據(jù)極端稀缺。目前需求量最大的兩類數(shù)據(jù),一是靈巧手長程精細操作,因為靈巧手硬件最近才有了能用起來的迭代;二是機器人全身運動,此前只有運控層面的走和跑,全身協(xié)調(diào)做任務(wù)的模型半年多前才開始出現(xiàn)。
艾歐的人類數(shù)據(jù)采集設(shè)備在兩年間還有一個變化,即越來越簡單了。2024 年的版本還有觸覺手套和慣性陀螺,到 2026 年變成了Ego+UMI組合的輕量化方案。丁哲章的解釋是,“一旦設(shè)備變復雜,采集的一致性和效率就降低了。在大家對數(shù)據(jù)量有明確需求的今天,復雜方案就沒有被選擇。”
量產(chǎn)關(guān)的三座大山
前面三家公司,靈生做世界模型,靈初做 VLA 大模型,艾歐做數(shù)據(jù)基礎(chǔ)設(shè)施,關(guān)心的都是模型和數(shù)據(jù)怎么落地。到了蘇州的樂享科技,問題是模型和數(shù)據(jù)都有了之后,機器人能不能造出來,造出來能不能上產(chǎn)線。
樂享科技正在度過人形機器人的量產(chǎn)爬坡期,跟聯(lián)席CTO李元慶聊過之后,量產(chǎn)面臨的第一道坎是算力。
在全球算力流通不確定的背景下,李元慶的感受是,RTX 6000 國內(nèi)拿不到,5090、4090 的平替還在測試,國產(chǎn)卡海光、昇騰逐步可用,但遷移有成本。他坦言,“能用的卡價格極貴,這就是現(xiàn)實”。
算力短缺的壓力已經(jīng)不小,但李元慶發(fā)現(xiàn)另一個問題更難處理,模型規(guī)模在推著算力需求往上跳。李元慶提到,團隊過去一直壓著 2.5B 的端側(cè)模型做訓練,“但后來發(fā)現(xiàn)想要上一些高成功率的動作,比如插 USB,模型參數(shù)量低于 20B、低于 30B 就沒有什么作用了”。一個 30B 和一個 2.5B 的模型,算力需求差了一個數(shù)量級,只能從端側(cè)搬到云端。元點Zeroth后來也上了星脈網(wǎng)絡(luò)的 HCC 集群,但在李元慶看來,底座再好,上游算力供應(yīng)的不確定性始終是最緊的一環(huán)。
元點Zeroth的策略是硬件全棧自研來降本,等供應(yīng)鏈成熟了再上新的工藝,一些環(huán)節(jié)分給合作伙伴,把隱性成本攤出去。
元點Zeroth在蘇州碰到的這些問題,WAIC 圓桌上的幾位嘉賓也各自遇到了。姚卯青(智元)、劉培超(越疆)、劉敏(博世)、張正友在討論中,把人形機器人量產(chǎn)拆成了更具體的工程問題。
姚卯青講述了智元進入南昌產(chǎn)線的過程,先實驗室測到 99%,再上副產(chǎn)線調(diào)參,最后上主產(chǎn)線壓測,一個月通宵調(diào)試才做到四個九。“限速問題、芯片焊接缺陷、減速器故障……你能想象到的問題都會出現(xiàn)。”99% 到 99.99% 的差距,靠的是硬件、通信、調(diào)度、診斷的全棧工程能力,不是模型本身。
張正友在演講中透露,騰訊 Robotics X 的 VLA 模型已經(jīng)在日化品工廠開始試運行,產(chǎn)線要求成功率高于 95%、節(jié)拍快于 6 秒一個動作、新增 SKU 數(shù)據(jù)采集和后訓練時間不到三天。這些指標在實驗室里不算什么,進入三班倒的真實產(chǎn)線,意義完全不同。
硬件端的挑戰(zhàn)也不小。劉培超在圓桌上說,越疆的機械臂做到 10 萬小時無故障運行,但人形機器人動輒 20 個關(guān)節(jié)起,“能不能先做到 5 萬小時起,再突破 10 萬,是一個循序漸進的過程”。博世的劉敏則提醒了節(jié)拍這個維度,替代工人的工位不光要能完成動作,還要“快”。6 秒是一個相對門檻,不同場景要求不同,但整體邏輯是“從場景當中由易到難,有一些容忍度,再一步步提高模型和小腦的能力”。
四家公司走下來,加上 WAIC 圓桌上的討論,2026 年上半年具身智能行業(yè)的水位到底在哪里,大致能看出來了。
模型、數(shù)據(jù)、硬件、落地都在往前走,但每一項都比外界從 Demo 里感受到的慢。模型還在找路線共識,數(shù)據(jù)基礎(chǔ)設(shè)施在加速成型,碎片化的工程難題還在有一個個攻破的路上。硬件可靠性的爬坡以年為單位,產(chǎn)線落地已經(jīng)有真實案例了,但離開箱即用還有一段距離。
丁哲章對“預期斷層”的描述是,聊落地的需求變多了,落地案例沒同步變多,幾個走訪企業(yè)對此也都有同感。陳源培的三波商業(yè)化判斷,硬件先賣、數(shù)據(jù)跟上、最后才是真正的產(chǎn)品交付,行業(yè)離規(guī)模化交付還有一段路。
或許真如博世劉敏在圓桌討論中說的那樣:“這不是一條路,是一步步往前走。”
2026 上半年的推進速度超過了此前兩年的總和。不是哪個單項突破了,模型、數(shù)據(jù)、通信、硬件在同步向前。但真正走進產(chǎn)線才會意識到,跟 Demo 里的畫面不同,這個行業(yè)的進度條,是工廠夜班里一輪一輪磨出來的。(本文首發(fā)鈦媒體APP,作者 | AGI-Signal,編輯 | 秦聰慧)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.