文 | 吳懟懟
在WAIC 2026智啟具身論壇,行業(yè)在探討的,是一套能夠在物理世界持續(xù)學(xué)習(xí)、自我改進(jìn)的系統(tǒng)。
7月19日,2026世界人工智能大會(huì)·智啟具身論壇在上海世博中心舉行。論壇由智元、覓蜂科技聯(lián)合主辦,清華大學(xué)、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics、騰訊 Robotics X等團(tuán)隊(duì)參與。
聽(tīng)完后,一個(gè)很明顯的感受是:雖然“人形機(jī)器人”依然是最容易吸引鏡頭的概念,但臺(tái)上被反復(fù)討論的關(guān)鍵詞,已經(jīng)從自由度、關(guān)節(jié)數(shù)量和動(dòng)作展示,轉(zhuǎn)向了數(shù)據(jù)、模型、仿真、部署、失敗反饋和持續(xù)學(xué)習(xí)。
這意味著,具身智能正在進(jìn)入一個(gè)新階段。
過(guò)去兩年,行業(yè)首先要證明機(jī)器人“能做”;現(xiàn)在,問(wèn)題變成了它能不能連續(xù)做幾百次、幾千次,換一個(gè)環(huán)境還能不能做,失敗以后能不能自己恢復(fù),以及部署出去以后,能力能否繼續(xù)增長(zhǎng)。
換句話(huà)說(shuō),具身智能的競(jìng)爭(zhēng),正在從機(jī)器人產(chǎn)品競(jìng)爭(zhēng),變成一場(chǎng)訓(xùn)練系統(tǒng)和數(shù)據(jù)基礎(chǔ)設(shè)施的競(jìng)爭(zhēng)。
01、物理AI的Scaling Law,卡在交互經(jīng)驗(yàn)
大語(yǔ)言模型的Scaling Law相對(duì)直接:更多數(shù)據(jù)、更大模型、更多算力,通常可以換來(lái)更好的能力。
但物理世界并不是一個(gè)可以直接爬取的互聯(lián)網(wǎng)。
智元合伙人、覓蜂科技董事長(zhǎng)兼CEO姚卯青在演講中將物理AI面臨的問(wèn)題概括為“三道墻”:數(shù)據(jù)墻、表征墻和閉環(huán)墻。
數(shù)據(jù)墻,是高質(zhì)量真實(shí)交互數(shù)據(jù)昂貴且稀缺;表征墻,是不同任務(wù)、場(chǎng)景和機(jī)器人本體之間,尚未形成足夠統(tǒng)一的物理表征;閉環(huán)墻,則是真實(shí)世界中的試錯(cuò)速度慢、成本高,一次失敗可能帶來(lái)零部件損壞,甚至影響整臺(tái)機(jī)器。
這個(gè)判斷很重要。
語(yǔ)言模型犯錯(cuò),通常只是生成了一個(gè)錯(cuò)誤答案;機(jī)器人犯錯(cuò),可能打碎杯子、碰傷人或者造成產(chǎn)線(xiàn)停機(jī)。因此,物理AI真正需要規(guī)模化的,并不只是“數(shù)據(jù)量”,更是可執(zhí)行、可評(píng)價(jià)、可回流的交互閉環(huán)。
這也解釋了為什么把一個(gè)大模型接到機(jī)器人上,并不等于完成了具身智能。大模型擅長(zhǎng)回答“這是什么”“應(yīng)該做什么”,機(jī)器人還必須解決“怎樣做”“力度多大”“失敗后怎么辦”,以及“做完以后,世界發(fā)生了什么變化”。
從數(shù)字AI到物理AI,是要把經(jīng)驗(yàn)規(guī)模化。
02、數(shù)據(jù)開(kāi)始從“數(shù)量競(jìng)賽”變成“配方競(jìng)爭(zhēng)”
本次論壇最值得關(guān)注的變化,是幾乎所有團(tuán)隊(duì)都不再相信單一數(shù)據(jù)來(lái)源能夠解決問(wèn)題。
目前逐漸形成的數(shù)據(jù)結(jié)構(gòu),大致像一個(gè)金字塔。
底層是規(guī)模最大的互聯(lián)網(wǎng)視頻和人類(lèi)行為視頻,它們成本低、覆蓋廣,可以幫助模型理解物體、場(chǎng)景和人類(lèi)行為;中間層是第一視角、UMI等“無(wú)本體數(shù)據(jù)”,即通過(guò)手持或穿戴式設(shè)備記錄人的動(dòng)作軌跡,繞開(kāi)昂貴機(jī)器人的采集瓶頸;頂層則是真機(jī)遙操作數(shù)據(jù)、實(shí)際部署數(shù)據(jù)以及機(jī)器人失敗后的回流數(shù)據(jù),數(shù)量最少,卻最接近真實(shí)執(zhí)行。
姚卯青在圓桌中估計(jì),若將機(jī)器人的“ChatGPT時(shí)刻”定義為能夠開(kāi)箱即用、理解開(kāi)放式自然語(yǔ)言指令,并在常見(jiàn)任務(wù)中達(dá)到70%至80%的基礎(chǔ)成功率,具身數(shù)據(jù)可能需要達(dá)到億小時(shí)級(jí)別。這個(gè)數(shù)字,說(shuō)明了真機(jī)采集不可能是唯一答案。
清華大學(xué)計(jì)算機(jī)系副研究員蘇航把具身預(yù)訓(xùn)練的演進(jìn)歸納為三條線(xiàn):數(shù)據(jù)從單一本體走向多源混合,模型從行為模仿走向世界建模,學(xué)習(xí)從離線(xiàn)訓(xùn)練走向真實(shí)部署中的持續(xù)進(jìn)化。
這意味著,未來(lái)的模型不會(huì)只學(xué)習(xí)“看到這個(gè)畫(huà)面就做這個(gè)動(dòng)作”。它還要理解任務(wù)進(jìn)展、預(yù)測(cè)動(dòng)作后果,并把不同機(jī)械臂、人形機(jī)器人和場(chǎng)景中的經(jīng)驗(yàn)壓縮成可遷移的能力。
數(shù)據(jù)基礎(chǔ)設(shè)施由此成為具身智能產(chǎn)業(yè)鏈里越來(lái)越重要的一層。覓蜂科技展示了MEgo系列采集終端、MEgo Engine治理平臺(tái)和AGIBOT WORLD真機(jī)數(shù)據(jù)集,試圖把采集、清洗、標(biāo)注、評(píng)測(cè)和部署回流接成一條鏈。商業(yè)價(jià)值可能也會(huì)從“出售一批數(shù)據(jù)”,轉(zhuǎn)向幫助客戶(hù)設(shè)計(jì)數(shù)據(jù)配方,并證明這批數(shù)據(jù)確實(shí)提升了模型表現(xiàn)。
對(duì)具身智能來(lái)說(shuō),低質(zhì)量數(shù)據(jù)的規(guī)模化甚至可能放大問(wèn)題。一個(gè)動(dòng)作標(biāo)簽偏差、一段時(shí)間沒(méi)有對(duì)齊的傳感器數(shù)據(jù),進(jìn)入訓(xùn)練后都會(huì)變成機(jī)器人執(zhí)行時(shí)的誤差。數(shù)據(jù)量很重要,數(shù)據(jù)能否跨本體復(fù)用、能否回到真機(jī)閉環(huán)驗(yàn)證,重要性更高。
03、VLA和世界模型,正在從路線(xiàn)之爭(zhēng)走向融合
過(guò)去一段時(shí)間,具身智能存在一場(chǎng)路線(xiàn)爭(zhēng)論:機(jī)器人應(yīng)該直接使用視覺(jué)—語(yǔ)言—?jiǎng)幼髂P停簿褪荲LA,從圖像和指令端到端輸出動(dòng)作;還是應(yīng)該先建立世界模型,預(yù)測(cè)每個(gè)動(dòng)作可能給環(huán)境帶來(lái)的變化,再?zèng)Q定如何行動(dòng)?
從這次論壇釋放的信息看,兩條路線(xiàn)正在走向融合。
智元展示的GO-2強(qiáng)調(diào)動(dòng)作思維鏈,讓機(jī)器人先做粗粒度規(guī)劃,再完成高頻、精細(xì)的執(zhí)行;Act2Goal則通過(guò)預(yù)測(cè)中間視覺(jué)狀態(tài),實(shí)現(xiàn)“先想后做”。智元將VLA與世界動(dòng)作模型融合后的方向稱(chēng)為WRAM,即世界推理動(dòng)作模型。
Physical Intelligence研究科學(xué)家任至意展示的π0.7模型,則提供了另一個(gè)有代表性的結(jié)果:模型在ARX機(jī)械臂上學(xué)習(xí)衣物折疊后,可以遷移到UR5雙臂機(jī)器人上執(zhí)行相似任務(wù),不需要針對(duì)新本體重新微調(diào)。
跨本體遷移,是具身智能能否形成平臺(tái)型公司的關(guān)鍵。
假如每換一種機(jī)械臂、夾爪或者機(jī)器人,都要重新采集數(shù)據(jù)、重新訓(xùn)練模型,那么機(jī)器人行業(yè)最終仍然會(huì)停留在傳統(tǒng)自動(dòng)化項(xiàng)目制。一旦模型能夠把不同本體的經(jīng)驗(yàn)映射到相對(duì)統(tǒng)一的動(dòng)作空間,軟件和數(shù)據(jù)才可能獲得真正的規(guī)模效應(yīng)。
清華大學(xué)蘇航提出的方向同樣指向統(tǒng)一表征:數(shù)據(jù)從單一本體走向多源混合,模型從行為模仿走向世界建模,訓(xùn)練則從一次性離線(xiàn)學(xué)習(xí),走向部署過(guò)程中的持續(xù)進(jìn)化。
最終的物理AI系統(tǒng),可能是一個(gè)多時(shí)間尺度系統(tǒng):上層理解語(yǔ)言和任務(wù),中層預(yù)測(cè)未來(lái)狀態(tài)并制定計(jì)劃,底層負(fù)責(zé)高頻控制和即時(shí)反應(yīng)。
這更像人類(lèi)的大腦、小腦和神經(jīng)反射系統(tǒng)協(xié)同工作,而不是讓一個(gè)模型以同樣頻率思考所有問(wèn)題。
04、真正的分水嶺,是從“視頻能看”到“機(jī)器能用”
具身智能行業(yè)曾經(jīng)有大量令人驚艷的演示,但演示和產(chǎn)品之間存在一條很深的鴻溝。
一個(gè)機(jī)器人成功疊好一次衣服,可以制作一段傳播廣泛的視頻;一家工廠真正關(guān)心的,卻是它能否連續(xù)工作,成功率是否穩(wěn)定,出現(xiàn)異常是否能夠恢復(fù),維護(hù)成本能否被節(jié)省的人力覆蓋。
這次論壇上,一些數(shù)據(jù)開(kāi)始具有產(chǎn)業(yè)參考意義。
據(jù)智元現(xiàn)場(chǎng)披露,其機(jī)器人在江西南昌的一條3C產(chǎn)線(xiàn)上進(jìn)行了連續(xù)六天、每天超過(guò)10小時(shí)的作業(yè),累計(jì)完成接近6.5萬(wàn)次操作,成功率達(dá)到99.99%。
Dyna Robotics披露,其商用基座模型DYNA-1在餐巾折疊任務(wù)中成功率達(dá)到99.4%,并在24小時(shí)無(wú)人干預(yù)情況下完成超過(guò)850個(gè)餐巾的折疊;針對(duì)新任務(wù),所需后訓(xùn)練數(shù)據(jù)不到一小時(shí)。
這些數(shù)字仍需要放到更長(zhǎng)周期、更多場(chǎng)景和實(shí)際成本中觀察,但衡量標(biāo)準(zhǔn)的變化已經(jīng)十分明確:行業(yè)開(kāi)始用連續(xù)運(yùn)行時(shí)間、任務(wù)成功率、適配數(shù)據(jù)量和人工干預(yù)頻率,而不是單次演示效果評(píng)價(jià)機(jī)器人。
更深一層看,商業(yè)部署與通用智能并非完全對(duì)立。
過(guò)去,人們擔(dān)心做具體項(xiàng)目會(huì)拖累通用模型研發(fā)。但Dyna Robotics等團(tuán)隊(duì)提出的“研究—部署飛輪”說(shuō)明,真實(shí)部署可以暴露實(shí)驗(yàn)室無(wú)法預(yù)見(jiàn)的問(wèn)題,也能產(chǎn)生最有價(jià)值的長(zhǎng)尾數(shù)據(jù)。部署不只是模型訓(xùn)練完成后的終點(diǎn),也可能是下一輪訓(xùn)練的起點(diǎn)。
誰(shuí)先把機(jī)器人部署出去,誰(shuí)就更早獲得真實(shí)數(shù)據(jù);誰(shuí)能更快消化數(shù)據(jù),誰(shuí)的后續(xù)部署成本就更低。這可能成為具身智能時(shí)代最重要的飛輪。
05、“ChatGPT時(shí)刻”不會(huì)在同一天到來(lái)
圓桌最后,嘉賓們給出的時(shí)間判斷從兩年到五年不等:姚卯青判斷兩年,Sunday Robotics趙子豪認(rèn)為三年以?xún)?nèi),馬也騁判斷四年,任至意認(rèn)為四五年,張正友給出了三到五年的區(qū)間。
機(jī)器人未必會(huì)復(fù)制ChatGPT在某一天突然席卷所有人的路徑。大家口中的“ChatGPT時(shí)刻”其實(shí)未必指向同一個(gè)終點(diǎn)。
ChatGPT是一項(xiàng)純軟件產(chǎn)品,只要服務(wù)器準(zhǔn)備好,幾乎可以瞬間觸達(dá)全球用戶(hù)。機(jī)器人受到制造產(chǎn)能、硬件成本、供應(yīng)鏈、安全標(biāo)準(zhǔn)和現(xiàn)場(chǎng)維護(hù)的共同限制,不可能通過(guò)一個(gè)網(wǎng)頁(yè)完成全球分發(fā)。
物理AI更可能是分層涌現(xiàn)。
試想一下,首先出現(xiàn)的,會(huì)是在工廠、倉(cāng)儲(chǔ)、后廚等環(huán)境相對(duì)結(jié)構(gòu)化、任務(wù)價(jià)值明確的場(chǎng)景;隨后進(jìn)入商超、酒店、養(yǎng)老等半開(kāi)放環(huán)境;最晚成熟的,很可能才是變量最多、容錯(cuò)要求最高的家庭。
因此,具身智能真正值得關(guān)注的,是誰(shuí)能同時(shí)建立模型能力、數(shù)據(jù)基礎(chǔ)設(shè)施、仿真評(píng)測(cè)、機(jī)器人本體和真實(shí)部署網(wǎng)絡(luò)。
在這場(chǎng)競(jìng)爭(zhēng)中,中國(guó)公司的優(yōu)勢(shì)在于制造業(yè)場(chǎng)景密集、供應(yīng)鏈完整、工程落地速度快;下一步要回答的,則是這些場(chǎng)景能否沉淀出跨本體、跨行業(yè)復(fù)用的模型能力。
當(dāng)越來(lái)越多機(jī)器人在真實(shí)世界里持續(xù)工作,并把每天遇到的成功、失敗和意外重新變成訓(xùn)練材料時(shí),物理AI的智能涌現(xiàn)已經(jīng)在發(fā)生,只是速度不一,地點(diǎn)不同。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.