夢瑤 發自 凹非寺
量子位 | 公眾號 QbitAI
太!火!爆!了!
還得是WAIC,還得是AI圈春晚——
哪怕到了展會第三天,依舊人擠人人人人,火爆熱程度堪比上海這兩天的天氣。(doge)
甚至,據說,連黃牛票…都炒到3000塊錢一張了!?
![]()
真不怪大家這么熱情,主要吧,還是展會現場太有看頭了——
這邊機器人模擬藥房拿藥取藥、那邊機器人組團開演奏會,還有各種長進真實硬件里的Agent和操作系統。
具身智能、世界模型、AI Coding、Token經濟、AI硬件……過去一年最火的技術概念,今年幾乎全都被搬到了現場。
如果說去年逛展大家聊得更多的,還是AI還能做點啥,那到了今年,一個非常非常非常明顯的變化是——
AI已經從屏幕里走了出來,開始往工廠、家庭、藥房、穿戴設備和各種真實生產場景里「瘋狂流動」了:
![]()
在一眾展商中,我也看到了一個咱非常之熟悉的玩家:京東。
只不過吧,這次,這家廠商亮相的方式確實有億點不一樣。
此前,京東就官宣要打造全球最大的物理世界運營中心,沒想到這么快就把最新成果搬到了WAIC現場——
首次集體亮相的JoyAI全系列大模型、具身數據采集與訓練鏈路,還有以JoyInside為底座打造的京東AI Home,全都來了:
![]()
逛完今年的WAIC,我們會發現AI的能力邊界,真的開始從數字內容的理解與生成,進一步延伸至物理世界的環境感知、實時決策與具體執行。
而過去停留在屏幕里的智能概念,如今已經開始進入工廠、家庭和各類終端設備,真正參與現實世界的現實運行了。
看得見、聽得懂、還能執行,面向物理AI的模型全家桶來了
這兩年,大模型已經進入密集發布期。
今年走進WAIC主場館,我們會發現圖像、視頻、語音、交互、具身等不同方向的模型幾乎覆蓋了所有熱門賽道。
但不得不承認的一點是,在真實的物理環境中,單一模型給出判斷,只是整個AI任務執行流程的「起點」。
后續的路徑規劃、設備控制、動作執行與結果反饋,可以說每個環節都直接影響一個任務能否真正形成完整閉環!!
也正因如此,物理AI對模型能力的要求,也從單項能力的突破進一步延伸至感知、理解、決策、執行的系統協作。
![]()
△AI生成
就在今年WAIC現場,京東直接端上了一整套面向物理世界的JoyAI模型「全家桶」。
從語音、圖像、視頻、實時交互、到具身智能,可以說是把物理AI需要的模型能力統統梭哈了……
對物理AI來說,視覺能力決定了AI能否建立對現實環境的連續認知。
畢竟一臺機器人真正開始行動前,需要先弄清周圍有什么、物體位于哪里,以及彼此之間存在怎樣的空間關系。
而京東此前開源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,剛好對應了視覺能力向物理世界延伸的不同維度——
JoyAI-Image-Edit實現了視角變換、空間漫游與幾何一致性編輯,讓AI從處理平面像素進一步走向理解空間結構。
![]()
△JoyAI-Image-Edit
JoyAI-Echo通過跨模態記憶維持長視頻的一致性,JoyAI-VL-Interaction則把理解和響應壓縮至毫秒級,讓AI可以一邊觀察實時畫面,一邊交互、調用Agent。
值得一提的是,京東還在今年WAIC上,展示了多模態領域的最新研究成果:實時視頻編輯模型JoyAI-Video-Edit。
具體來說,用戶可以自定義畫面,并在預覽過程中實時修改,讓視頻生成具備更強的即時反饋與動態調整能力。
從長時一致性、實時理解到即時修改,幾款模型分別補上了動態視覺中的不同環節,讓物理AI既能記住前后變化,也能跟上實時畫面,并根據環境變化及時調整反應。
![]()
△JoyAI-Video-Edit
視覺模型讓設備看懂周圍環境,但當設備真正進入家庭和零售場景,還要面對一個更難處理的變量——人的指令。
畢竟,大家都懂,現實交流很少按照標準格式發生。
語氣、習慣和表達方式同樣因人而異,對于物理AI來說能否真正聽懂指令,直接決定了后續動作會不會跑偏。
在今年WAIC上,京東不僅亮相了語音生成基礎模型JoyAI-Voice,還同步發布了新的語音交互模型:JoyAI-Talker~
其能夠識別用戶的情緒與真實意圖,根據不同人的表達習慣調整回應,同時具備低延遲交互和隨時打斷能力。
這意味著,人與物理AI的交互能夠從一次性下達指令,變成持續溝通:設備可以在執行過程中接收反饋、暫停動作、理解新的需求,再及時調整接下來的行動了!!
![]()
能看懂環境、理解人的意圖,物理AI還要跨過最后一道門檻——讓真實設備把模型的判斷變成動作。
而京東的JoyAI-RA移動操控基礎模型,解決的正是這段從決策到行動的轉換。
通過統一訓練框架,讓不同機器人與人類操作經驗能夠在同一套動作表達中完成對齊,再結合仿真訓練和真實環境驗證,持續修正模型在現實中的執行偏差。
由此,物理AI在模型能力上,才真正完成了從感知、理解、決策到行動的完整閉環。
小機器人們,開始在物理世界狠刷「經驗值」
機器人在模型里學會了看、聽、理解和規劃,真到了現實世界,還是可能被一只擺歪的杯子「難住」。
畢竟,模型給出的更多是智能上限。
這些能力能否遷移到物理世界的真實任務中,很大程度上還是取決于小機器人們在物理世界中攢到的經驗。
讀萬卷書不如行萬里路,這個道理放在小機器人身上,同樣成立。
于是,隨著機器人走向現實環境真實作業,一個越來越關鍵的環節被推到了臺前,那就是「具身數據采集」。
![]()
△AI生成
與大模型的語料訓練相比,機器人學習所需的真實經驗,其實要比文本數據難攢得多,而且哪怕數據規模上去了,機器人也可能被「教壞」。
京東就做過一組很直接也很直觀的實驗——
他們分別用1萬小時高質量數據和1萬小時存在瑕疵的數據訓練模型,結果發現,有瑕疵的數據即使繼續往上堆,模型效果也未必提高,甚至還會越練越差。
所以在京東看來,數據時長只能反映采集規模。真正決定訓練價值的,是動作、軌跡、任務結果和場景變化能否被準確記錄和理解,背后還牽涉標注模型、算法精度與數據處理等一整套技術鏈路。
由此形成的「數據采集—模型訓練—真機驗證—反哺采集」數據采集閉環,則是物理AI真正走進現實世界的關鍵。
![]()
△AI生成
值得一提的是,這套圍繞真實數據持續運轉的具身智能數據采集的飛輪,也已經跑出了最新進展——
當前京東已經發動60萬人參與數據采集,建設了全球最大具身數據采集中心,預計2年內采集1000萬小時人類真實數據。
圍繞數據采集、仿真訓練與真機驗證,京東還構建起了全球首個覆蓋采、存、標、訓、評、仿、測的全鏈路具身數據基礎設施。
從人類怎么做,到機器人怎么學、哪里做錯了、下一輪還缺什么數據,就這樣被串進了同一個持續循環的系統里。
而這條鏈路跑出來的最新成果,則被直接搬到了今年WAIC現場。
在今年WAIC上,京東開源了行業最大的人類第一視角數據集EgoLive——
2000小時視頻、65866個Episode,覆蓋346項真實世界任務。人類在生活和作業現場中積累的操作經驗,就這樣被一段段記錄下來,變成具身模型可以反復學習的「現實教材」。
事實上,京東之所以選擇第一視角的數據采集方式,背后也有一層更具體的行業判斷。
在京東看來,具身智能真正稀缺的,是能夠同時保留環境信息、動作過程與任務意圖的高質量真實數據。
而「第一視角」的數據采集工作恰好提供了一條更適合規模化的路徑:它能沿著人的視線,完整記錄看到了什么、雙手怎么動、任務如何完成,同時減少對特定機器人本體的依賴。
如今,這條路線事實上也已經在實際任務中得到驗證,在多個應用場景里,使用京東第一視角數據和機器人數據后,任務準確率甚至已經實現兩位數的提升。
![]()
△AI生成
光看數字多少還是有點抽象。
在這次WAIC上,京東把具身智能從跟人學到自己干活的整條鏈路,還搬到了現場。
參觀者戴上京東自研的超高清采集終端JoyEgoCam,在貨架前完成一次真實作業,人看到了什么、手怎么移動、物品如何被拿起和擺放,都會以第一視角完整記錄下來。
這些數據隨后經過自動標注、質量優化和結構化處理,被送入數字孿生環境中訓練、評測,最后再部署到實體機器人上。
具身數據從采集到訓練、再到真機驗證的閉環,也就這樣在現場跑了起來:
![]()
從云端到現實世界,這次終于有了更具體的物理AI入口
AI要真正走進物理世界,最終的落腳點,那就是其能不能在「真實場景」里把事情做成。
事實上,不同的場景對于AI的嵌入難度,也完全天差地別。
例如工廠和物流更像一道邊界清晰的封閉題:貨物從哪來、機械臂往哪抓、設備按照什么規則運行,大多可以提前定義,任務完成與否也有明確指標。
但,「家庭」場景就麻煩多了。
一個家里同時存在各種設備產品,每類產品都有自己的系統與交互邏輯,數據分散在不同設備里,此外更難預測的,還有人和突然變化的環境——
孩子突然哭了、老人夜里起床、寵物擋住掃地機器人……這些情況隨時可能發生,也很難提前窮舉。
也正因如此,家庭正在成為物理AI最難進入、同時也最有戰略價值的場景之一。
而京東,目前也已經把模型與數據能力接進一臺臺具體設備,沿著這些智能終端,真正走進了家庭場景。
![]()
△AI生成
值得一提的是,面向真實的物理場景,京東當前已經把自研JoyAI大模型的能力,進一步封裝成了一套給智能硬件使用的AI大腦——JoyInside。
從定位來看,JoyInside更像連接模型與硬件的一層AI System。
其將JoyAI的感知、理解、記憶和交互能力接進具體設備,同時處理家庭場景中的語音識別、意圖理解、長期記憶和多設備協同。
而對于家庭里的各種設備,事實上京東則有一層更具「具身」意味的理解——
此前,京東科技AI創新業務附身智能負責人曾在媒體采訪中提到,在京東看來,一個家里的臺燈、床墊、空調、機器人和AI玩具,其實可以被看成一臺拆散了的「積木式機器人」。
每臺設備負責一種感知或行動,JoyInside則讓它們逐漸理解家庭成員的需求,并在不同場景中相互配合。
這套思路在今年WAIC現場,也有了更具象的展示。
比如下面這張搭載JoyInside的智能睡眠床墊,能持續捕捉睡眠體征,還能結合用戶當前狀態進行主動詢問。
當感知、模型理解與設備控制被接進同一條鏈路,一張傳統床墊也就擁有了持續感知、主動判斷和提供服務的能力。
![]()
再比如,在學習場景中,JoyInside AI投影臺燈提供了一個更典型的物理AI樣本。
通過無屏漫反射投影與多模態掃題批改,它可以識別紙面題目、書寫內容和學習進度,再將模型生成的講解與反饋直接投射到桌面,實現實時答疑和訂正。
這意味著,AI的交互界面開始從屏幕里的對話框延伸到真實學習空間。一盞傳統臺燈也由此升級成了具備「感知—理解—反饋」能力的物理AI終端:
![]()
而這張由智能硬件組成的物理AI網絡,擴張速度也比想象中更快。
據了解,目前接入JoyInside的智能硬件,對話輪次平均提升超過120%,而JoyInside合作范圍也已經覆蓋近200個家電家居、機器人和AI玩具等行業品牌。
甚至到今年,JoyInside預計還將接入超過千萬臺終端設備。
所以當我們再回過頭再看——
全球最大物理世界運營中心這個戰略目標,似乎也已從一個口號愿景,逐漸長出了模型、數據、設備和真實場景組成的「具體骨架」。
對于一家從零售起家的廠商來說,物理世界從來都不抽象。
貨物怎樣流動、倉庫如何運轉、設備怎么協同、用戶需要什么,原本就是京東過去二十多年每天都在處理的問題。
當模型、數據、基礎設施、終端與業務場景逐步貫通,物理AI也隨之形成一套持續循環的運行機制——
在真實環境中感知與行動,在執行過程中獲得反饋,再將反饋沉淀為數據,推動模型進一步迭代。
進而AI也開始從云端,一步步推向了自己最熟悉、積累也最深的物理世界。
物理世界的AI,也終于等來了它最理想的樣子。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.