![]()
機(jī)器人的視覺戰(zhàn)爭(zhēng):一家中國(guó)公司的具身智能基建野心。
2026年7月,上海WAIC。
走進(jìn)具身智能展區(qū),一種混雜了焦慮與狂熱的微妙氛圍充斥著整個(gè)展館。兩年前的WAIC,這里只有18家企業(yè)吃螃蟹;去年已經(jīng)飆升到80家;再到今年,參展數(shù)量已經(jīng)悄然突破了200家。
比摩爾定律還快的增長(zhǎng)速度背后,不僅有各種終端玩家在大放異彩;伴隨模型算法的架構(gòu)紅利走到階段性瓶頸,以宸境科技為代表,過(guò)去深藏在水底之下的數(shù)據(jù)Infra供應(yīng)鏈玩家,也開始走到聚光燈下。
![]()
數(shù)據(jù)如何成為具身智能的阿喀琉斯之踵
要理解數(shù)據(jù)之于具身智能的重要性,自動(dòng)駕駛就是一面最好的鏡子。
把具身智能拆分成不同環(huán)節(jié)來(lái)看,其實(shí)智能駕駛,只是具身智能版圖中的一個(gè)特定子任務(wù)。但強(qiáng)如特斯拉和國(guó)內(nèi)一眾造車新勢(shì)力,在數(shù)百萬(wàn)用戶數(shù)據(jù)源源不斷上傳云端的前提下,死磕了近十年的情況下,依然在面對(duì)各種離奇的Corner Cases時(shí)戰(zhàn)戰(zhàn)兢兢。
而具身智能所面對(duì)的場(chǎng)景,復(fù)雜度比自動(dòng)駕駛高出了不止一個(gè)數(shù)量級(jí):
第一層,是從二維到三維的幾何升維:汽車只需要處理X-Y平面的移動(dòng),而機(jī)器人的手眼協(xié)調(diào)是在完全開放的三維空間里進(jìn)行。
第二層,是自由度的指數(shù)級(jí)爆炸:汽車只有方向盤和油門剎車,人形機(jī)器人的自由度(DoF)動(dòng)輒幾十個(gè),這意味著可能出現(xiàn)的動(dòng)作范圍呈指數(shù)級(jí)增加。
第三層,則是嚴(yán)重的數(shù)據(jù)不對(duì)稱:相比自動(dòng)駕駛,能提供優(yōu)質(zhì)數(shù)據(jù)反饋的機(jī)器人數(shù)量,少得可憐。
更關(guān)鍵的是,具身智能需要的不是普通的視頻數(shù)據(jù),而是帶有空間結(jié)構(gòu)和任務(wù)邏輯的具身經(jīng)驗(yàn)。
“互聯(lián)網(wǎng)上多的是海量的視頻,但對(duì)具身智能來(lái)說(shuō),沒有可靠位姿的視頻只是垃圾素材。”宸境科技相關(guān)專家直言,“二維地圖只需要描述平面,而機(jī)器人則需要知道自己在三維空間里的絕對(duì)位置、姿態(tài)、運(yùn)動(dòng)軌跡和任務(wù)狀態(tài)。只有具備穩(wěn)定軌跡、時(shí)間同步、空間對(duì)齊和質(zhì)量評(píng)估的數(shù)據(jù),才算得上是可訓(xùn)練的硅基經(jīng)驗(yàn)。而這些,需要的是SLAM/VIO、魯棒的6DoF軌跡、實(shí)時(shí)在線輸出和軌跡評(píng)分等數(shù)據(jù)。”
過(guò)去一年多,宸境科技正是看準(zhǔn)了這塊數(shù)據(jù)荒漠,憑借Insight空間智能相機(jī)、TinyNav導(dǎo)航算法庫(kù)等底層組件,拿下了一眾頭部大廠的合作。
![]()
但到了今年,宸境科技發(fā)現(xiàn),行業(yè)的痛點(diǎn),已經(jīng)不止是單一的硬件或者導(dǎo)航算法。一套可規(guī)模化采集、可驗(yàn)證、可復(fù)用的數(shù)據(jù)閉環(huán)基礎(chǔ)設(shè)施,才是讓各大具身智能終端快速進(jìn)化的根本。
也是因此,在今年的WAIC展臺(tái)上,這家以物理AI基礎(chǔ)設(shè)施為標(biāo)簽的公司,推出了兩款代表性產(chǎn)品:Looper具身智能數(shù)采系統(tǒng)NavCore具身智能自主導(dǎo)航大腦
它們所針對(duì)的,正是具身智能行業(yè)在數(shù)據(jù)層面遇到的兩大難題:真實(shí)世界的高質(zhì)量數(shù)據(jù)如何規(guī)模化量產(chǎn),以及機(jī)器人本體端如何實(shí)現(xiàn)高穩(wěn)定的環(huán)境感知與自主導(dǎo)航。
![]()
Looper數(shù)采系統(tǒng):給機(jī)器人裝上第一視角學(xué)習(xí)能力
在具身智能數(shù)據(jù)采集的戰(zhàn)場(chǎng)上,目前有三種主流技術(shù)路線:遙操作+VR、可穿戴多視角、固定多機(jī)位studio。
遙操作最大的優(yōu)勢(shì)是能夠直接獲得機(jī)器人動(dòng)作數(shù)據(jù),適合訓(xùn)練機(jī)器人執(zhí)行策略。但它通常依賴專用設(shè)備,采集成本較高,效率有限,同時(shí)數(shù)據(jù)分布容易受到機(jī)器人本體形態(tài)和操作方式的限制。
固定多機(jī)位采集具有很強(qiáng)的可控性,可以獲得高質(zhì)量、多視角數(shù)據(jù),但依賴特定場(chǎng)地和設(shè)備,難以覆蓋家庭、工廠、商業(yè)環(huán)境中的大量真實(shí)任務(wù)和長(zhǎng)尾場(chǎng)景。
考慮以上背景,Looper選擇了Ego-centric多視角方案,它的核心理念是:讓人類戴著機(jī)器人視角去完成任務(wù),把人類數(shù)萬(wàn)年積累的肉身經(jīng)驗(yàn),無(wú)感地、低成本地轉(zhuǎn)化為機(jī)器人看得懂的數(shù)字資產(chǎn)。
在業(yè)內(nèi)看來(lái),這種最接近人類完成任務(wù)時(shí)的感知方式,同時(shí)也是最有潛力、較低成本實(shí)現(xiàn)真實(shí)場(chǎng)景數(shù)據(jù)規(guī)模化的路線。
![]()
配置上,Looper采用了頭部+雙手的黃金組合多視角方案:頭部Insight相機(jī)負(fù)責(zé)記錄第一視角視覺信息、空間環(huán)境和自身運(yùn)動(dòng)軌跡;雙手相機(jī)負(fù)責(zé)捕捉近距離操作細(xì)節(jié),包括手部運(yùn)動(dòng)、物體交互和局部空間變化;背包端則提供邊緣計(jì)算、同步記錄和數(shù)據(jù)存儲(chǔ)能力。
但這絕不是簡(jiǎn)單的把幾個(gè)攝像頭綁在身上錄像。"采集數(shù)據(jù)容易,采集有效數(shù)據(jù)才是壁壘。Looper做的是采有效數(shù)據(jù)、采高質(zhì)量數(shù)據(jù)。"宸境科技聯(lián)合創(chuàng)始人兼首席運(yùn)營(yíng)官(COO)顏沁睿給我們舉了個(gè)例子:數(shù)據(jù)采集過(guò)程中,多相機(jī)之間的空間和時(shí)間對(duì)齊是一個(gè)非常關(guān)鍵的行業(yè)難點(diǎn)。如果不同視角下的圖像、深度信息、慣性數(shù)據(jù)(IMU)和位姿軌跡無(wú)法在同一個(gè)時(shí)空坐標(biāo)系下保持高頻同步,訓(xùn)練出來(lái)的機(jī)器人就會(huì)動(dòng)作失調(diào)。
針對(duì)這個(gè)問(wèn)題,宸境科技選擇了在端上直接完成VSLAM的6自由度軌跡計(jì)算并輸出的技術(shù)方案。
過(guò)去做具身智能的數(shù)據(jù)采集,行業(yè)通用的做法是采集一整天,拿回去用服務(wù)器離線跑幾天三維重建,才發(fā)現(xiàn)數(shù)據(jù)對(duì)齊失敗,整批報(bào)廢。而Looper借助端上直接輸出VSLAM,在現(xiàn)場(chǎng)就能實(shí)時(shí)知道每一幀畫面的空間位置,不合格當(dāng)場(chǎng)重測(cè)。
該方式的另一大優(yōu)勢(shì)則在于圖像、IMU和6DoF(六自由度)軌跡在端側(cè)天然對(duì)齊,后續(xù)的三維重建和任務(wù)切分成本呈斷崖式下跌。
最終檢索時(shí),客戶拿到的也不是一堆無(wú)序的視頻文件,而是可以按照空間區(qū)域、運(yùn)動(dòng)軌跡、任務(wù)階段精準(zhǔn)檢索的高質(zhì)量經(jīng)驗(yàn)包,真正讓原始視頻由此轉(zhuǎn)化為真正可學(xué)習(xí)、可驗(yàn)證的數(shù)據(jù)。
據(jù)悉,宸境科技還正規(guī)劃推出新一代四目大視場(chǎng)數(shù)采頭環(huán),核心優(yōu)化方向?yàn)檩p量化佩戴、無(wú)束縛自然采集。全新方案將還原人類分層感知邏輯:以余光兼顧全局環(huán)境,視線鎖定身前交互物體,從感知底層完成機(jī)器人數(shù)據(jù)采集方案升級(jí)。
![]()
NavCore導(dǎo)航大腦:如何讓機(jī)器人從能走路到會(huì)走路
如果說(shuō)Looper解決的是數(shù)據(jù)生產(chǎn)問(wèn)題,那么NavCore要解決的則是機(jī)器人的自主導(dǎo)航問(wèn)題。
過(guò)去,具身智能公司在導(dǎo)航這件事上,過(guò)得像個(gè)高級(jí)系統(tǒng)集成商:
從A廠商買相機(jī),去B廠商挑算力板,找C團(tuán)隊(duì)買定位算法,然后研發(fā)團(tuán)隊(duì)通宵達(dá)旦地寫驅(qū)動(dòng)、調(diào)校傳感器、對(duì)齊時(shí)間戳。
作為這一切,現(xiàn)場(chǎng)部署中無(wú)線網(wǎng)絡(luò)的頻繁掉線、多板卡供電不均、接口適配等瑣碎的臟活累活,往往也會(huì)吞噬掉研發(fā)團(tuán)隊(duì)大量時(shí)間。
此外,在整個(gè)鏈路中,相機(jī)的微小延遲會(huì)放大定位誤差,定位誤差會(huì)直接污染全局地圖,地圖更新慢了又會(huì)導(dǎo)致路徑規(guī)劃撞墻。任何一個(gè)環(huán)節(jié)抖動(dòng),都可能直接導(dǎo)致任務(wù)失敗。
更不用說(shuō),橫向?qū)Ρ冗^(guò)去的2D導(dǎo)航方案,3D導(dǎo)航在相同分辨率下,數(shù)據(jù)量會(huì)提升一個(gè)數(shù)量級(jí)以上,同時(shí)還會(huì)增加點(diǎn)云處理、碰撞檢測(cè)和路徑規(guī)劃的計(jì)算壓力。
軟件算法的難度升級(jí)了,但硬件上面臨的條件也更苛刻了:過(guò)去基于2D的自動(dòng)駕駛,可以搭載的空間,是龐大的汽車;而具身智能需要把3D導(dǎo)航能力部署到低成本嵌入式平臺(tái)上。
面對(duì)以上問(wèn)題,作為具身智能的自主導(dǎo)航大腦,NavCore的做法是:大集成與標(biāo)準(zhǔn)化。它可以把復(fù)雜的機(jī)器人導(dǎo)航工程封裝為可部署產(chǎn)品,使客戶無(wú)需從零搭建感知、算力、建圖、定位和導(dǎo)航鏈路。
![]()
硬件上,它以NVIDIA Jetson系列作為算力底座,深度融入全球主流開發(fā)者生態(tài);同時(shí)將自研的Insight空間智能相機(jī)、計(jì)算、通信、電源管理進(jìn)行模塊化一體設(shè)計(jì),降低集成復(fù)雜度。
這里面比較值得一提的是宸境科技自研的Insight空間智能相機(jī),傳統(tǒng)攝像頭只要在固定機(jī)位把畫面拍清楚就解決了90%的問(wèn)題,但在具身智能場(chǎng)景,不僅需要高畫質(zhì),還要有足夠大的視場(chǎng)、極低的感知延遲、可靠的傳感器同步,以及在振動(dòng)、急轉(zhuǎn)、弱光、強(qiáng)光和動(dòng)態(tài)遮擋下持續(xù)輸出穩(wěn)定位置和姿態(tài)的能力。
![]()
這種需求決定了鏡頭、傳感器、慣性測(cè)量單元、芯片和算法不能各自獨(dú)立設(shè)計(jì)。為此,Insight采用了188度超廣角視場(chǎng)、工業(yè)級(jí)慣性測(cè)量單元和端側(cè)算力,在設(shè)備本地完成視覺定位、深度計(jì)算和空間感知,讓具身智能不僅能看得見,也能精準(zhǔn)理解復(fù)雜的空間關(guān)系。
而最終的軟件算法上,宸境科技還通過(guò)算法裁剪、計(jì)算優(yōu)化、硬件加速以及模型量化壓縮,把原本需要服務(wù)器級(jí)別算力的空間智能,塞進(jìn)了低成本的機(jī)器人端側(cè),還能長(zhǎng)期穩(wěn)定運(yùn)行。
此外,考慮到過(guò)去很多機(jī)器人項(xiàng)目都需要針對(duì)不同本體,以及不同場(chǎng)景重新做一套系統(tǒng)集成,包括傳感器選擇、算力適配、驅(qū)動(dòng)開發(fā)、坐標(biāo)系標(biāo)定、算法部署和現(xiàn)場(chǎng)調(diào)試等等。這導(dǎo)致機(jī)器人開發(fā)周期長(zhǎng),方案難以復(fù)制,也是行業(yè)規(guī)模化落地的重要瓶頸。
NavCore不僅內(nèi)置了宸境硬核的TinyNav視覺導(dǎo)航算法,還可以提供基于ROS2的標(biāo)準(zhǔn)化接口輸出。無(wú)論是人形、四足、AMR還是無(wú)人機(jī),還是智慧園區(qū)全域空間感知與多機(jī)器人調(diào)度、工業(yè)巡檢厘米級(jí)自主巡檢與動(dòng)態(tài)避障、港口物流復(fù)雜環(huán)境實(shí)時(shí)導(dǎo)航與任務(wù)執(zhí)行、文旅導(dǎo)覽智能路徑引導(dǎo)與沉浸式講解等場(chǎng)景,都能快速遷移、開箱即用。
通過(guò)對(duì)整個(gè)導(dǎo)航鏈路的底層重構(gòu),NavCore把整個(gè)行業(yè)最復(fù)雜、最容易踩坑的集成工作都以標(biāo)準(zhǔn)化接口輸出。具身智能的研發(fā)團(tuán)隊(duì),也就自然能夠把有限的精力,釋放到上層的任務(wù)智能和應(yīng)用場(chǎng)景中,加速創(chuàng)新。
![]()
尾聲
伴隨場(chǎng)景從固定軌跡的簡(jiǎn)單Demo走向充滿不確定性的現(xiàn)實(shí)場(chǎng)景,具身智能正迎來(lái)它的成人禮。
而未來(lái)三到五年,能否把數(shù)據(jù)閉環(huán)、感知導(dǎo)航、本體控制這些看不見的環(huán)節(jié)做扎實(shí),會(huì)成為新的行業(yè)生存標(biāo)準(zhǔn)。
宸境科技在WAIC上交出的這兩個(gè)答卷:Looper是要把人類在物理世界中沉淀了數(shù)萬(wàn)年的勞動(dòng)力經(jīng)驗(yàn),低成本、規(guī)模化地編碼進(jìn)數(shù)字世界;NavCore在物理世界的連續(xù)性與不可逆性中,為機(jī)器人畫出確定性的行進(jìn)路線,或許正是其中關(guān)鍵。
也只有無(wú)限的人類經(jīng)驗(yàn)開始通過(guò)標(biāo)準(zhǔn)化的管道源源不斷地喂養(yǎng)模型,自主導(dǎo)航的工程門檻被降低到開箱即用,具身智能才有可能真正跨越從昂貴Demo到通用勞動(dòng)力的關(guān)鍵一步。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.