![]()
機器人的視覺戰爭:一家中國公司的具身智能基建野心。
2026年7月,上海WAIC。
走進具身智能展區,一種混雜了焦慮與狂熱的微妙氛圍充斥著整個展館。兩年前的WAIC,這里只有18家企業吃螃蟹;去年已經飆升到80家;再到今年,參展數量已經悄然突破了200家。
比摩爾定律還快的增長速度背后,不僅有各種終端玩家在大放異彩;伴隨模型算法的架構紅利走到階段性瓶頸,以宸境科技為代表,過去深藏在水底之下的數據Infra供應鏈玩家,也開始走到聚光燈下。
![]()
數據如何成為具身智能的阿喀琉斯之踵
要理解數據之于具身智能的重要性,自動駕駛就是一面最好的鏡子。
把具身智能拆分成不同環節來看,其實智能駕駛,只是具身智能版圖中的一個特定子任務。但強如特斯拉和國內一眾造車新勢力,在數百萬用戶數據源源不斷上傳云端的前提下,死磕了近十年的情況下,依然在面對各種離奇的Corner Cases時戰戰兢兢。
而具身智能所面對的場景,復雜度比自動駕駛高出了不止一個數量級:
第一層,是從二維到三維的幾何升維:汽車只需要處理X-Y平面的移動,而機器人的手眼協調是在完全開放的三維空間里進行。
第二層,是自由度的指數級爆炸:汽車只有方向盤和油門剎車,人形機器人的自由度(DoF)動輒幾十個,這意味著可能出現的動作范圍呈指數級增加。
第三層,則是嚴重的數據不對稱:相比自動駕駛,能提供優質數據反饋的機器人數量,少得可憐。
更關鍵的是,具身智能需要的不是普通的視頻數據,而是帶有空間結構和任務邏輯的具身經驗。
“互聯網上多的是海量的視頻,但對具身智能來說,沒有可靠位姿的視頻只是垃圾素材。”宸境科技相關專家直言,“二維地圖只需要描述平面,而機器人則需要知道自己在三維空間里的絕對位置、姿態、運動軌跡和任務狀態。只有具備穩定軌跡、時間同步、空間對齊和質量評估的數據,才算得上是可訓練的硅基經驗。而這些,需要的是SLAM/VIO、魯棒的6DoF軌跡、實時在線輸出和軌跡評分等數據。”
過去一年多,宸境科技正是看準了這塊數據荒漠,憑借Insight空間智能相機、TinyNav導航算法庫等底層組件,拿下了一眾頭部大廠的合作。
![]()
但到了今年,宸境科技發現,行業的痛點,已經不止是單一的硬件或者導航算法。一套可規模化采集、可驗證、可復用的數據閉環基礎設施,才是讓各大具身智能終端快速進化的根本。
也是因此,在今年的WAIC展臺上,這家以物理AI基礎設施為標簽的公司,推出了兩款代表性產品:Looper具身智能數采系統NavCore具身智能自主導航大腦
它們所針對的,正是具身智能行業在數據層面遇到的兩大難題:真實世界的高質量數據如何規模化量產,以及機器人本體端如何實現高穩定的環境感知與自主導航。
![]()
Looper數采系統:給機器人裝上第一視角學習能力
在具身智能數據采集的戰場上,目前有三種主流技術路線:遙操作+VR、可穿戴多視角、固定多機位studio。
遙操作最大的優勢是能夠直接獲得機器人動作數據,適合訓練機器人執行策略。但它通常依賴專用設備,采集成本較高,效率有限,同時數據分布容易受到機器人本體形態和操作方式的限制。
固定多機位采集具有很強的可控性,可以獲得高質量、多視角數據,但依賴特定場地和設備,難以覆蓋家庭、工廠、商業環境中的大量真實任務和長尾場景。
考慮以上背景,Looper選擇了Ego-centric多視角方案,它的核心理念是:讓人類戴著機器人視角去完成任務,把人類數萬年積累的肉身經驗,無感地、低成本地轉化為機器人看得懂的數字資產。
在業內看來,這種最接近人類完成任務時的感知方式,同時也是最有潛力、較低成本實現真實場景數據規模化的路線。
![]()
配置上,Looper采用了頭部+雙手的黃金組合多視角方案:頭部Insight相機負責記錄第一視角視覺信息、空間環境和自身運動軌跡;雙手相機負責捕捉近距離操作細節,包括手部運動、物體交互和局部空間變化;背包端則提供邊緣計算、同步記錄和數據存儲能力。
但這絕不是簡單的把幾個攝像頭綁在身上錄像。"采集數據容易,采集有效數據才是壁壘。Looper做的是采有效數據、采高質量數據。"宸境科技聯合創始人兼首席運營官(COO)顏沁睿給我們舉了個例子:數據采集過程中,多相機之間的空間和時間對齊是一個非常關鍵的行業難點。如果不同視角下的圖像、深度信息、慣性數據(IMU)和位姿軌跡無法在同一個時空坐標系下保持高頻同步,訓練出來的機器人就會動作失調。
針對這個問題,宸境科技選擇了在端上直接完成VSLAM的6自由度軌跡計算并輸出的技術方案。
過去做具身智能的數據采集,行業通用的做法是采集一整天,拿回去用服務器離線跑幾天三維重建,才發現數據對齊失敗,整批報廢。而Looper借助端上直接輸出VSLAM,在現場就能實時知道每一幀畫面的空間位置,不合格當場重測。
該方式的另一大優勢則在于圖像、IMU和6DoF(六自由度)軌跡在端側天然對齊,后續的三維重建和任務切分成本呈斷崖式下跌。
最終檢索時,客戶拿到的也不是一堆無序的視頻文件,而是可以按照空間區域、運動軌跡、任務階段精準檢索的高質量經驗包,真正讓原始視頻由此轉化為真正可學習、可驗證的數據。
據悉,宸境科技還正規劃推出新一代四目大視場數采頭環,核心優化方向為輕量化佩戴、無束縛自然采集。全新方案將還原人類分層感知邏輯:以余光兼顧全局環境,視線鎖定身前交互物體,從感知底層完成機器人數據采集方案升級。
![]()
NavCore導航大腦:如何讓機器人從能走路到會走路
如果說Looper解決的是數據生產問題,那么NavCore要解決的則是機器人的自主導航問題。
過去,具身智能公司在導航這件事上,過得像個高級系統集成商:
從A廠商買相機,去B廠商挑算力板,找C團隊買定位算法,然后研發團隊通宵達旦地寫驅動、調校傳感器、對齊時間戳。
作為這一切,現場部署中無線網絡的頻繁掉線、多板卡供電不均、接口適配等瑣碎的臟活累活,往往也會吞噬掉研發團隊大量時間。
此外,在整個鏈路中,相機的微小延遲會放大定位誤差,定位誤差會直接污染全局地圖,地圖更新慢了又會導致路徑規劃撞墻。任何一個環節抖動,都可能直接導致任務失敗。
更不用說,橫向對比過去的2D導航方案,3D導航在相同分辨率下,數據量會提升一個數量級以上,同時還會增加點云處理、碰撞檢測和路徑規劃的計算壓力。
軟件算法的難度升級了,但硬件上面臨的條件也更苛刻了:過去基于2D的自動駕駛,可以搭載的空間,是龐大的汽車;而具身智能需要把3D導航能力部署到低成本嵌入式平臺上。
面對以上問題,作為具身智能的自主導航大腦,NavCore的做法是:大集成與標準化。它可以把復雜的機器人導航工程封裝為可部署產品,使客戶無需從零搭建感知、算力、建圖、定位和導航鏈路。
![]()
硬件上,它以NVIDIA Jetson系列作為算力底座,深度融入全球主流開發者生態;同時將自研的Insight空間智能相機、計算、通信、電源管理進行模塊化一體設計,降低集成復雜度。
這里面比較值得一提的是宸境科技自研的Insight空間智能相機,傳統攝像頭只要在固定機位把畫面拍清楚就解決了90%的問題,但在具身智能場景,不僅需要高畫質,還要有足夠大的視場、極低的感知延遲、可靠的傳感器同步,以及在振動、急轉、弱光、強光和動態遮擋下持續輸出穩定位置和姿態的能力。
![]()
這種需求決定了鏡頭、傳感器、慣性測量單元、芯片和算法不能各自獨立設計。為此,Insight采用了188度超廣角視場、工業級慣性測量單元和端側算力,在設備本地完成視覺定位、深度計算和空間感知,讓具身智能不僅能看得見,也能精準理解復雜的空間關系。
而最終的軟件算法上,宸境科技還通過算法裁剪、計算優化、硬件加速以及模型量化壓縮,把原本需要服務器級別算力的空間智能,塞進了低成本的機器人端側,還能長期穩定運行。
此外,考慮到過去很多機器人項目都需要針對不同本體,以及不同場景重新做一套系統集成,包括傳感器選擇、算力適配、驅動開發、坐標系標定、算法部署和現場調試等等。這導致機器人開發周期長,方案難以復制,也是行業規模化落地的重要瓶頸。
NavCore不僅內置了宸境硬核的TinyNav視覺導航算法,還可以提供基于ROS2的標準化接口輸出。無論是人形、四足、AMR還是無人機,還是智慧園區全域空間感知與多機器人調度、工業巡檢厘米級自主巡檢與動態避障、港口物流復雜環境實時導航與任務執行、文旅導覽智能路徑引導與沉浸式講解等場景,都能快速遷移、開箱即用。
通過對整個導航鏈路的底層重構,NavCore把整個行業最復雜、最容易踩坑的集成工作都以標準化接口輸出。具身智能的研發團隊,也就自然能夠把有限的精力,釋放到上層的任務智能和應用場景中,加速創新。
![]()
尾聲
伴隨場景從固定軌跡的簡單Demo走向充滿不確定性的現實場景,具身智能正迎來它的成人禮。
而未來三到五年,能否把數據閉環、感知導航、本體控制這些看不見的環節做扎實,會成為新的行業生存標準。
宸境科技在WAIC上交出的這兩個答卷:Looper是要把人類在物理世界中沉淀了數萬年的勞動力經驗,低成本、規模化地編碼進數字世界;NavCore在物理世界的連續性與不可逆性中,為機器人畫出確定性的行進路線,或許正是其中關鍵。
也只有無限的人類經驗開始通過標準化的管道源源不斷地喂養模型,自主導航的工程門檻被降低到開箱即用,具身智能才有可能真正跨越從昂貴Demo到通用勞動力的關鍵一步。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.