在近日的具身智能頂會 RSS(Robotics: Science and Systems)2026 上,最高獎項 Outstanding Paper Award 提名名單里,出現(xiàn)了一個不太 “機(jī)器人” 的名字 —— 影眸科技,一家頭部 3D 生成大模型公司。
這家公司為外界熟知,大多是因為它在 3D 生成領(lǐng)域的硬核實(shí)力:基于團(tuán)隊發(fā)布的原生 3D 大模型框架 CLAY(提名 SIGGRAPH2024 最佳論文),影眸在 2024 年推出了全球首個原生 3D 大模型產(chǎn)品 Hyper3D,如今該產(chǎn)品已出現(xiàn)在今年英偉達(dá) CES Keynote 、OpenAI 首屆黑客松冠軍項目等多個全球技術(shù)標(biāo)桿場景的 3D 資產(chǎn)生成工作流里,其企業(yè)客戶規(guī)模位居行業(yè)第一。
但影眸科技的研究和布局,并不止于生成。在具身智能方向,Hyper3D 的 Sim-Ready 功能可以一鍵為 3D 資產(chǎn)賦予重力、摩擦力等真實(shí)物理屬性,無縫導(dǎo)出到 Isaac Sim 等仿真環(huán)境,已經(jīng)成為具身團(tuán)隊訓(xùn)練「空間智能」的核心資產(chǎn)來源之一。今年 7 月,影眸科技在具身應(yīng)用領(lǐng)域再進(jìn)一步,聯(lián)合地瓜機(jī)器人、謀先飛發(fā)布了 “具身智能可訓(xùn)練仿真閉環(huán)聯(lián)合解決方案”,其世界生成模型 Hyper3D WorldGen 基于自研原生 3D 大模型 Hyper3D Rodin 與 CAST 框架(SIGGRAPH2025 最佳論文)實(shí)現(xiàn)了僅憑單張照片還原可交互三維場景,場景內(nèi)的 3D 物品均為原生 Sim-Ready 資產(chǎn),具備物理屬性,可直接用于仿真訓(xùn)練,打通從真實(shí)影像到具身可訓(xùn)練場景的端到端鏈路。
資產(chǎn) Sim-Ready 之后,一個更尖銳的問題隨之而來:如果仿真里訓(xùn)練出的策略,一到真實(shí)世界成功率就大幅下降、不具備部署價值,那仿真資產(chǎn)的價值又在哪里?
影眸團(tuán)隊用這篇研究成果給出了自己的答案。
![]()
影眸Hyper3D合伙人、物理 AI 事業(yè)部負(fù)責(zé)人 Joel Wang 作為共同一作、影眸科技作為署名單位參與完成的論文《cuNRTO: GPU-Accelerated Nonlinear Robust Trajectory Optimization》入圍了 RSS 2026 的最高獎項 Outstanding Paper Award 提名。
- 論文鏈接:https://www.roboticsproceedings.org/rss22/p102.pdf
- 項目主頁:cunrto.deemos.dev
![]()
此前十余年,RSS 的最高論文獎項長期由全球頂尖高校和實(shí)驗室占據(jù),中國大陸機(jī)構(gòu)與企業(yè)團(tuán)隊進(jìn)入候選名單的案例屈指可數(shù)。今年共有 8 篇論文獲得提名,其中僅兩篇成果包含由國人團(tuán)隊創(chuàng)立的商業(yè)公司的核心參與,分別是影眸科技和銀河通用。
這篇論文回答的,正是上面那道「從仿真到現(xiàn)實(shí)」的必答題:在充滿誤差與擾動的真實(shí)物理世界里,如何讓具身更快地算出安全的動作。它把非線性魯棒軌跡優(yōu)化的核心計算搬上 GPU,在獨(dú)輪車、四旋翼和 Franka 機(jī)械臂任務(wù)中實(shí)現(xiàn)最高139.6 倍加速,同時保持100%的安全約束。
從生成 Sim-Ready 的 3D 資產(chǎn),到讓仿真中訓(xùn)練出的智能走向 Real-World Ready,這是影眸研究版圖上關(guān)鍵而必然的一步。
仿真不必完美,策略要對不完美有所準(zhǔn)備
![]()
具身在仿真里學(xué)會的每一個動作,都建立在一個隱含假設(shè)上:世界會按模型訓(xùn)練時的環(huán)境那樣運(yùn)轉(zhuǎn),但真實(shí)世界絕不是如此。真實(shí)機(jī)器人面對的不是一個和仿真完全一致的物理世界,摩擦、控制誤差和外部擾動始終存在。
行業(yè)的傳統(tǒng)直覺是不斷提高仿真精度,讓模擬器盡量接近現(xiàn)實(shí)。但這條路有一條殘酷的漸近線,現(xiàn)實(shí)中的摩擦、接觸、材料屬性、執(zhí)行誤差不可能被完整復(fù)刻,Sim-to-Real Gap 是仿真訓(xùn)練真正落地繞不開的問題。
cuNRTO 選擇了另一條路,解決 Sim-to-Real,不一定要等待一個完美的 Simulator,也可以讓策略對 Simulator 的不完美具備魯棒性。
「仿真的上限,不只取決于它能多真實(shí),也取決于策略能否承受它不真實(shí)的部分。」Joel Wang 說。
這在技術(shù)上對應(yīng)控制領(lǐng)域一個經(jīng)典方向 — 魯棒軌跡優(yōu)化(Robust Trajectory Optimization)。思路可以用一句話概括:既然擾動無法被精確預(yù)測,那就把能夠被界定的模型誤差與外部擾動,顯式表示為一個有界的結(jié)構(gòu)化不確定性集合(uncertainty set),然后在規(guī)劃階段提出硬性要求。對集合內(nèi)的每一種可能擾動,軌跡都必須滿足全部安全約束:避障、關(guān)節(jié)限位、力矩上限,一個都不能違反。
換句話說,這是一種最壞情況保證(worst-case guarantee)。相比只能給出概率性保證的隨機(jī)方法,它對機(jī)械臂操作、飛行器避障這類安全攸關(guān)場景更為根本。而且求解的產(chǎn)物不只是一條名義軌跡,還有一組隨時間變化的反饋增益 — 機(jī)器人在執(zhí)行中一旦被擾動帶偏,可以依據(jù)實(shí)時估計的擾動即時糾偏。
聽起來很美好,但有一大難題:這類問題,此前根本算不動。
從 8 個小時到 218 秒:算不動的魯棒優(yōu)化,是怎么被搬上 GPU 的
為什么算不動?直覺層面,「對所有擾動都成立」意味著無窮多條約束 — 不確定性是連續(xù)取值的,無法逐一枚舉,問題在原始形式下不可解。
此前的 NRTO(Nonlinear Robust Trajectory Optimization)框架給出了一條可行路徑:外層對非線性動力學(xué)和約束做逐次線性化(successive linearization),內(nèi)層通過魯棒約束重構(gòu),把無窮多條約束轉(zhuǎn)化為有限個二階錐規(guī)劃(SOCP)約束,再用交替方向乘子法(ADMM)求解。這套框架在理論上足夠優(yōu)雅,非線性動力學(xué)、非線性約束都能處理。
但工程上,它撞在了一堵墻上,SOCP 子問題依賴內(nèi)點(diǎn)法(Interior Point Method)求解。內(nèi)點(diǎn)法精度高,卻是一種以大規(guī)模矩陣分解為核心的串行算法,每次迭代都要重新分解一個隨問題規(guī)模膨脹的 KKT 系統(tǒng)。系統(tǒng)維度一高、約束一多,計算量爆炸式增長。
論文給出的基線數(shù)據(jù)非常直觀,一個帶五個障礙物的獨(dú)輪車(unicycle)任務(wù),原始 NRTO 要算30423 秒— 超過 8 個小時;四旋翼任務(wù)也要 13374 秒。這樣的速度,魯棒優(yōu)化只能停留在論文里,談不上任何部署價值。
與此同時,從剛體動力學(xué)梯度并行化,到實(shí)時非線性 MPC,把優(yōu)化搬上 GPU 已是明確趨勢。麻煩在于,NRTO 的原始結(jié)構(gòu),嵌套雙層循環(huán)加串行內(nèi)點(diǎn)法,天然不適合并行。
cuNRTO 的貢獻(xiàn),就是通過兩次算法層面的架構(gòu)重構(gòu),把這套串行算法改寫成 GPU 友好的形態(tài)。
第一步:NRTO-DR,用算子分裂替換內(nèi)點(diǎn)法。
![]()
NRTO-DR 架構(gòu)圖
直覺上,這一步做的事情是把一個龐大而串行的求解器,拆成大量小而獨(dú)立的基本計算操作。
具體而言,團(tuán)隊用經(jīng)典的 Douglas-Rachford 分裂方法重寫了內(nèi)層最昂貴的 SOCP 子問題,將其分解為兩類操作。其一是稀疏線性求解,由于內(nèi)層迭代中 KKT 系統(tǒng)的系數(shù)矩陣保持不變,只需做一次 Cholesky 分解,之后每次迭代復(fù)用三角求解,直接推翻了內(nèi)點(diǎn)法「每步重新分解」的成本結(jié)構(gòu)。其二是二階錐投影,把一個點(diǎn)投影到二階錐上只有三種幾何情形,且每條約束的投影彼此完全獨(dú)立,是典型的可大規(guī)模并行問題。
GPU 實(shí)現(xiàn)上,稀疏分解與三角求解交給 cuDSS,錐投影由定制 CUDA kernel 完成。每條約束映射到一個 warp,向量運(yùn)算通過 cuBLAS 全程留在設(shè)備端。
效果立竿見影:無障礙獨(dú)輪車任務(wù)從 30423 秒降到 1934 秒。
但團(tuán)隊在 profiling 時發(fā)現(xiàn)了新的瓶頸,43.5% 的運(yùn)行時間花在 CPU 與 GPU 之間的同步上,真正的錐投影計算只占 11%,GPU 平均利用率僅 34.9%。算法快了,數(shù)據(jù)卻在 GPU 與主機(jī)之間來回搬運(yùn),把省下的時間又還了回去。
第二步:NRTO-FullADMM,整個內(nèi)循環(huán)搬進(jìn) GPU。
![]()
NRTO-FullADMM 架構(gòu)圖
這是論文真正的核心創(chuàng)新。它不再滿足于替換子求解器,而是重構(gòu)了內(nèi)層 ADMM 本身的分塊結(jié)構(gòu),通過引入新的松弛變量,把二階錐投影直接「壓」進(jìn) ADMM 的第一個更新塊 — 原本需要嵌套一層 DR 求解器才能完成的事,變成了 ADMM 迭代中的一步原生投影,嵌套結(jié)構(gòu)被抹平了。
由此帶來關(guān)鍵的工程紅利是,整個內(nèi)循環(huán)可以完整跑在 GPU 上。每個外層線性化迭代只需向 GPU 上傳一次約束數(shù)據(jù)與常量算子,之后的仿射求值、并行錐投影、QP 更新、反饋增益、對偶更新與殘差檢查,全部在設(shè)備端完成,直到收斂才把結(jié)果傳回。
GPU 到主機(jī)通信瓶頸被徹底消除,GPU 平均利用率從 34.9% 提升至86.5%
速度提了兩個數(shù)量級,安全一分沒讓
![]()
使用 cuNRTO 規(guī)劃 Franka 機(jī)械臂軌跡
論文在獨(dú)輪車、四旋翼和 7 自由度 Franka 機(jī)械臂三類系統(tǒng)上做了系統(tǒng)評測,對時間步長、不確定性水平、障礙物數(shù)量三個維度分別做了實(shí)驗。幾組關(guān)鍵數(shù)字:
- 獨(dú)輪車五障礙任務(wù):30423 秒 →218 秒,加速139.6 倍
- 四旋翼五障礙任務(wù):13374 秒 → 200 秒,加速 66.9 倍;
- Franka 機(jī)械臂(14 維狀態(tài)、7 維力矩輸入,包含關(guān)節(jié)限位、速度限制、力矩邊界與避碰約束):3949 秒 → 152 秒,加速 25.9 倍。
更重要的是,所有加速都沒有以安全為代價。通過 1000 次隨機(jī)擾動采樣,加上 1000 次專門探測不確定性集合邊界的極端用例,合計 2000 次 Monte Carlo rollout 驗證:在考慮線性化誤差的設(shè)定下,所有任務(wù)、所有擾動實(shí)現(xiàn)均保持100% 約束滿足。三種求解器的最優(yōu)目標(biāo)值差異不到 0.5%,但速度提升兩個數(shù)量級,解的質(zhì)量沒有退化。
這項工作的核心,是同時處理速度和魯棒性,而不是用安全換速度。
![]()
![]()
值得一提的是,論文還在 Robotarium 平臺上完成了真機(jī)驗證,擾動集合直接從開環(huán)執(zhí)行的殘差中估計,NRTO 輸出的反饋策略在線估計擾動、實(shí)時糾偏,最終穩(wěn)定駛?cè)肽繕?biāo)區(qū)域。而只執(zhí)行名義控制序列的對照組,出現(xiàn)了肉眼可見的漂移。
擾動不必被精確建模,只需被界定;世界不必完美,策略只需對不完美有所準(zhǔn)備。這套方法論在真實(shí)硬件上跑通了完整閉環(huán)。
據(jù)了解,團(tuán)隊正在與英偉達(dá)進(jìn)一步推進(jìn) GPU 側(cè)優(yōu)化,目標(biāo)是把相關(guān)計算繼續(xù)壓縮至毫秒級。一旦達(dá)成,魯棒優(yōu)化將不再只是離線規(guī)劃工具,而是具備在線控制能力的實(shí)時組件。
一家 3D 生成公司,憑什么入圍具身頂會最佳論文?
![]()
![]()
回到開頭的問題:一家 3D 生成公司,為什么要下場做機(jī)器人控制?
把影眸Hyper3D近幾年的研究工作擺在一起,答案會自己浮現(xiàn):
- CLAY(SIGGRAPH2024 最佳論文提名):原生 3D 生成基礎(chǔ)模型,解決三維物體如何生成;
- DressCode(SIGGRAPH2024 最佳論文提名):自回歸 3D 生成架構(gòu)探索;
- BANG (SIGGRAPH2025 Top 10 技術(shù)論文速覽):通過生成式方法理解物體內(nèi)部結(jié)構(gòu)、實(shí)現(xiàn) 3D 資產(chǎn)遞歸分件,解決物體結(jié)構(gòu)如何理解和拆解;
- CAST(SIGGRAPH 2025 最佳論文):從單圖重建包含物體關(guān)系與物理約束的完整 3D 場景,解決完整場景及物理關(guān)系如何重建;
- cuNRTO(RSS 2026 最佳論文提名):解決智能體如何在存在不確定性的環(huán)境中安全行動。
生成物體 → 理解結(jié)構(gòu) → 構(gòu)建場景 → 在物理場景中行動。這不是四篇孤立的論文,而是同一張研究版圖上環(huán)環(huán)相扣的四塊拼圖,也對應(yīng)著影眸正在打通的業(yè)務(wù)閉環(huán),Hyper3D 的 Sim-Ready 功能為具身智能持續(xù)生產(chǎn)可仿真的 3D 資產(chǎn),cuNRTO 則在探索讓基于這些資產(chǎn)訓(xùn)練出的智能真正走向 Real-World Ready。影眸的定位也變得清晰:它正在成為連接生成世界、仿真世界與真實(shí)世界的 3D 智能基礎(chǔ)設(shè)施。
支撐這張版圖的,是一個在創(chuàng)業(yè)公司里相當(dāng)罕見的全球頂級科研團(tuán)隊。影眸Hyper3D是業(yè)內(nèi)唯一連續(xù)多年獲得 SIGGRAPH 最佳論文及提名的商業(yè)公司,算法團(tuán)隊每 2 人中就有 1 人獲得或被提名過頂會最佳論文,約 70% 的科研成果實(shí)現(xiàn)了產(chǎn)品轉(zhuǎn)化。
這種研究密度今年還在加碼,SIGGRAPH 2026 上,影眸共有 6 篇論文被接收 — 對一家 60 人的創(chuàng)業(yè)公司而言,這是足以對標(biāo)全球頂級實(shí)驗室的產(chǎn)出。
![]()
團(tuán)隊在大會現(xiàn)場設(shè)了展位,演示 Hyper3D 的實(shí)時生成,人流幾乎沒斷過,其中相當(dāng)一部分是 Hyper3D 的老用戶,圍上來當(dāng)面提需求、給反饋。
![]()
同一個會場里,論文在講臺上被宣讀,產(chǎn)品在展臺前被用戶圍住,這無疑是「研究即產(chǎn)品」這條路線最具象的畫面。
![]()
在影眸Hyper3D,研究者擁有真正的問題定義權(quán),可以探索不直接服務(wù)于短期產(chǎn)品版本的長期問題。研究與產(chǎn)品不是兩套割裂的體系,CLAY、BANG、CAST 最終都進(jìn)入了產(chǎn)品與產(chǎn)業(yè)場景,多位核心研究者本身就是公司合伙人和核心決策者。身兼創(chuàng)業(yè)者與一線研究者的 Joel Wang,正是其中之一。
「這次提名當(dāng)然是對論文的認(rèn)可,但對我們更重要的是,它再次證明影眸有能力支持非常前沿、甚至不直接服務(wù)于短期產(chǎn)品版本的研究。我們希望影眸最終成為一支真正理解三維世界、也能夠持續(xù)定義前沿問題的 Research Lab。」Joel Wang 說。
從 SIGGRAPH 到 RSS,從圖形學(xué)到機(jī)器人學(xué),一個判斷正在變得清晰:影眸正在從一家 3D 生成模型公司,成長為一個覆蓋 3D 表示、生成、理解、場景構(gòu)建與智能體控制的研究團(tuán)隊,這些工作共同指向未來三維物理世界的建模、理解與交互。
當(dāng)具身智能的敘事聚焦于本體與大模型時,不容忽視的是,具身能否走進(jìn)充滿干擾、摩擦與誤差的現(xiàn)實(shí)世界。而在具身走向現(xiàn)實(shí)世界的關(guān)鍵一步上,像影眸這樣連接生成、仿真與現(xiàn)實(shí)世界的 3D 智能基礎(chǔ)設(shè)施將會是不可或缺的。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.