henry 聽雨 發自 悉尼
量子位 | 公眾號 QbitAI
剛剛,機器人頂會RSS 2026論文獎項出爐!
作為機器人領域公認最具學術影響力的國際會議之一,RSS(Robotics: Science and Systems)的獲獎論文,一直被視為觀察機器人研究風向的一扇窗口,代表了這個領域的最新階段進展。
今年,RSS共收到708篇投稿,最終錄用210篇,接收率僅29.7%。
8篇論文進入最終名單后,三項最佳論文獎揭曉,其中來自韓國團隊的FlashSAC拿下最佳論文。
![]()
其余Final List中,清華AIR、銀河通用、影眸科技等中國團隊和華人研究者也有亮眼表現。
此前備受關注的Early Career Spotlight環節,李弘揚、Wenzhen Yuan等華人學者同樣登場給出了精彩的報告。
話不多說,我們直接來看。
三項論文大獎出爐
最佳論文:FlashSAC
最佳論文獎頒給了來自Holiday Robotics、KAIST、KRAFTON、TU Darmstadt、KTH 等機構的聯合團隊。
共同一作為Holiday Robotics研究科學家Donghu Kim與KAIST 碩士生Youngdo Lee
![]()
他們提出的FlashSAC,試圖解決離策略強化學習用于高維機器人控制時訓練慢、容易不穩定的問題。
它的核心思路,是減少梯度更新次數,同時擴大模型規模、數據吞吐量和經驗池,并通過限制權重、特征與梯度范數,抑制價值網絡誤差持續累積。
在10種模擬器、60余項任務中,FlashSAC整體超過PPO及多種離策略基線。
更直觀的是,在人形機器人行走的Sim2Real實驗中,它把訓練時間從數小時壓縮到了數分鐘。
最佳學生論文:Muninn
今年RSS的最佳學生論文頒給了Muninn: Your Trajectory Diffusion Model But Faster
![]()
這項工作來自伊利諾伊大學厄巴納-香檳分校、佛羅里達國際大學和普羅維登斯學院的聯合團隊。
第一作者Gokul Puthumanaillam是UIUC博士生,師從Melkior Ornik。
Muninn為軌跡擴散模型加入了一套無需重新訓練的緩存機制。
在每一步去噪時,它都會估計復用此前計算結果可能帶來的軌跡偏差:風險較小時,直接調用緩存;風險較大時,再重新計算。
在離線強化學習、運動規劃和視覺運動策略等任務中,Muninn最高實現4.6倍加速,同時基本保持原有的任務表現和安全指標。
團隊還在真實機器人的閉環導航和操作任務中驗證了這套方法。
最佳系統論文:NeuralActuator
最佳系統論文獎頒給了NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception。
![]()
第一作者Zhiyang Dou是MIT CSAIL博士生,此前曾在香港大學攻讀碩士、本科畢業于山東大學。
這項工作瞄準低成本機械臂的一個關鍵問題:摩擦、回差和溫度變化會讓傳統的電流—力矩關系失準,進而擴大仿真與真機之間的差距。
NeuralActuator利用Transformer和可微分仿真,同時預測執行器力矩、外部接觸力、接觸概率和電機狀態,讓機器人在部署時無需專門的力/扭矩傳感器,也能感知受力。
團隊還發布了雙臂遙操作采集的NAD數據集,并在價格從約500美元到3萬美元以上的三類機械臂上完成驗證。
實驗展示了其在動力學建模、無傳感器力感知、電機狀態檢測和模仿學習控制中的應用。
8篇論文殺入Final List
除了最終獲獎的三篇論文,今年還有5篇工作進入了最終決賽名單(Final List)。
有一說一,今年的Final List相當有含金量。
據稱,大會會先從全部錄用論文中篩出50篇候選論文。這些論文均獲得評審人和領域主席(AC)給出的至少兩個Strong Accept。
隨后,獎項委員會進一步選出23篇半決賽論文,其中16篇獲得三個Strong Accept,另外7篇由高級領域主席(SAC)推薦產生。
最終,8篇論文進入Final List,并在會議期間評選出最佳論文、最佳學生論文和最佳系統論文。
![]()
1、自動合成會聊天的仿生機器人面部機構
第一篇是Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots。
這項工作來自清華大學智能產業研究院(AIR)、北京智源人工智能研究院、清華大學交叉信息研究院和北京航空航天大學。
Zongzheng Zhang與Zi Lin為共同第一作者,清華大學趙昊擔任通訊作者。
![]()
2、把連續動作壓縮成有順序的Token
第二篇是OAT: Ordered Action Tokenization
這項工作主要來自哈佛大學Yilun Du團隊與斯坦福大學,第一作者劉晁企,他目前在斯坦福擔任RA,長期從事機器人策略學習與動作表征研究。
論文提出OAT(有序動作分詞),解決自回歸機器人策略中連續動作難以轉化為離散Token的問題。
它會把一段連續動作壓縮為具有因果順序的短Token序列:前幾個Token描述大致動作,后續Token逐步補充更精細的細節。
因此,機器人可以根據算力與實時性需求,在推理速度和動作精度之間靈活取舍。
在覆蓋4類仿真基準、真實機器人在內的20余項任務中,采用OAT的自回歸策略整體超過此前的動作分詞方案和擴散策略基線。
![]()
此外,由于作者就坐在我們前面,我們直接抓來采訪。
晁企介紹,團隊近期還擴展了一個更完整的版本。除了自回歸策略,新版本還加入了knowledge-insulated/token co-training VLA。
希望大家看看新論文。
![]()
3、機器人也會「借力打力」了
第三篇是銀河通用參與的Emerging Extrinsic Dexterity in Cluttered Scenes via Dynamics-aware Policy Learning
![]()
這項工作由中國科學院自動化所、北京智源研究院、Galbot、北京大學和上海交通大學聯合完成。
鄭一新與北京大學博士生呂江燃為共同第一作者,呂江燃同時擔任項目負責人。該論文通訊作者為銀河通用機器人創始人兼首席技術官、北京大學研究員、具身智能大模型北京市重點實驗室主任王鶴博士
論文提出動力學感知策略學習框架DAPL
它先通過世界模型學習雜亂場景中物體發生碰撞、滑動和傾倒后的動態變化,再用這些動力學表征指導強化學習。
由此,機器人不再只依賴直接抓取,也能借助周圍物體和環境接觸,完成推、撥、翻轉等「外在靈巧操作」。
量子位在現場采訪了呂江燃。他表示,模型學會這些操作并非依靠復雜的reward hacking,而是由模型自主涌現出的能力。
在未見過的仿真雜亂場景中,相較抓取、人工遙操作及已有表征學習方法,DAPL的成功率提升超過25%。
在10類真實場景中,其成功率約為50%,并已用于貨架雜貨整理與取物任務。
4、把魯棒軌跡優化從小時級壓到秒級
第四篇是cuNRTO: GPU-Accelerated Nonlinear Robust Trajectory Optimization
![]()
王嘉維Arshiya Taj Abdul為共同第一作者。
論文提出GPU加速的非線性魯棒軌跡優化框架cuNRTO。它要解決的問題是:當機器人面對模型誤差、外部擾動等不確定因素時,如何依然生成滿足安全約束的運動軌跡。
其核心,是重新設計兩套適合GPU并行計算的優化架構,再利用CUDA加速原本最耗時的二階錐投影和反饋增益優化,大幅提高魯棒軌跡優化的求解效率。
量子位在現場采訪了第一作者王嘉維。他目前是影眸科技合伙人、物理AI事業部負責人,同時在劍橋大學攻讀博士。
在他看來,這項工作的一個重要價值,是縮小具身智能的Sim2Real Gap
仿真無法完全還原真實物理世界,導致仿真訓練的策略部署到真實機器人時,常受模型誤差和環境擾動影響。cuNRTO 將這些不確定性建模并納入魯棒優化,讓機器人在規劃階段提前考慮最壞情況。
過去,這類優化在復雜場景中需數十分鐘甚至數小時;如今已縮短至秒級,團隊計劃與英偉達合作推進至毫秒級。未來還可結合影眸科技的仿真資產,在多樣化物理環境中生成數據、訓練魯棒策略,提升sim-to-real可靠性。
5、用可微分仿真教機器鰻游泳
第五篇是Realizing Robotic Swimming with Unified Fluid-Robot Multiphysics
![]()
這項工作來自卡內基梅隆大學(CMU)
第一作者Jeong Hun Lee于2026年4月獲得CMU機器人學博士學位,師從Zachary Manchester與Carmel Majidi,研究方向集中在流體—機器人交互、動力學建模與水下仿生運動。
論文提出了一套統一、可微分的流體—機器人多物理場仿真框架
它把機器人的多剛體動力學與水流的納維—斯托克斯方程,放進同一個優化問題中求解,從而更準確地模擬機器人身體與周圍流體之間復雜的渦流作用。
借助仿真器提供的梯度,團隊為一條六節仿生機器鰻優化出波浪式游動,以及魚類受驚時的C形快速轉向動作,并成功遷移到真實硬件。
在高幅度游動實驗中,其軌跡誤差相比粒子流體基線最高降低約75%。
兩項「時間檢驗獎」,致敬經典工作
今年還有兩項名稱相近、但歸屬不同的「時間檢驗獎」:一項來自IJRR,另一項由RSS頒發。
IJRR時間檢驗獎:EuRoC微型無人機數據集
今年的IJRR Test of Time Award,授予十年前由蘇黎世聯邦理工學院(ETH Zurich)自主系統實驗室Roland Siegwart團隊發表的經典工作The EuRoC Micro Aerial Vehicle Datasets
![]()
論文首次發布了11組標準化微型無人機視覺—慣性數據集,包含同步雙目圖像、IMU測量以及高精度位姿真值。
數據覆蓋工業環境和動捕實驗室,從緩慢飛行到高速運動、弱光和運動模糊等復雜場景。
它為視覺慣性定位(VIO)、SLAM以及三維重建提供了統一評測基準,也成為過去十余年機器人視覺領域最具影響力的數據集之一。
RSS時間檢驗獎:高柔順、欠驅動機器人手
RSS 2026 Test of Time Award,則授予柏林工業大學機器人學者Raphael Deimel與機器人操作領域學者Oliver Brock。
獲獎論文是二人于2014年發表的A Novel Type of Compliant, Underactuated Robotic Hand for Dexterous Grasping。
![]()
簡單來說,這項工作提出了一種高柔順、欠驅動的擬人機器人手。
![]()
研究團隊證明,僅靠少量驅動器,就能完成豐富的抓取姿態;同時利用手部與物體接觸時產生的自然機械耦合,實現復雜而穩定的靈巧抓取。
這款基于軟體機器人思路設計的機械手,還具備抗沖擊、安全、耐灰塵和液體、制造成本低等特點,為后來柔順機器人手的發展奠定了基礎。
Early Career Spotlight 20周年:四位青年學者,四條機器人前沿路線
在RSS正式開始前,官方還公布了今年的Early Career Spotlight(青年學者聚焦獎)獎項。
四位入選者分別是:
- 香港大學助理教授、源策未來創始人李弘揚
- 法國Inria Rennes終身研究員Marco Tognon
- MIT EECS副教授Pulkit Agrawal
- UIUC助理教授Wenzhen Yuan
![]()
Early Career Spotlight旨在表彰已在機器人領域取得突出成果、同時展現出發展潛力的青年研究者。
在現場,量子位也聽完了四位學者的報告。
![]()
值得一提的是,今年也是Early Career Spotlight獎項設置的20周年。此前,機器人領域教父級人物pieter abeel和sergey levine也曾獲此殊榮。
會議現場,四位學者分別圍繞自己近年來最重要的研究方向進行了主題報告,也勾勒出機器人領域未來幾年的幾條重要技術路線。
李弘揚:從全身控制,走向全身智能
曾提出端到端自動駕駛奠基性工作UniAD(2023 CVPR best paper)的李弘揚教授,分享了其團隊最新方向——Whole Body Intlligence(全身智能)
![]()
他認為,機器人的能力正在從導航、操作、運動控制等單項能力,向移動操作等組合能力演進。下一階段的關鍵,則是從Whole-Body Control(WBC,全身控制)邁向Whole-Body Intelligence
二者有什么區別?
全身控制關注平衡、穩定、接觸約束等底層控制問題,目標是讓機器人完成一個動作;全身智能則希望機器人能夠調動整個身體,在復雜環境中完成長時程、多任務的自主決策與協同執行。
為此,李弘揚提出了一套以大規模預訓練為核心的技術架構。
底層由行為基礎模型(Behavior Foundation Model)學習身體先驗和運動約束;中間層負責身體狀態感知與動作生成;頂層則由具備語言、記憶和規劃能力的「大腦」統一調度。
這套架構希望在不同時間尺度上完成任務編排與持續學習,最終形成完整的全身智能系統。
圍繞這一方向,李弘揚團隊已經開展了一系列探索,包括提出局部移動操作(Loco-Manipulation)框架、構建面向人形機器人的EgoHumanoid第一人稱全身數據集、探索基于世界模型的強化學習后訓練,以及實現無需外部動作捕捉和定位設備的人形機器人自主乒乓球系統。
在他看來,全身智能是一項系統工程。它不僅需要模型突破,還需要算法、數據、硬件和評測體系共同實現規模化發展,最終推動機器人獲得跨任務、跨環境的泛化能力。
![]()
Wenzhen Yuan:有了觸覺傳感器,還不等于有了觸覺智能
Wenzhen Yuan的報告圍繞「機器人如何理解并利用觸覺」展開。
她指出,GelSight等光學觸覺傳感器,可以獲取接觸幾何、力和形變等高分辨率信息。但傳感器只是起點,真正的關鍵,是如何把觸覺轉化為操作能力。
傳統力學方法可以支持穩定抓取、線纜穿繞、開門、滑移檢測和液體屬性識別,但高度依賴人工設計與特定傳感器。
數據驅動方法更能適應復雜、嘈雜的環境,卻又受到觸覺數據規模小、不同傳感器之間域差距大等限制。
為此,團隊利用物理仿真,生成大量來自不同虛擬傳感器的數據,學習與傳感器無關的觸覺表征,進而實現跨傳感器的零樣本遷移。
她還強調,機器人手指的形狀、相機、光源和材料,也應該與感知和操作策略協同設計。
換句話說,觸覺智能并不只是一個傳感問題,而是傳感、數據、模型與機器人形態共同優化的問題。
Marco Tognon:讓無人機不只會飛,也能干活
![]()
Marco Tognon聚焦的是「空中物理交互」。
也就是讓無人機不只會飛行和拍攝,還能接觸環境、搬運和操作物體,完成巡檢維護、裝配施工等實體任務。
他的報告回顧了無人機從簡單接觸任務走向復雜空中操作的過程,并進一步展望無人機與其他機器人、人類安全協作、共同完成實體工作的可能性。
Pulkit Agrawal:具身智能還缺力智能與終身學習
![]()
Pulkit Agrawal認為,當前具身智能還缺少兩項關鍵能力:力智能與終身學習。
機器人真正需要理解的,是在不確定環境中,何時、何處、施加多大的力量。
同時,機器人也不能在訓練結束后就「凍結」。它應該在部署過程中繼續從成功與失敗中學習,不斷提升可靠性和適應性。
One More Thing
頒獎現場還有個小彩蛋。
主持人在宣布獲獎名單時,一度誤將最終獲得最佳論文獎的FlashSAC,同時宣布為最佳學生論文。
現場一時間仿佛出現了「一篇論文包攬兩項大獎」的名場面。
不過工作人員很快發現并完成糾正,虛驚一場。
![]()
![]()
By the way,下一屆RSS,希臘見!!
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.