![]()
具身智能時代,通用機器人策略距離“登頂”還有多遠?現(xiàn)有基準仍難以回答這個問題。
不少基準依賴簡單、短程或技能范圍狹窄的任務;仿真評估效率高、易擴展,但難以反映真實物理部署能力;真實世界評估更接近實際部署,卻成本高、耗時長,也更難復現(xiàn)。
針對這一問題,來自香港大學、加州大學伯克利分校、清華大學、北京大學等聯(lián)合研究團隊提出了面向仿真與真實世界的統(tǒng)一評估基準 RoboDojo,覆蓋多樣、長時程、精度要求高、依賴記憶和開放式的操作場景。
![]()
論文鏈接:https://arxiv.org/abs/2607.04434
實驗結果顯示,現(xiàn)有通用機器人操作策略還遠談不上可靠:即便是當前 SOTA 模型,也難以穩(wěn)定完成 RoboDojo 中的復雜任務,在真實世界部署中成功率僅 12.8%,遠低于人類遙操作的滿分表現(xiàn)。
基于這些結果,研究團隊建立了公開排行榜,系統(tǒng)分析了當前策略在仿真與真實世界中的局限,并提出了未來通用操作策略的關鍵方向。
![]()
圖|RoboDojo 概覽。
RoboDojo:統(tǒng)一的機器人評估基準
整體來看,RoboDojo 以五類核心操作能力定義仿真基準,并由仿真評估平臺、真實世界評估平臺和 XPolicyLab 共同完成任務構建、策略訓練、部署與評估。
![]()
圖|RoboDojo 任務概覽。
仿真基準覆蓋五類核心操作能力:泛化、記憶、長程執(zhí)行、精細控制與開放指令理解,并通過 42 個任務系統(tǒng)診斷策略在不同操作能力上的短板。
- 泛化任務測試策略對未見背景、光照、目標和雜物的適應能力;
- 記憶任務考察歷史信息利用;
- 長程任務評估策略完成多步驟操作序列的能力;
- 精細控制任務聚焦窄孔插入等高精度接觸操作;
- 開放任務測試策略能否將已學技能遷移到未見語言指令和新目標。
從系統(tǒng)構成來看,RoboDojo 由仿真評估平臺、真實世界評估平臺和 XPolicyLab 三部分構成,具體如下:
仿真平臺:負責任務構建、資產生成、并行評估和數據采集。任務和場景通過配置文件定義,不同物體被構建為數字孿生資產;評估時,平臺可并行運行多個場景以提升效率;采集數據時,簡單任務可自動生成軌跡,復雜任務則通過 VR 遙操作獲取高質量示范。
![]()
圖|RoboDojo 中的技能多樣性。
真實世界評估:強調可復現(xiàn)性,通過統(tǒng)一硬件、工作空間、光照、場景重置和評估協(xié)議,減少真實機器人實驗中的偶然因素;RoboDojo-RealEval 則借助觸摸屏界面和布局疊加機制,規(guī)范任務重置與執(zhí)行流程。
![]()
圖|真實世界任務亮點。
XPolicyLab:統(tǒng)一策略開發(fā)、訓練、評估與部署流程,并通過標準化數據轉換、訓練模板、部署流程和 observation-action 接口,降低策略接入成本。
此外,RoboDojo 還設立了仿真與真實世界雙榜單:仿真榜單圍繞五類能力反復評估,并以資深 VR 遙操作員為人類參考;真實世界榜單基于 RoboDojo-RealEval,在 3 種機器人本體、18 個任務上評估 10 個代表性策略,統(tǒng)一重置、部署與評分協(xié)議。
![]()
圖|RoboDojo-RealEval 系統(tǒng)概覽。
RoboDojo 的評測結果如何?
研究團隊發(fā)現(xiàn),現(xiàn)有通用機器人操作策略整體仍不可靠:即便是當前領先模型,也與人類專家存在顯著差距,且仿真中的優(yōu)勢未必能延續(xù)到真實部署中。不過,RoboDojo 本身具備較好的評估效率和可復現(xiàn)性。具體結果如下:
1.仿真結果
目前領先策略仍遠低于人類水平:目前領先模型包括 Hy-Embodied-0.5-VLA、Spatial Forcing、π0.5、X-VLA 等,但最佳策略平均成功率僅 8.80%、平均分 13.07,遠低于人類專家的 76.03% 和 80.42 分,說明現(xiàn)有策略距離穩(wěn)定完成任務仍有巨大差距。
![]()
圖| RoboDojo 仿真基準排行榜。
不同模型能力發(fā)展不均衡:Spatial Forcing 更擅長泛化,X-VLA 在精細操作上領先,π0.5 在開放任務上相對更強,Hy-Embodied-0.5-VLA 則在長程執(zhí)行、記憶和總體表現(xiàn)上最好;但這些優(yōu)勢多局限于單一維度,難以覆蓋完整任務集。即使在表現(xiàn)較好的泛化和長程維度,最佳成功率也不足 15%,精細控制、記憶和開放指令理解仍是短板。
泛化方面,場景隨機化會顯著削弱策略表現(xiàn):Hy-Embodied-0.5-VLA 在標準場景下領先,但隨機化后下降 92.9%;Spatial Forcing 在隨機場景下相對更穩(wěn),但絕對表現(xiàn)仍很低。當前策略對視覺和空間分布變化高度敏感,可靠泛化仍需要更穩(wěn)定的控制、閉環(huán)校正和失敗恢復能力。
![]()
圖|標準與隨機化視覺設置下的策略性能。
長程執(zhí)行方面:動作先驗、具身預訓練和空間 grounding 帶來的提升仍然有限。Hy- Embodied-0.5-VLA、π0.5 和 Spatial Forcing 成功率接近 15%,說明模型能推進部分多步任務;但最佳成功率仍不足 15%,且分數高于成功率,模型常能推進前期步驟,但難以穩(wěn)定完成最終目標,技能組合、階段決策和錯誤恢復能力仍不足。
精細控制方面:X-VLA 表現(xiàn)最好,成功率 12.00%、分數 18.32,但仍遠未達到可靠水平。Hy-Embodied-0.5-VLA 雖總體最佳,卻在該維度落后于 X-VLA 和 Spatial Forcing,說明整體表現(xiàn)不能直接轉化為局部精細控制;三維定位、平滑動作預測和閉環(huán)接觸控制仍是短板。
記憶方面:當前策略仍難以有效利用歷史信息完成后續(xù)操作。Hy-Embodied-0.5-VLA 表現(xiàn)最好,具身預訓練和動作先驗有助于利用歷史信息;但 EventVLA 的顯式記憶設計和 X-WAM 的隱式時間記憶都未能帶來穩(wěn)定成功,表明記憶能力仍難以轉化為可靠控制。
開放語義操作方面:當前策略仍難以應對開放指令和新目標。即使表現(xiàn)最好的 π0.5,成功率也僅 1.67%、分數 1.98。強視覺-語言骨干雖能提升感知和語言理解,但尚不能穩(wěn)定對齊開放指令、視覺 affordance 與可執(zhí)行動作,語義目標到機器人行為的轉化仍是關鍵短板。
2.真實世界結果
真實世界部署方面,當前通用機器人操作策略仍不可靠。最佳策略 π0.5 在 18 個真實任務上的成功率僅 12.8%、分數 22.9,遠低于人類遙操作的滿分表現(xiàn)。分數普遍高于成功率,說明模型常能完成部分步驟,卻難以完成完整任務。
![]()
圖| RoboDojo 真實世界基準排行榜。
仿真性能與真實可部署性并不完全一致。π0.5 在仿真和真實評估中均表現(xiàn)較強,但真實排名并不完全遵循仿真結果:InternVLA-A1、GalaxeaVLA 在真實測試中優(yōu)于預期,部分仿真領先模型在真實機器人上優(yōu)勢縮小。仿真更適合能力診斷,真實評估則用于檢驗策略對感知噪聲、校準誤差、執(zhí)行延遲和接觸不穩(wěn)定等物理因素的適應性。
真實世界評估暴露了成功率之外的執(zhí)行與安全風險。真實部署中會出現(xiàn)動作抖動、無效重復、接觸不穩(wěn)定甚至安全關鍵行為,DM0 等模型還需要人工監(jiān)控或干預。這說明真實評估不能只看任務是否完成,還要檢驗策略在物理機器人上的控制穩(wěn)定性和失敗恢復能力。
3.評估效率與穩(wěn)定性
RoboDojo 具備較好的評估效率和穩(wěn)定性。異構并行仿真提升了大規(guī)模測試吞吐量;真實世界評估中,π0.5 完成 180 次試驗僅耗時 202 分鐘,平均每個任務10 次試驗約 11.2 分鐘,體現(xiàn)了標準化重置、統(tǒng)一接口和本地部署帶來的效率提升。
![]()
圖|每個任務的真實世界評估時間。
重復評估結果顯示,仿真與真實世界的最大成功率標準差分別僅 1.1 和 1.3 個百分點,榜單結果較穩(wěn)定、可復現(xiàn)。
![]()
圖|多次重復運行中各任務真實世界評估的完整穩(wěn)定性。
不足和未來發(fā)展
研究團隊指出,盡管 RoboDojo 已覆蓋仿真與真實世界評估,但當前機器人操作策略在泛化、長程執(zhí)行、精細操作、記憶和開放任務理解上仍有明顯短板;真實世界結果也表明,現(xiàn)有模型在復雜物理部署中仍不夠穩(wěn)定。
研究團隊表示,他們將在未來持續(xù)更新 RoboDojo 的策略、任務和評估結果,并擴展到更廣泛的場景、機器人本體和感知模態(tài),包括靈巧手操作、類人全身操作、觸覺操作和移動操作等方向。
![]()
圖|RoboDojo 的未來擴展。
同時,他們也將為 RoboDojo 在不同方向引入多個機器人本體,提升基準的可訪問性,增強跨硬件平臺比較的公平性,最終發(fā)展為面向具身操作的通用評估平臺。
更多技術細節(jié),詳見原論文。
作者:夏千斯
如需轉載或投稿,請直接在本文章評論區(qū)內留言
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.