![]()
智東西
編譯 茄子
編輯 程茜
智東西7月29日消息,昨日,AI教母李飛飛的創企World Labs推出機器人訓練閉環引擎R2S2R(真實-仿真-真機)的最新成果。World Labs的這項成果通過構建與現實環境高度對齊的可交互仿真世界,讓機器人能夠在虛擬環境中完成訓練、評估和策略優化,再將優化后的策略遷移至真實機器人執行任務,并試圖解決通用機器人研發中長期存在的數據采集困難、真機測試成本高以及模型泛化能力不足等問題。
![]()
▲李飛飛(左)與SceniX創始人李昀燭(中間)、a16z的對話視頻截圖(圖源:X)
這一成果通過R2S2R分為“真實轉仿真(Real-to-Sim)”與“仿真轉真機(Sim-to-Real)”兩個部分展示。其中,Real-to-Sim階段將物理機器人、傳感器、環境、物體和交互過程轉化為仿真模型,保留任務相關的觀察結果和動態特性;Sim-to-Real階段則在模擬環境中訓練和測試機器人策略,并驗證仿真表現是否能夠預測真實世界運行效果。
這一最新成果正是由World Labs和其7月21日收購的美國機器人仿真創企SceniX聯合打造。
與大語言模型依靠互聯網海量數據快速迭代不同,機器人訓練和評估長期面臨數據瓶頸。真實環境中的機器人交互數據不僅采集成本高、難以規模化獲取,還受到場景、安全和硬件條件限制,導致機器人難以像大模型一樣通過數據規模提升能力。
李飛飛認為,要釋放機器人領域的Scaling Law,需要通過環境建模創造可交互的數字世界,用虛擬環境生成的數據補充真實世界中昂貴且難以獲取的訓練和評估數據。
此次推出的R2S2R首批成果正是World Labs對這一方向的探索,相比傳統機器人仿真系統主要依賴人工搭建虛擬環境,R2S2R利用世界模型技術,從真實機器人任務出發重建與現實高度一致的數字世界。
這樣不僅可以還原機器人感知到的視覺信息,也能模擬機器人與環境交互過程中的物理反饋和動態變化,使仿真環境能夠直接用于機器人策略訓練、評估和優化。
![]()
▲R2S2R首批成果將單次物理任務生成眾多可控、可復用虛擬環境(圖源:X)
一、Real-to-Sim: 將真實機器人任務重建為虛實對齊的仿真環境
World Labs展示了機械臂裝箱的案例。在案例中,機械臂在仿真環境和現實環境里執行了相同的開環(無實時反饋修正,下發動作后不根據視覺傳感實時調整)動作序列,并且在觀測結果、物體運動軌跡以及任務結果上實現高度一致。
![]()
技術博客指出,想要在不同環境和任務中持續實現這種虛實對齊,僅依靠傳統仿真器并不足夠。因此,World Labs開發了一套新的生成式世界建模系統。該系統能夠生成高保真視覺效果、精準幾何結構以及符合現實規律的物理和動力學表現,從而實現所需的Real-to-Sim對齊效果。
系統能夠采集機器人本體、傳感器、周圍環境、操作物體以及任務演示數據。隨后,這些數據會被重建為一個可交互的虛擬世界。該虛擬環境不僅保留機器人能夠感知到的視覺信息,也還原了決定任務成功或失敗的物理交互過程。
真實環境并不會提供完整、干凈的測量數據。因為物體的形狀、重量、摩擦力等關鍵參數可能存在不確定性;相機和機器人硬件也可能與設計參數產生偏差;線纜、包裝材料等柔性物體在交互過程中產生的形變,也難以通過簡單模型完整還原。
為了驗證重建環境的準確性,研究團隊分別在仿真環境和真實環境中執行匹配的開環交互任務,并直接對比兩者的觀測結果、物體響應以及最終任務表現。
World Labs在技術博客中展示了不同類型的交互對象,包括剛性物體、關節結構物體以及可變形物體,同時適配不同機器人、傳感器、環境和高接觸復雜度任務的多個案例。
下圖演示了YAM機械臂執行線纜操控任務,通過持續接觸完成線纜滑動、布線和插拔操作,仿真與真實環境中的動作過程和任務結果保持高度一致。
![]()
該案例演示了ALOHA雙臂機器人執行柔性線纜插入任務,機器人在線纜發生形變和持續接觸的情況下,完成抓取線纜末端并將其插入孔洞的操作,驗證了仿真環境對復雜柔性物體交互過程的還原能力。
案例演示了RB-Y1雙臂機器人執行電源線操控任務,機器人通過雙手協同操作,將可形變線纜圍繞冰箱完成布線,并實現仿真與真實環境下相匹配的操作效果。
![]()
這個案例則演示了ALOHA雙臂機器人執行立方體交接任務,兩個機械臂完成精準抓取、交接和放置操作,仿真與真實環境中的觀察結果、物體運動軌跡和任務結果高度匹配。
![]()
二、Sim-to-Real:依托仿真訓練和評估機器人策略,實現真實環境部署
技術博客指出,完成真實任務重建后,與現實環境高度對齊的仿真系統可以進一步成為機器人訓練和評估的平臺。研發人員可以在仿真環境中訓練新的機器人策略,主動發現模型容易失敗的場景,并根據這些問題生成針對性訓練數據,優化策略后再回到真機環境驗證。
相比完全依賴實體機器人反復測試,這種方式能夠顯著降低訓練迭代過程中的時間和硬件成本。
1、訓練
World Labs展示了ALOHA雙臂裝箱任務案例。在案例中,該機器人策略完全基于仿真數據訓練,不使用任何真實世界訓練數據,訓練完成后可直接從虛實對齊的仿真環境遷移至真實ALOHA機器人,并完成雙臂裝箱操作。
![]()
此外,World Labs還測試了光照擾動條件下的策略魯棒性,在改變視覺環境的情況下,同一機器人策略仍能夠保持穩定運行,驗證了仿真訓練策略對于環境變化的適應能力。
![]()
World Labs認為,真實硬件訓練機器人存在明顯限制,能夠被人為搭建、重復測試并安全執行的場景十分有限。而在仿真環境中,研發人員可以自由調整物體位置、機器人狀態、拍攝視角、光照條件、物理參數以及任務難度,讓機器人在訓練階段提前接觸大量現實中難以復現、測試成本較高的復雜情況。
在這一過程中,機器人可以不斷嘗試不同操作,從成功和失敗結果中學習,而無需每次測試后重新布置真實環境。同時,仿真環境還能提供真實硬件難以直接獲取的數據,例如物體精準位置、接觸狀態、受力變化以及不同動作對應的任務結果,幫助模型進一步優化。
World Labs稱,R2S2R可以適配不同機器人、傳感器和算法需求,同一個任務場景經過一次重建后,還能持續用于后續模型訓練和硬件迭代,讓仿真環境從一次性的測試工具,變成可重復使用的機器人研發平臺。
World Labs還展示了多個機器人任務案例,覆蓋柔性線纜操作、可變形箱體、剛性物體以及復雜環境中的抓取放置任務。
這些案例中的機器人策略均依靠仿真訓練完成,不包含任何真實世界訓練數據,并能遷移到多種真實機器人平臺執行任務。
下方案例演示了RB-Y1雙臂機器人執行電源線操控任務,機器人通過雙手協同完成可形變線纜圍繞冰箱布線。
![]()
這個案例演示了YAM機械臂執行線纜操控任務,機器人通過持續接觸完成線纜滑動、布線、插拔操作。
![]()
在利用Flexiv機械臂執行試管轉移任務的案例中,機器人可以在在嚴格幾何公差要求下完成試管精準抓取和放置。
![]()
在xArm機械臂執行標記物分揀任務案例中,機器人能夠從雜亂環境中逐一抓取細長且形狀相似的物體。
![]()
在xArm機械臂執行鉛筆分揀任務案例中,機器人能夠從密集雜物中可靠提取細長物體。
![]()
World Labs稱,R2S2R的價值并非在于展示單個成功案例,而在于通過虛實對齊的仿真環境,讓機器人具備適應多任務、多物理交互場景的泛化能力。
2、評估
技術博客指出,機器人研發迭代速度遠慢于大語言模型,核心限制是模型效果評估高度依賴實體硬件,這也是機器人基礎模型研發的主要瓶頸。具備虛實對齊能力的仿真環境,可以讓機器人評估過程實現規模化擴展。
并且,有了仿真環境后,研發團隊不必被動等待機器人在真實硬件上暴露故障,而是可以在數千種可控仿真條件下主動搜索模型失效場景,在真實測試前篩掉大量檢查點(checkpoint),只把最有潛力的策略投入高成本硬件測試,從而加快迭代、擴大測試覆蓋范圍、降低研發成本。
World Labs提出,一個有價值的仿真系統并不需要完全復現真實世界中的成功率,而是需要支持與現實世界一致的決策邏輯。該邏輯能夠識別策略成功和失敗的位置,判斷不同策略之間的優劣,并預測訓練階段的改進是否能夠遷移到真實硬件。
World Labs以ALOHA雙臂立方體交接任務為例,展示R2S2R引擎的規模化評估能力。并且,所有結果均來自仿真環境和真實環境中的閉環策略運行測試。
研究團隊稱,衡量R2S2R引擎是否有效的關鍵標準之一,是仿真環境能否還原策略在成功與失敗邊界附近的行為表現。這也是進一步優化機器人策略學習算法的必要條件。
在仿真與真實環境的臨界成功測試中,該策略通常會在立方體中心區域完成抓取。當任務接近模型泛化邊界時,機械臂會嘗試靠近立方體邊緣進行抓取,雖然操作過程幾乎導致任務失敗,但最終仍分別在仿真環境和真實環境中完成任務。更重要的是,兩種環境中均復現了相同的接近失敗行為,并獲得了一致的任務結果。
在仿真與真實環境的失敗測試中,系統同樣能夠還原對應的失敗行為和最終任務結果,表明仿真環境不僅能夠復現任務流程和成功狀態,也能夠捕捉影響機器人策略表現的臨界條件和失效情況。
![]()
對于開發機器人系統和機器人基礎模型的團隊而言,虛實對齊的仿真環境能夠為策略和數據迭代提供系統化評估能力。它可以幫助研發人員發現哪些模型檢查點表現最佳,定位策略成功或失敗的位置,并指導下一階段需要生成哪些訓練數據。
實驗覆蓋不同策略架構、訓練配置,還包括訓練集內物體位置(ID)、訓練集外未知位置(OOD)兩類場景。
結果顯示,在仿真環境中表現更好的策略,在真實硬件測試中同樣表現更優。仿真能夠保持不同策略之間的相對排名,跟蹤模型訓練過程中的性能提升和停滯階段,并呈現與真實環境相似的成功區域和失敗區域分布。
![]()
借助這套評估體系,機器人團隊可以利用R2S2R引擎篩選模型檢查點、發現性能退化問題、指導策略和數據迭代,并決定哪些模型值得投入高成本硬件測試。虛實對齊仿真由此成為機器人研發流程中的高吞吐評估層。
結語:仿真器是世界模型體系的關鍵環節
World Labs此前提出,仿真器是世界模型體系中的關鍵環節,能夠讓智能體在虛擬世界中完成行動、學習和評估,而R2S2R的實驗結果進一步驗證了這一判斷。
技術博客稱,僅優化算法、增加真實硬件數據,仍難以解決機器人從實驗室演示走向實際應用的泛化難題。R2S2R通過打通Real-to-Sim與Sim-to-Real兩個環節,將真實任務轉化為可控仿真環境,并依托仿真完成機器人策略訓練、評估和優化。
未來,高保真仿真有望不再只是機器人研發的輔助工具,而成為支撐機器人規模化訓練與落地的重要基礎設施。
來源:World Labs
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.