編輯|冷貓
記得何同學做過一個超復(fù)雜的流水線項目嗎?
![]()
內(nèi)容來源:老師好我叫何同學
這個視頻發(fā)布于 2024 年 1 月,當時要實現(xiàn)自動疊紙盒,把禮物放進紙盒的自動化操作,正是這樣一個機械臂和自動化編程組合成的流水線。
如果有一個能像人一樣靈活的機器手來折疊包裝,長時間批量地工作,何同學團隊耗費心力打造的龐大流水線的功能,就能夠被兩個小體積的靈巧手給完美實現(xiàn)。
并且也不需要考慮各種流水線上的穩(wěn)定性,靈巧手自己就能夠解決遇到的位置偏移,變形等問題,全面自主。相比復(fù)雜的機械臂和自動化,靈巧手的自由度和泛用性顯然是其不可比擬的。
這很難,但和人類雙手接近的靈巧手,已經(jīng)出現(xiàn)了。
![]()
這一對雙臂靈巧手,在精細操作、長程任務(wù)和泛化性上均展現(xiàn)出了亮眼的成績,而它來自于靈初智能。
在這兩個靈巧手準確協(xié)同,實現(xiàn)精巧操作的背后,是一套靈初智能與北大 - 靈初聯(lián)合實驗室共同發(fā)布并開源的技術(shù)范式,稱為 EgoSteer,是一套雙靈巧手通用操作大模型和全棧系統(tǒng)。
![]()
- 論文鏈接:https://egosteer.github.io/EgoSteer.pdf
- 項目主頁:https://egosteer.github.io/#/
到目前為止,業(yè)界能跟隨自由語言指令、還能在全新場景里泛化的模型少之又少。
π0.7、DreamZero 這些近期在通用性上取得突破的工作,把機器人能干的活兒從「一個任務(wù)」推到了「一批任務(wù)」,但它們大多依賴昂貴的真機數(shù)據(jù)。但我們知道,具身靈巧手最好的數(shù)據(jù),必然來自人類的雙手。
![]()
https://mp.weixin.qq.com/s/EFmICtdSJAMXNmz0fxwJUw
EgoSteer 是一個里程碑式的進步。它能跟隨開放式的自然語言指令,完成一百多種語義各異的靈巧操作任務(wù),還能用少量示范快速學會復(fù)雜的長程任務(wù)。該全棧系統(tǒng)已完整開源代碼、模型權(quán)重,數(shù)據(jù)也將近期開源,為雙靈巧手通用操作開究提供了一套高質(zhì)量、可復(fù)現(xiàn)、可迭代的全棧基線
數(shù)據(jù),模型和系統(tǒng),深度技術(shù)拆解
下面我們從三個層面把它拆開:數(shù)據(jù)、模型和系統(tǒng)閉環(huán)。這三塊拼在一起,才能真正被稱為「全棧」系統(tǒng)。
近萬小時人手視頻,變成訓練數(shù)據(jù)
先說一個反直覺的事實:制約靈巧手大模型的瓶頸,往往落在數(shù)據(jù)上。但數(shù)據(jù)本身其實并不稀缺,稀缺的是能拿來訓練的數(shù)據(jù)。
第一人稱人類視頻,也就是戴著相機以人的視角拍下的操作畫面,是天然的富礦。全網(wǎng)這類可用素材大約有 11.6 萬小時,人手在里面擰、捏、遞、疊,蘊含著海量的交互知識。問題在于,這些視頻原始狀態(tài)下噪聲大得驚人:鏡頭劇烈晃動、雙手頻繁被遮擋、既沒有可靠的語言標注,也沒有精確的動作標注。直接拿去訓練,模型學到的是一堆彼此矛盾的監(jiān)督信號,下游策略只會被帶偏。
靈初把處理這些視頻的管線單獨做成了一個系統(tǒng),叫EgoSmith。它是一條四階段的全自動流水線,目標是把視頻變成帶精細語言和動作標注的可訓練數(shù)據(jù)。
![]()
EgoSmith 概覽:EgoSmith 能夠?qū)⒃肼曒^大的第一視角視頻整理為高質(zhì)量的靈巧操作 VLA 數(shù)據(jù),為語言驅(qū)動的機器人預(yù)訓練提供可規(guī)模化的人手交互先驗。
第一階段是預(yù)過濾。用簡單但有效的啟發(fā)式規(guī)則先做一遍粗篩:在 128 個采樣點的網(wǎng)格上算平均光流,光流大的往往對應(yīng)人在走動、并沒有在操作,直接丟掉;再用 YOLO 檢測畫面里手的數(shù)量、尺度和位置,靠幾何規(guī)則剔除嚴重遮擋或有旁人亂入的幀,只留下手部操作清晰可見的片段。
第二階段是 4D 運動估計,把頭和手的運動還原到真實物理空間里。EgoSmith 用更輕更穩(wěn)的 DPVO 做相機跟蹤和關(guān)鍵幀深度,用 Any4D 做逐幀的度量尺度深度預(yù)測,兩者對齊尺度比之后,恢復(fù)出更準確的相機軌跡,再把相機坐標系下的手部運動轉(zhuǎn)換到統(tǒng)一的世界坐標系。
第三階段是多層級語言標注,這是「聽懂人話」的基礎(chǔ)。先用 Qwen3.5-VL-Plus 把那些沒有實質(zhì)手物交互的片段再濾掉一批,剩下的每一段都生成從粗到細的五級語言指令:L1 是動詞加賓語這樣的原子指令,L2 是要點摘要,L3 以物體為中心,L4 以手為中心區(qū)分左右手分工,L5 則細到分步動作。
第四階段是后過濾,做多級質(zhì)量控制。episode 級看相機平移分布剔除離群、用硬閾值丟掉頭部運動過大的片段;chunk 級把手腕姿態(tài)轉(zhuǎn)到中間幀、把手指關(guān)鍵點投影到逐幀手腕系,剔除坐標空間的離群值;frame 級算相機、手腕、手指的幀間差分,用硬閾值濾掉突變跳變。一層層篩下來,那些因為三維重建漂移、尺度不準、跳幀而變得不可靠的片段被系統(tǒng)性地清除。
最終產(chǎn)出是一個標準化的數(shù)據(jù)集:橫跨 12 個開源數(shù)據(jù)集,9.6K 小時、209 萬個片段、10.4 億幀,覆蓋 8969 個不同的物體名詞和 623 個動作動詞。
讓 VLA 學會「想象」:只在訓練時出現(xiàn)的世界模型
有了干凈的數(shù)據(jù),接下來就是最重要的訓練模型環(huán)節(jié)。
EgoSteer的模型本體是一個基于流匹配(flow matching)的 VLA,但它最有意思的設(shè)計,是給這個 VLA 掛了一個世界模型專家,而這個專家只在訓練時存在,推理時直接丟掉,不帶來任何額外的計算負擔。
![]()
EgoSteer 概覽:一種結(jié)合世界模型增強的 VLA 模型,用于實現(xiàn)可控的靈巧操作。
要理解這個設(shè)計的巧思,得先看清模型的骨架。EgoSteer 由三部分組成,共享一個視覺語言主干:
第一部分是主干,用的是預(yù)訓練視覺語言模型 Qwen3-VL(2B 規(guī)模),采用因果注意力,負責把圖像、語言、狀態(tài)這些多模態(tài)輸入編碼成表示。
第二部分是動作專家,一個基于 DiT 的模塊,約 3 億參數(shù),通過流匹配來生成動作塊(action chunk)。它采用聯(lián)合注意力,既看自己,也看主干的表示。
第三部分是世界模型專家,一個輕量的 4 層 Transformer,約 7000 萬參數(shù)。它干的事聽起來有點抽象:給定當前要執(zhí)行的動作和相應(yīng)的相機運動,去預(yù)測未來那一幀畫面的 DINOv3 特征。
為什么要預(yù)測未來?團隊的洞察是,VLA 天生擅長視覺和語言的理解,卻缺乏對「下一秒會發(fā)生什么」的想象,而這種想象的缺失,恰恰限制了動作生成的精度。
世界模型專家正是在這一環(huán)節(jié)進行補強。訓練時,它拿真實動作、相對相機運動和一串可學習的查詢 token 作為輸入,去回歸未來幀經(jīng) DINOv3 編碼后的語義特征。
這里有兩個值得說的細節(jié)。一是它選擇回歸 DINOv3 特征,而放棄直接預(yù)測像素,因為語義特征天然過濾掉了光照變化和背景噪聲,比在像素空間里預(yù)測圖像提供的梯度更穩(wěn)定、更直接。二是這個專家只有 4 層,且以固定間隔去注意主干的層。
它存在的價值,是讓「預(yù)測未來」這個目標產(chǎn)生的梯度回流到主干,主干對世界的理解變強了,動作專家的精度自然跟著水漲船高。到了推理階段,這個專家功成身退,一點推理開銷都不留。
EgoSteer 用一套統(tǒng)一的動作空間:手腕位姿用 3D 位置加 6D 旋轉(zhuǎn)表示,手部姿態(tài)用五根手指指尖在手腕坐標系下的位置表示,雙臂雙手加起來是 48 維。人手數(shù)據(jù)和機器人數(shù)據(jù)被強行拉到同一種表示格式下。人類操作的寶貴數(shù)據(jù),就是通過這套統(tǒng)一表示,平滑地流向機器人。
最后一個工程細節(jié)關(guān)乎「流暢」。機器人真機推理時,如果每生成一個動作塊就停頓一下等下一次推理,動作會一頓一頓的。為此, EgoSteer 采用了訓練時的 Real-Time Chunking(RTC)技術(shù):訓練時喂給模型一段干凈的、帶隨機延遲的動作前綴作為已知條件,只讓它去噪后續(xù)動作,以覆蓋推理延遲。
人在閉環(huán):「無縫接管」失敗機器人
數(shù)據(jù)和模型之外,全棧系統(tǒng)的第三塊是機器人系統(tǒng) Robot-Stack。它把遙操作數(shù)據(jù)采集、模型推理部署、人在閉環(huán)糾偏這三件事,融進了同一套底層控制里。
![]()
這套設(shè)計的第一層價值是一致性。無論機器人是在自主跑模型,還是人戴著數(shù)據(jù)手套在手動遙操作,底層共用完全相同的控制環(huán)路和 FK/IK 計算邏輯,跑在同一批 ROS2 節(jié)點上。
真正精彩的是「人在閉環(huán)糾偏」的接管機制。想象一個場景:機器人在執(zhí)行任務(wù),眼看要失敗了,一位專家需要立刻接管。這個接管的瞬間是個大坑,如果直接把人手的絕對姿態(tài)映射到機器人上,機器人的狀態(tài)會在交接的一剎那突變,物理上就是一個劇烈的抖動,輕則任務(wù)失敗,重則損壞器件。
靈初的解法非常巧妙,稱之為「相對動作映射」。操作員踩下腳踏板發(fā)出接管信號的那一刻,系統(tǒng)記錄下機器人當前的末端姿態(tài)和人手當前的姿態(tài)作為各自的基準。
此后,系統(tǒng)只把操作員手部的相對運動量疊加到機器人的當前狀態(tài)上。直觀地說,操作員只要順著機器人當下的姿勢去比劃,就能平滑地接過控制權(quán),全程沒有突變抖動。糾正完成后再踩一次腳踏板,控制權(quán)無縫交還給模型。接管成功率超過 85%。
這套機制的妙處在于,它讓在線糾偏的數(shù)據(jù)收集變得極其低門檻。專家可以在機器人失敗的任意狀態(tài)下絲滑接管、示范正確做法,而且只有這些「介入片段」會被留下來作為糾偏訓練數(shù)據(jù)。
靈初用三輪 DAgger 迭代,在 56 個任務(wù)上一共只采集了 3.7K 條軌跡、8.3 小時的糾正數(shù)據(jù)。靠這套控制棧,團隊以極低的人力成本,采集了覆蓋 193 個桌面操作任務(wù)、187 小時的高質(zhì)量真機數(shù)據(jù),涵蓋從簡單抓放到非抓握、重定向、雙手協(xié)作、接觸密集等 7 大類操作。
把數(shù)據(jù)、模型、系統(tǒng)三塊串起來,EgoSteer 的訓練遵循三個階段。第一階段用 9.6K 小時的人類第一人稱數(shù)據(jù)做預(yù)訓練,只用頭部相機,在 128 張 A800 上訓了 175K 步、約 164 小時。第二階段用 187 小時多樣化的真機數(shù)據(jù)做后訓練,加上胸部相機形成雙視角,學習率降到原來的十分之一。第三階段是多輪人在閉環(huán) DAgger 糾偏。
實驗結(jié)果
EgoSteer 的評測拆成了幾個彼此獨立的維度,每一個都在回答一個具體的疑問:它到底能不能聽懂話、能不能應(yīng)付沒見過的場景、那些精巧的模塊是不是真的有用、近萬小時人手數(shù)據(jù)最終換來了什么。
可操控性與泛化
EgoSteer 全程只用一個共享模型,不為任何單一任務(wù)做專門微調(diào),所有動作都由開放式的自由語言指令直接驅(qū)動。評測覆蓋 7 大類操作,從簡單抓放(PnP)到非抓握推撥、物體重定向、雙手協(xié)作、接觸密集型任務(wù),一共 40 個日常復(fù)雜任務(wù),每個任務(wù)在隨機雜亂的場景里試驗 10 次。
最終的整體平均成功率是 75%。
![]()
EgoSteer 在涵蓋 7 個類別的 40 項任務(wù)中的可控操作性能。它能夠穩(wěn)健地遵循自由形式的語言指令完成任務(wù),實現(xiàn)總體 75% 的成功率,展現(xiàn)出良好的泛化能力。
EgoSteer 把評測任務(wù)切成了三檔難度。
第一檔是訓練時見過的任務(wù),模型表現(xiàn)穩(wěn)定。第二檔是組合泛化,指令把已知技能重新拼裝,這類需要理解指令結(jié)構(gòu)、重新編排子技能的任務(wù),成功率65%。第三檔最難,是語義上完全沒見過的新任務(wù),成功率62%。
一個模型在沒見過的語義任務(wù)上還能保住六成的成功率,說明它學到的是一套可以遷移的操作先驗,并沒有停留在對特定指令的死記硬背。
數(shù)據(jù)規(guī)模
這個實驗證明了,人手數(shù)據(jù)的規(guī)模在具身智能模型中依舊非常寶貴。
![]()
這是一條清晰的 scaling 曲線。團隊用從零訓練、3K、6K、9.6K 小時四個預(yù)訓練規(guī)模跑了對照,隨著數(shù)據(jù)量上去,預(yù)訓練損失收斂得更低,真機成功率也穩(wěn)步爬升,到 9.6K 小時時達到60%,而完全從零訓練的模型只有約30%。三十個百分點的差距,幾乎全部來自預(yù)訓練數(shù)據(jù)。
![]()
橫向和同期工作比,在一組 10 個相對容易的任務(wù)上,EgoSteer 平均成功率 74%,同期的 Being-H0.5 是 39%,π0.5 是 22%。論文的分析是,這兩個對比模型都吃虧在預(yù)訓練和后訓練階段的動作表示不一致、輸入分辨率更小、缺少部署優(yōu)化,所以只能應(yīng)付最基本的抓放,指令跟隨弱、泛化有限、執(zhí)行也不夠精準。
預(yù)訓練價值的終極檢驗
最后一問,也是最能體現(xiàn)預(yù)訓練價值的一問:一個在人手視頻上預(yù)訓練好的模型,能不能只用少量示范,就快速學會一個全新的、跨本體的、復(fù)雜的長程任務(wù)。
兩個實驗給了答案。在 RealMan 機器人上,僅用 120 條示范,EgoSteer 就在一個 18 步、耗時 40 秒的折紙盒任務(wù)上做到了75% 成功率。在換了一套本體的 AgiBot G1 機器人上,僅用 200 條示范,在一個 9 步、耗時 1 分鐘的拆蛋糕盒任務(wù)上做到了83%。
![]()
對照組的結(jié)果近乎殘酷。同樣的數(shù)據(jù)量下,傳統(tǒng)模仿學習方法 Diffusion Policy 和 IMLE、以及沒有做過預(yù)訓練的同架構(gòu)模型,在這兩個長程任務(wù)上的成功率全部是 0%。真正讓「少樣本學會一個長程任務(wù)」成為可能的,是近萬小時人手視頻攢下的操作先驗,而不單單是模型架構(gòu)本身。
更多技術(shù)信息,請參閱原論文。
用雙手創(chuàng)造未來
具身智能已經(jīng)是一片火熱的研究領(lǐng)域,行業(yè)內(nèi)仍有一座座難以攀登的技術(shù)高峰。怎么把噪聲漫天的人手視頻洗成能訓練的數(shù)據(jù),怎么讓模型在動手之前先預(yù)演下一幀,怎么讓一個人類專家絲滑地接管一臺機器人,這些問題是各類具身智能研究者,嘗試通過不同的路徑去解決的瓶頸。
靈初智能顯然在技術(shù)領(lǐng)域默默耕耘,埋頭在數(shù)據(jù)管線、預(yù)訓練范式和真機閉環(huán)這些看不見的地方較勁,用 EgoSteer 把數(shù)據(jù)、模型、系統(tǒng)三頭一起補齊。
![]()
靈初智能成立于 2024 年 9 月,總部在上海,首席科學家楊耀東是北大助理教授,領(lǐng)銜北大 - 靈初聯(lián)合實驗室。創(chuàng)始團隊年齡跨度從 70 后一路排到 00 后,既有在黑莓、Sonos、達闥、京東摸爬滾打近二十年的產(chǎn)業(yè)老兵王啟斌,也有天才少年陳源培。
就在今年,這家成立才一年半的公司宣布完成 20 億元人民幣的天使輪加 Pre-A 輪融資,國開金融、上海徐匯資本等一眾國資和產(chǎn)業(yè)資本進場。它此前推出的 Psi R 系列,是業(yè)內(nèi)首個端到端強化學習具身模型,也是最早做出能完成長程任務(wù)的具身模型的團隊之一。從那時起,它的技術(shù)路線就和行業(yè)主流的「夾爪加仿真」拉開了距離,一門心思押在「強化學習加人手數(shù)據(jù)加靈巧手」這條更難走的路上。
真正能往前推進具身智能行業(yè)進化的,未必是最高最炫的機器人,而是那些愿意花力氣去清洗數(shù)據(jù)、去打磨閉環(huán)、去把一條完整鏈路跑通并開源出來的團隊。
靈巧的手,終究要接住瑣碎而真實的人間事務(wù)。具身智能的雙手,也能創(chuàng)造未來。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.