VLA和世界模型已經把機器人推向“看懂世界”和“預測世界”的階段。
但只要模型真的進入物理世界,問題很快就會變得更具體:
它拿什么學習這個世界,靠什么把動作做出來,又怎么知道自己到底碰到了什么。
前兩個問題,分別指向數據和本體。第三個問題,指向觸覺。
本周,哈工大(深圳)楊朔團隊發布了TouchWorld,一個面向靈巧操作的觸覺世界模型。
它的核心能力,是讓機器人不只預測畫面如何變化,也開始預測接觸如何發生,并在真實操作中利用觸覺反饋修正動作。
TouchWorld不是孤立的一篇論文。此前,楊朔團隊已經推出EgoTouch和TouchAnything:
EgoTouch解決靈巧操作的觸覺數據怎么采;
TouchAnything嘗試從第一人稱視頻中恢復觸覺,如何做低成本的觸覺數據增廣。
這三項工作連起來,構成了一條清晰路線:先采觸覺,再恢復/對齊觸覺,最后讓具身模型真正使用觸覺。
沿著這條路線,出生于1998年的年輕教授楊朔創辦了破曉智能(PHANES AI)。
破曉智能要做的,是融合人類視頻數據與觸覺感知模態,構建人形機器人全身移動靈巧操作世界模型。
更具體地說,它不是只做一個觸覺模型或硬件,而是希望圍繞“機器人如何真正學會操作”,搭建一套從數據、模型到控制的完整能力鏈。
“破曉”這個名字,也對應了這家公司想解決的問題:在人形機器人走向真實操作之前,觸覺數據、觸覺世界模型、靈巧手反饋控制、全身移動操作仍然處在技術混沌中。
破曉智能希望從觸覺數據切入,把這些能力重新串起來,讓機器人從“看見世界”,走向真正“接觸世界、操作世界”。
從Data-Centric AI,到機器人真實數據
楊朔現任哈爾濱工業大學(深圳)計算機科學與技術學院長聘教授、博導,也是破曉智能創始人兼CEO。
公開信息顯示,他26歲獲評哈工大(深圳)計算機學院長聘教授、博導,曾獲Google Ph.D. Fellowship,入選國家級高層次青年人才、深圳市“高精尖缺”人才、廣東省重大人才工程。
![]()
楊朔,破曉智能(PHANES AI)創始人、哈工大(深圳)長聘教授、博導
在研究上,楊朔長期關注多模態大模型、Data-Centric AI、可信AI、計算機視覺與具身智能等方向。
相比直接從“機器人創業”切入,他的路徑更像是從一個數據問題一路走到物理世界:
模型到底應該用什么數據學習。到了機器人這里,就變成了機器人到底應該用什么數據學習真實操作。
在傳統機器學習里,這個問題更多指向數據質量、數據選擇、噪聲標簽和數據壓縮。
到了具身智能,數據不再只是圖像、文本和標簽,而是人在真實世界中的連續操作過程。
過去一段時間,人類數據正在成為機器人學習復雜操作的重要入口。
NVIDIA EgoScale證明,第一人稱人類操作數據在靈巧操作訓練中具備Scaling Law;Generalist / Gen-1則進一步顯示,大規模人類數據預訓練結合少量真機數據后訓練,可以顯著提升機器人在長程、復雜任務中的成功率。
這兩類工作共同指向一個趨勢:相比完全依賴真機采集,讓機器人先從大規模人類數據中學習動作過程、物體交互和任務結構,再用少量機器人數據完成對齊和適配,是一條更容易規模化的數據路徑。
但這條路線仍然缺一層關鍵信息:觸覺。
第一人稱視頻讓機器人看到了人類如何觀察世界、接近物體、抓取工具、完成任務。
但人和物體之間真正發生了什么,視頻里并不完整。手指壓在哪里,力有多大,物體有沒有滑,接觸是否穩定,這些信息很難只靠圖像回答。
破曉智能給出的答案是:光有視覺不夠,光有動作軌跡也不夠。機器人還需要觸覺,需要理解手和物體接觸時發生了什么。
這也是楊朔團隊從EgoTouch、TouchAnything走到TouchWorld的原因。
Touch系列:從采集觸覺,到對齊觸覺,再到使用觸覺
從破曉智能的技術圖譜看,Touch系列模型不是并列擺放的幾篇論文,而是一條從數據到世界模型、再到全身控制的能力鏈。
EgoTouch解決的是觸覺數據怎么采。
它把第一人稱視頻、腕部視角、手部姿態和雙手壓力圖放進同一套采集系統里,讓人類操作視頻帶上接觸和壓力信息。
團隊圍繞剛性物體、柔性物體、抓取、抓捏、擰動、工具使用等任務,采集人類在真實操作中的視覺和觸覺數據。
![]()
EgoTouch第一人稱視覺-觸覺數據采集系統
TouchAnything解決的是如何讓更多第一人稱視頻補上觸覺。
帶觸覺的數據始終有限。真正戴上傳感器采集的人類操作數據,成本高、規模小,也很難覆蓋所有場景。
但互聯網上已經有大量第一人稱人類操作視頻:人怎么拿起水壺、怎么抓球拍、怎么擰瓶蓋、怎么使用工具,這些過程都被視覺記錄了下來。
問題在于,這些視頻只有畫面,沒有觸覺。
TouchAnything要做的,就是用EgoTouch這類視覺-觸覺對齊數據,訓練模型學會從第一人稱視頻中估計雙手接觸區域和壓力分布。
換句話說,它讓模型具備一種從視覺里“恢復觸覺”的能力:只看視頻,也能推斷手指哪里碰到了物體,哪里正在用力,壓力大概如何分布。
這一步的價值不只是做一個觸覺估計模型,而是把少量帶觸覺傳感器的數據,擴展成更大規模的觸覺監督。原本只能看到動作外觀的人類視頻,有機會被補上一層接觸信息,變成更適合機器人學習靈巧操作的數據。
在破曉智能的技術路線里,TouchAnything更像一個數據放大器。
它一邊承接EgoTouch采到的人類視覺-觸覺數據,一邊把觸覺監督擴展到更多第一人稱視頻里。基于這層數據,TouchWorld才能進一步學習如何預測接觸、使用接觸;HumanWBC也才能把觸覺帶入全身移動、雙臂協同和靈巧手控制。
![]()
TouchAnything多視角觸覺預測模型架構。模型輸入頭戴第一人稱視角、左右腕部視角和雙手3D姿態,通過多視角視覺特征融合與姿態感知融合,預測雙手壓力分布圖,從而從純視覺視頻中恢復觸覺信息
TouchWorld解決的是觸覺如何進入機器人世界模型和操作策略。
它不是簡單給機器人多接入一個觸覺輸入,而是讓觸覺進入兩個關鍵環節:提前預測未來應該形成怎樣的接觸,并在執行中根據觸覺反饋修正動作。
換句話說,機器人不只是預測“下一幀畫面會怎樣”,也要預測“下一步應該碰成什么樣”。
HumanWBC則是這條路線的下一步:基于人類數據訓練全身移動靈巧操作控制模型,把感知理解、自主移動、全身控制、雙臂協同和靈巧手操作接到同一個系統里。
所謂全身移動靈巧操作(loco-manipulation),不只是讓機器人站在桌前完成一個抓取動作,而是讓機器人真正從“能看懂”,走向“能走過去、抓起來、做完事”。
所以這條路線不是“做一個觸覺模型”,而是以觸覺為核心,把感知、仿真、決策和控制串起來,推動機器人全身移動靈巧操作大腦進化。
TouchWorld:把“手感”寫進世界模型
TouchWorld的核心可以用兩個詞概括:predictive和reactive。
![]()
TouchWorld 三層架構:高層規劃并預測目標,中層生成動作,高頻觸覺反饋實時糾偏
Predictive,指的是觸覺目標預測。
機器人不只要預測未來畫面,還要預測未來應該形成怎樣的接觸狀態。
![]()
![]()
![]()
TouchWorld通過觸覺世界模型預測機器人任務子目標
一個最簡單的例子是按噴壺按鈕。
從視覺上看,手碰到按鈕和真的把按鈕按下去,畫面差別可能很小。尤其當手遮擋按鈕時,圖像很難判斷任務是否已經完成。但觸覺上,手指有沒有接觸、壓力有沒有到位,是更直接的判斷。
TouchWorld預測觸覺目標,就是讓機器人知道:如果這個子任務完成,手指上應該出現怎樣的接觸和壓力。
這對靈巧操作很重要。很多任務的完成狀態并不完全體現在畫面里,而是體現在手和物體之間的接觸關系里。
Reactive,指的是高頻觸覺反饋修正。
真實操作中,物體會滑,接口會偏,手指可能沒抓穩,靈巧手本身也會出現定位誤差。機器人不能每次都等上層模型重新規劃。它需要像人一樣,在接觸瞬間根據觸覺反饋做快速調整。
人抓一個濕滑物體時,不會重新推理每個關節角,而是根據手上的觸感立刻調整抓握姿態。TouchWorld的reactive模塊也是這個邏輯:上層模型給出粗動作,底層根據實時觸覺反饋輸出修正量,讓動作在接觸中不斷糾偏。
在TouchWorld的設計里,reactive模塊的推理頻率是Tactile World Model的4倍。中間策略每輸出一個動作,底層都會進行多次細微調整,每次輸出的是一個delta修正量,而不是重新生成完整動作。
這套機制讓觸覺不再只是被動記錄,而是參與動作生成和執行控制。
TouchWorld在六個真實機器人任務上進行了測試:澆花、桌面清理、電源插頭插入、杯子插入、擦鍋、抽紙巾。
![]()
TouchWorld在澆花、抽紙巾等六項真實機器人任務中完成測試
這些任務看起來并不炫,但非常適合檢驗觸覺的價值。
澆花需要按壓噴壺按鈕;插頭插入和杯子插入考驗精密接觸;擦鍋需要持續調節壓力;抽紙巾涉及柔性物體和穩定拉取;桌面清理則要求機器人在多個子任務之間切換,并保持抓取穩定。
實驗中,TouchWorld在clean setting下平均成功率達到65.0%;在人為擾動場景下,平均成功率達到57.2%。
相比Pi-0.5、FTP-1、GR00T N1.7等對照方法,TouchWorld在兩個設置下分別高出最強baseline15.7和16.0個百分點。
![]()
這個結果不意味著靈巧操作已經被解決。65.0%的成功率也說明,這套系統距離大規模泛化還有很長距離。
它驗證了一件更具體的事:當任務進入接觸階段,觸覺目標預測和高頻反饋修正,確實能提升機器人操作穩定性。
對破曉智能來說,這比單點成功率更重要。TouchWorld證明了觸覺可以進入機器人世界模型和操作策略,而不只是停留在傳感器讀數層面。
![]()
HumanWBC采集人類視覺、動作與觸覺數據,并對齊至機器人執行 沖破黎明前的黑暗
破曉智能這個名字,也蘊含著它成立的理由:機器人行業并不缺demo,也不缺關于通用智能的宏大敘事。但當機器人真的要從展示走向真實場景,很多基礎設施仍然處在技術收斂前的混沌狀態。
五指靈巧手加觸覺就是其中之一:高自由度、帶全掌觸覺的靈巧手方案還不成熟;觸覺數據難采;真機靈巧操作數據稀缺;觸覺手套噪聲大;不同傳感器之間的數據表示不統一;統一benchmark也還沒有建立……
這些問題看起來瑣碎,卻互相鉗制著、決定了觸覺靈巧操作能不能真正走出來。
在楊朔團隊研究過程中,為了采集高自由度靈巧手的觸覺數據,團隊曾把觸覺手套裁剪后,硬套到五指靈巧手上,自己搭出一套真機采集方案。
但是手套用幾天就會壞,靈巧手會發熱,第一天標定好的系統,第二天也可能出現漂移,數據噪聲很大,采集效率并不高。
這些看似很工程的問題,反過來強化了一個判斷:觸覺靈巧操作不是單點模型問題,而是一個系統問題。
這也是破曉智能為什么不能只停留在模型側、研發側的真實原因。
在觸覺靈巧操作里,數據本身就是基礎設施。破曉智能正在搭建面向人類操作的多模態數據采集平臺,方向是低成本、無感便攜、全場景的數據采集,把第一人稱視覺、腕部視角、手部姿態、全掌觸覺、全身姿態等信息放進同一套系統里。
這些工作指向同一個目標:讓機器人不只看到人類怎么操作,還能獲得更接近“人手真實感覺”的數據。
只有這樣的數據足夠多,TouchAnything才能從視頻中恢復觸覺,TouchWorld才能進一步學習如何預測接觸、使用觸覺。
破曉智能要做的,也不只是發布一個模型。
它要圍繞人形機器人全身移動靈巧操作,補齊一套系統能力:觸覺數據采集、觸覺估計、觸覺世界模型、遙操與硬件infra、評測體系,以及面向人形機器人的全身移動靈巧操作模型。
如果說EgoTouch和TouchAnything解決的是觸覺數據從哪里來,TouchWorld解決的是機器人如何預測和使用觸覺,那么HumanWBC指向的是破曉智能最終想完成的閉環:讓機器人把感知理解、自主移動、全身控制和靈巧操作接起來,從“能看懂”,走向“能走過去、抓起來、做完事”。
這一步會把問題從桌面靈巧操作繼續推向更復雜的人形機器人任務:移動、平衡、雙臂協同、長程任務、全身控制,以及觸覺反饋如何和機器人整體動作系統結合。
破曉智能想做的,是讓機器人從“看見世界”,走向“理解接觸世界”。
未來的人形機器人要進入家庭、服務、工業等真實場景,不能只靠視覺和語言。它必須知道自己有沒有碰到、有沒有抓穩、有沒有滑、力是否合適,以及動作偏了以后該如何修正。
從EgoTouch到TouchAnything,再到TouchWorld,楊朔團隊已經把這條路線推進到了真實機器人操作系統里。
破曉智能第一次亮相,想拋出的判斷很明確:機器人基礎模型的下一層能力,是觸覺。
而沖破黎明前黑暗的第一步,就是讓機器人真正知道自己碰到了什么。
TouchWorld
論文:https://arxiv.org/abs/2607.07287
tech blog:https://phanes-lab.github.io/TouchWorld-website/
TouchAnything
論文:https://arxiv.org/abs/2605.13083
官方項目主頁:https://jianyi2004.github.io/TouchAnything-Website/
文章來源:量子位。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.