一覺醒來,具身智能的牌桌上又多了一張硬牌。
WAIC 前夕,星塵智能(Astribot)新模型 Lumo-2,直接在官網甩出 20 + 真機視頻 ——
兩個機器人四手聯彈打包禮盒、煎蛋還要顛鍋、稱一斤小米、接住高處滾落的球、磨豆做咖啡、花式調酒、打蝴蝶結、行李箱拉拉鏈、疊衣服…… 幾乎把 "復雜家務" 這四個字能覆蓋的場景都過了一遍。
![]()
https://mp.weixin.qq.com/s/GH1PatBqRw8rYUdy19YyhA
- 20 + 全流程視頻官網 www.astribot.com/research/Lumo2
- 技術報告:https://arxiv.org/abs/2607.11270
這背后,是星塵智能發布的第二代具身基座模型,也是業內首個面向家庭場景的隱式世界 - 動作模型(Latent World-Action Model),同步發的,還智能體Agent Philia。和上個月發售的 8.99 萬起新本體 T1,推動星塵智能 "AI 模型 — 具身 OS— 繩驅本體" 三位一體的全棧架構,又一次升級。
在此之前,能拿出多個長時程、連續、無遙操作真機演示的公司屈指可數,大部分公司選擇在仿真環境測試:Figure 先后放出廚房、房間、客廳三段整理視頻,成了行業標桿;Physical Intelligence 任務多、時序長、提供全流程視頻,跟此次發布頗為相像。
星塵智能,一口氣拋出 20 + 任務,不僅數量可觀,任務類型也不是簡單的 "拿取 - 放置"(pick and place),躍升到需要時序推理、物理理解、高精細操作、人機協同的更高難度區間。
部署性毫不示弱,端到端推理速度比標準自回歸提升 2.71 倍且不損失精度,能支撐閉環實時控制;
![]()
20 + 家庭任務,難度分層拉滿
翻看星塵智能這次公開的任務清單,會發現它并不是在堆砌數量湊熱鬧,而是刻意按能力維度做了分層展示:
協同合作:一個機器人都難完成的高精細度折紙盒任務,讓兩個機器人或人和機器人四手聯彈,需要過程中理解對方在做什么、做到哪一步、持續判定狀態,難度暴增。
![]()
物理理解:煎雞蛋并顛鍋翻面、稱出 500 克小米、把咖啡粉碗刷洗干凈 —— 這類任務表面簡單,實則要求機器人對液體、顆粒物、油溫這些非剛體物理規律有真實的感知與預判,而不是背答案式地重復固定軌跡。
![]()
時序推理:接住從高處滾落的球、把杯子準確放進正在旋轉的杯架、拿起一顆正在滾動的雞蛋。這幾個任務幾乎是給機器人出的 "動態目標預判題",容錯空間極小,稍慢一拍就會失敗。
![]()
長程任務:磨粉、萃取、出品,一整套咖啡制作流程;花式調酒;煎蛋加撒胡椒 —— 任務鏈條長、步驟強依賴,前一步的誤差會直接傳導到后面每一步。
![]()
高精細靈巧操作:給禮盒系蝴蝶結、往書包里塞玩具再拉上拉鏈、熨燙衣物并掛上衣架、行李箱裝箱拉鏈、拆茶包泡茶、疊衣服。這類任務非常少見,對末端力控和視覺伺服精度要求極高,是過去人形機器人最容易 "露餡" 的地方。
![]()
![]()
一套 Demo 打下來,星塵智能想傳遞的信號很直接:不是能做一件事做到極致,而是同一套大腦系統,能撐起認知理解、動態反應、長鏈條執行、精細操作等多種完全不同的能力形態。這也是它敢把技術報告和數十段視頻一次性公之于眾的底氣。
真正的分野,不是模型多強,是 "AI - OS - 本體" 齊不齊
Demo 好看,只是表象。真正決定這場競賽走向的,是 Demo 背后支撐的技術路線。
放眼全球,具身智能公司大致能分成全棧派、偏模型大腦派、本體派幾類打法:
全棧派走蘋果 “軟硬件協同” 路線,圍繞 AI 模型、機器人操作系統(OS)、機器人本體及量產部署進行一體化布局,其優勢在于軟硬件協同優化,能夠持續獲取真實場景數據,形成” 數據 — 模型 — 產品” 閉環,加速機器人能力迭代。
大腦派則聚焦打造跨機器人平臺的通用基礎模型,Pi 重點突破 VLA、提升機器人長時序任務和泛化能力;Skild AI 則為不同機器人提供統一智能層。其優勢在于能夠集中資源推動基礎模型創新,具備更強的跨平臺適配能力。
![]()
星塵智能給出的判斷是:機器人真正要走進家庭,AI 模型、具身操作系統、機器人本體,三者缺一不可,誰也替代不了誰。
- AI 模型負責理解世界、學習技能,是感知與決策的源頭;
- 具身 OS負責長期服務用戶、管理記憶、協調多個智能體,是機器人 "活下去、記得住、越用越懂你" 的中樞;
- 本體負責安全、高效地和真實物理世界打交道,是所有智能最終落地的載體。
單獨把某一環做到極致 —— 無論是最強的模型、最能打的操作系統,還是最精密的硬件 —— 都只是 "半成品"。只有 AI 模型、具身 OS、繩驅本體三者協同進化,機器人才能真正成為開放世界里可持續迭代的 "Personal Robot"。
這也是為什么星塵智能把這次發布同時押在 AI、OS、本體三條線上 ——AI 模型管 "腦子怎么想",OS 管 "這個腦子怎么長期服務人、協調多臺機器人",而背后的繩驅本體,則是全球第一家實現量產的繩驅人形機器人平臺,模仿人類肌腱運動機制,讓機器人在靈巧操作、擬人表現力、人機交互安全性上有天然優勢 —— 這一點,純軟件公司做不到,只靠硬件堆料的公司也做不到。
![]()
https://mp.weixin.qq.com/s/GH1PatBqRw8rYUdy19YyhA
5 月發布 T1 新品 8.99 萬元起售,將高精細操作機器人打到地板價
Lumo-2:先 "預測世界",再 "生成動作"
過去一代具身模型,無論是 VLA 還是 WAM(世界動作模型),本質上都在解決 "下一步該做什么動作",卻很少回答 "這個動作會怎樣改變世界"。這帶來兩個老問題:復雜技能高度依賴昂貴的機器人示范數據;模型越做越大,端側部署成本水漲船高。
Lumo-2 的核心思路是反過來:先在一個輕量級、基于物理規律的潛在動態空間(Latent Space)里預測未來世界會變成什么樣,再從這個預測結果生成動作。這比傳統顯式文本推理 "一步步說出想法" 更快,也比直接生成未來視頻的世界模型更省算力,用最小的計算代價,實現了接近世界模型的推理能力。
![]()
技術報告里,團隊還指出了一個此前容易被忽視的問題:過去基于重建的動作編碼方式,會讓模型學到的表征偏向 "重建得像不像",而不是 "控制得好不好",導致訓練指標和真機表現兩張皮。
為此,Lumo-2 設計了三階段漸進式跨模態對齊—— 先把動作和世界動態對齊,再把動作和視覺、語言對齊,最后在多源異構數據上聯合訓練,從根子上解決了 "訓練好看、真機拉胯" 的老毛病。
![]()
階段 1:將動作與世界動態對齊
![]()
階段 2:將動作與視覺和語言對齊
![]()
階段 3:在 VLM、視頻和機器人數據上聯合訓練
這套設計帶來了實打實的性能提升:
在按時序推理、物理理解、長流程、高精度四類拆分的真實復雜任務測試中,綜合表現全面最優,超越 Pi0.5 和 Fast-WAM
![]()
在具身 VLM 基準測試中,相比同規模基座,Lumo-2 在幾乎所有具身理解與空間定位任務上都取得一致提升,多項核心基準排名第一;
在泛化抓取 - 放置任務上,無論是基礎設置、未見指令還是未見物體,Lumo-2 都持續優于 π?.?和 Fast-WAM 等主流基線,在未見指令 + 未見物體的組合場景下優勢尤其明顯;
![]()
在人機技能遷移上,面對兩類標注完整度不同的人類視頻數據源,Lumo-2 無需額外的專用遷移學習機制,就能把人類演示中的經驗有效遷移到機器人任務上,包括那些機器人從未見過的物體。
工程層面毫不示弱,分塊自回歸解碼策略利用動作維度間的弱耦合性并行生成,端到端推理速度比標準自回歸提升 2.71 倍且不損失精度,能支撐閉環實時控制;
![]()
輕量化的時序上下文機制則通過歷史動作記憶消除多階段任務里的 "感知混疊",讓長鏈條任務不容易在中途 "斷片"。
Agent Philia,讓機器人不止會干活,還能長期陪著你
如果說 Lumo-2 解決的是 "這一步怎么做",Agent Philia 要解決的就是 "這個機器人怎么在你家里長期靠譜地活下去"。
![]()
https://mp.weixin.qq.com/s/GH1PatBqRw8rYUdy19YyhA
Philia 采用全模塊化解耦架構,交互界面、推理模型、記憶系統、導航算法、操作策略、新增機器人實體支持,都是獨立組件,升級任何一塊都能直接反映到整體能力上,不需要推倒重來。
![]()
它維護一套持久化的語義記憶,記住用戶偏好、歷史交互、任務執行記錄和語義位置信息 —— 這些記憶只用來輔助任務規劃,不會繞過安全校驗直接控制機器人執行,網關層始終把關。用戶可以直接用飛書、微信這類日常應用,打字或說話下指令,不用學一套新的操控方式;機器人還能結合歷史上下文理解你的真實需求,主動匯報執行進度。
對企業客戶,Philia 支持一個智能體同時調度多臺異構機器人:每臺機器人保留自己的地圖、定位和運行時環境,但共享同一個語義空間,任務可以在多臺機器人之間統一分配。對開發者,Agent 能力和機器人本體能力相互解耦,模型可以持續升級、機器人平臺可以持續擴展,而不用把整套系統推倒重來。
三位一體時代,牌桌上沒幾個真玩家
具身智能這場仗,正在從 "比誰的模型參數大、榜單刷得高",轉向 "比誰先把 AI 模型、具身 OS、機器人本體擰成一個能持續進化的系統"。這不只是技術路線之爭,更是決定誰能率先把機器人真正規模化推進普通家庭的分水嶺。
星塵智能這次交出的答卷是:20 + 高難度任務的真機驗證,加上一篇把訓練方法論、benchmark 結果和局限性都擺出來的技術報告,再加上一套面向長期服務的操作系統 —— 三樣東西同時拿出手,這在當前全球具身智能公司里并不多見。
7 月 17 日至 20 日,星塵智能亮相在上海世界人工智能大會(WAIC)上,已成為客戶最愛展示的機器人產品之一,出現在多個落地場景:螞蟻集團智慧藥房應用,京東集團智慧零售應用、智能操作系統公司中科創達(股票代碼:300496.SZ)智能交互應用、類腦具身智能公司具腦磐石的智慧導覽應用場景。
![]()
模型可以被復現,Demo 可以被模仿,但長在自家繩驅本體上的運控策略、大腦與身體之間磨合出來的協同關系,以及能陪用戶一起變聰明的記憶系統,短期內很難被簡單復制。
具身智能這條賽道,顯然還沒到誰能松口氣的時候。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.