編輯|+0
持續火熱的機器人,再次成為 WAIC 最搶鏡的主角。
跳舞、搭積木、分揀物品……展臺前,觀眾舉著手機,哪里動作幅度大,鏡頭就往哪里追。
千尋智能的展臺上,則來了兩位畫風完全不同的主角:一位是通體黑灰、看起來不茍言笑的 Moz1,埋頭干活;另一位是首次公開亮相的 Moz2,奶杏色機身配上粉色小圍脖「OOTD」,忙著向觀眾打招呼、舉手比心,靠賣萌吸引了不少鏡頭。
![]()
鏡頭拉遠,兩個機器人所處的現場,有一塊居家日常的客廳空間。沙發、餐桌、冰箱和洗碗機分布在不同位置,可樂、臟碗和玩偶散落其間,一眼看過去,像極了普通打工人的居家日常。
「快幫我整理客廳!」工作人員向機器人 Moz1 下達指令后,便退到一旁。接下來,是機器人的「表演」時刻:Moz1 先觀察環境,再開始自主移動——它走到桌邊拿起可樂,將其放進冰箱,隨后又把餐桌上的臟碗送入洗碗機。
![]()
完成桌面清理后,Moz1 正準備轉身前往沙發整理玩偶,一個紙團卻意外被丟到了桌面上。Moz1 隨即停下原來的動作,重新感知并判斷環境變化,調整任務順序和行動路線,轉而拿起新增的紙團,將其扔進垃圾桶。處理完這一臨時插入的任務后,Moz1 沒有從頭開始,而是繼續執行尚未完成的玩偶收納任務,將沙發附近的玩偶歸入收納筐。
![]()
沒有人跟在后面提醒它「先拿這個」,也沒有人在中途補充「下一步去那里」。從理解指令、拆解任務,到應對新增物體、局部調整計劃,再到繼續原來的任務,幾項子任務被連續完成。
現場屏幕還會同步呈現任務拆解、當前步驟及后續計劃,讓觀眾看到一句自然語言指令如何被轉化為一段持續執行的動作過程。
家務這種事,果然還是看別人做更輕松。不過,「整理客廳」這件看似普通的小事,對機器人來說,其實遠沒有看上去那么簡單。
整理客廳為什么比看上去更難
人類聽到「把客廳整理一下」,會自動補全許多沒有被說出口的信息:哪些東西算亂、應該放到哪里、先收拾桌面還是先撿地上的物品。這個過程依賴長期積累的生活常識與經驗,而機器人并不天然具備這些能力。
這類任務不同于抓取、分揀等邊界清晰的機器人演示。后者通常預先定義了任務起點、結束條件、物品位置和操作流程;真實客廳卻不是標準化工位。家具布局、物品種類和擺放位置隨時可能變化,目標物體可能被遮擋,也可能出現訓練中未見過的新物品,人的走動和臨時放入的雜物還會持續改變環境狀態。這種開放、動態且缺少統一規則的場景,構成了典型的非結構化環境。
![]()
因此,「整理客廳」考驗的不只是機器人能否完成抓取、移動和放置,而是能否理解一個模糊目標,并將其轉化為可執行的任務鏈:識別物品、判斷類別、確定歸位位置、規劃路徑、完成操作,并在每一步后確認結果。場景發生變化時,它還需要重新評估狀態,調整任務順序和行動方案,而不是記住固定坐標、路線或腳本。
這里涉及兩項相互關聯的能力:長程執行與場景泛化。前者要求機器人沿著較長的任務鏈持續推進,記住總體目標、已完成步驟和待處理事項;后者要求它在布局變化、陌生物品、遮擋、路徑受阻和臨時干擾下,仍能將既有技能遷移到當前場景。
具身智能早期的許多演示,更擅長完成拿起杯子、打開抽屜等單點任務。但當動作鏈變長、子任務之間產生依賴后,問題就不再只是會不會抓,還包括是否記得為什么要抓,以及抓完之后做什么。機器人可能遺忘目標、漏掉步驟、重復處理已完成的物品,或因一次局部失敗偏離后續計劃。這類任務上下文和狀態丟失的問題,常被形象地稱為「金魚記憶」。
長程任務還會放大局部誤差。假設每個子步驟的成功率為 95%,且各步驟近似獨立,那么包含 10 個連續步驟的任務,全部一次成功的概率只有約 60%。動作鏈越長,識別偏差、抓取失敗和放置誤差越容易累積;環境越開放,機器人需要處理的異常狀態和分支情況也越多。
因此,長程能力不能只看單個動作做得是否準確;評價泛化能力,也不能只看機器人能否在另一套布置中復現相同流程。更關鍵的是,它能否發現失敗或環境變化,判斷問題出現在哪一步,并通過局部修正或重新規劃,繼續完成原來的總體目標。
開冰箱、抓餐具,或者把玩偶放進收納筐,這些動作并不新鮮。此次演示的變化在于,機器人需要圍繞「整理客廳」這一整體目標,自主識別當前狀態、決定下一步行動,并在環境變化中持續執行,而不是依賴人工逐步提示或預設腳本。
任務也由桌面上的單次抓取擴展到跨越不同家具和功能區域的連續操作,即從物體級走向空間級。機器人不僅要處理更多動作,還要協調導航與操作。例如,從桌邊拿起飲料后移動到冰箱前,即使原來的桌面已經離開視野,它仍需掌握自己正在處理什么、物品是否抓穩、冰箱門處于什么狀態,以及還有哪些物品尚未歸位。
這要求機器人持續維護一份動態更新的任務狀態與場景表征,包括總體目標、已完成和待完成的子任務、物品及其空間關系、環境變化、執行異常和下一步行動。只有同時保持任務上下文,并動態理解非結構化環境,機器人才能從完成一次演示,走向在不同場景中完成同類任務。
長程任務背后,Spirit v1.6 不只是把動作串起來
把幾個機器人動作按順序連接起來,并不等于機器人具備了長程任務能力。
如果飲料永遠位于同一個位置,冰箱門永遠保持相同角度,路徑中也不會出現任何障礙,一段固定程序當然可以讓機器人依次完成抓取、移動和放置,但真實環境不會嚴格配合程序。
物體可能被移動,目標位置可能被遮擋,某一步可能沒有真正完成,機器人抓住的東西也可能在途中滑落。固定腳本只知道下一條指令是什么,卻不知道環境是否仍然滿足執行這條指令的條件,更不知道是否應該暫時放棄原計劃、重新安排順序。
針對這些問題,Spirit v1.6 采用了 VLA 與世界模型一體化架構。VLA 負責將用戶提出的語言目標、機器人看到的環境和機器人能夠執行的動作連接起來;世界模型則用于理解物體之間的關系,并預判一個動作執行后,環境可能發生怎樣的變化。
![]()
千尋智能 Spirit 具身智能全棧架構
進一步來看,Spirit v1.6 在預訓練階段引入了對抽象動作 Token 的預測。這里的動作 token,可以理解為對連續機器人行為的一種更高層表示。相比直接在冗長的底層動作序列中逐步推演,抽象動作 Token 提供了更高層的行為表示,有助于降低長序列訓練與推理的計算成本,并加強環境感知、動作決策和執行調整之間的聯動。
以把飲料放進冰箱為例,機器人不能只生成一段機械臂運動軌跡。它需要判斷飲料的位置和朝向,找到合適的抓取點,確認通往冰箱的路線和冰箱門的狀態,并在動作執行后重新觀察:飲料是否抓穩、門是否真正打開、放置結果是否符合預期。
從系統能力上看,這里涉及長程任務中的執行監控。抓取動作結束,不代表飲料一定已經被抓住;機械臂進入冰箱,也不代表飲料已經穩定放下。系統需要根據執行后的視覺和狀態反饋,對子任務進行完成判定,再決定繼續、重試還是調整計劃。
世界模型提供的是對環境狀態和動作后果的內部估計,幫助機器人判斷:如果現在這樣做,接下來可能發生什么。但世界模型并不直接等同于長期記憶。長程執行還需要持續維護初始目標、已完成任務、環境變化和當前計劃。VLA 與世界模型一體化的意義,在于讓狀態預測、動作生成和執行反饋形成閉環,而不是從頭到尾播放一套固定動作。
在長程能力之外,千尋智能還通過其他演示補充了不同維度的驗證。
桌面整理任務重點測試動態重規劃:當物品被臨時移走、目標位置受到遮擋,或者已經整理好的桌面再次被打亂時,機器人需要重新判斷執行順序,而不是沿用失效的計劃。
![]()
藥片分揀考驗的則是小尺寸物體識別、毫米級定位和末端力控。
![]()
扭蛋機互動面對的是機器隨機轉動圈數和觀眾伸手位置變化,要求機器人根據視覺反饋實時調整動作軌跡。
![]()
這些任務對應的是同一套基座能力:理解目標、感知變化、規劃動作,并根據真實執行結果繼續作出判斷。
從展臺到落地,長程任務還要跨過穩定性和數據關
判斷一套具身系統是否成熟,不能只看它在展臺上能否完成一次任務,還要看它能否在真實場景中長期、重復、穩定地工作。
這也是千尋智能優先進入工業場景的原因。工業環境的任務目標相對明確,但對精度、節拍、一致性和安全性的要求更高。柔性線束、來料偏差等不確定因素,以及高壓接插件插接等復雜非標工序,都會持續考驗機器人的泛化和糾錯能力。
據千尋智能披露,Moz1 已在寧德時代動力電池 PACK 產線承擔高壓測試插頭插接等復雜非標工序,作業成功率穩定在 99% 以上。同時,千尋智能已與京東、博世、舍弗勒等企業展開合作,持續拓展零售和工業場景應用。
對千尋智能而言,工業落地不僅提供了商業化驗證,也帶來了關鍵的真實運行數據。機器人在實際作業中出現的抓空、滑落、停滯和接觸點判斷錯誤,都可以被記錄、清洗和復盤,再用于模型迭代。這也是其數據金字塔體系的出發點。
在底層,不同來源的數據承擔著不同作用:互聯網視頻用于建立通用的視覺和語義認知,可穿戴設備記錄人類在真實空間中的操作過程,遙操作數據幫助模型適配機器人本體,真機運行數據則進一步記錄任務中的成功、失敗、修正和恢復。
![]()
千尋智能全國數據采集流轉中心
在中間層,采集到的數據需要經過清洗、標注、質檢和復盤,才能真正轉化為訓練材料。千尋智能自研的輕量化可穿戴采集設備已經迭代至第七代,并計劃在 2026 年沉淀百萬小時級真實世界交互數據。
在最上層,數據最終要轉化為機器人對陌生物體、陌生環境和陌生任務的泛化能力。
![]()
千尋智能數據金字塔
由此形成一套持續迭代的閉環:真實場景暴露問題,運行過程沉淀數據,數據推動模型升級,升級后的模型再進入更多場景。機器人最終要在摩擦、遮擋、形變和執行誤差中接受檢驗,這也是現實運行數據難以被實驗室數據完全替代的原因。
本屆 WAIC 上首次公開亮相的 Moz2,則代表了這條路線向下一個場景的延伸。Moz2 是千尋智能面向商超、酒店、辦公樓宇等商用服務場景推出的探索性產品,用來驗證公共空間中的機器人形態、人機交互方式和硬件適配能力。
![]()
與強調工業操作能力的 Moz1 相比,Moz2 的設計明顯更具親和感。其機身采用柔性材質和圓角處理,降低機械設備在公共空間中的距離感;全身配置 32 個自由度,使用全向舵輪底盤和折疊腿部結構,以適應商場、酒店和辦公場所中的靈活移動需求;7 自由度仿生手臂與三指靈巧手,則為后續物品遞送、商品理貨等操作保留硬件空間。
現階段,Moz2 主要用于商服場景中的人機交互形態打磨、用戶體驗驗證和硬件適配測試,暫未搭載完整任務功能。未來,Moz1 在工業場景中已經驗證的長程規劃、精細操作和動態適配等能力,將逐步遷移至 Moz2。
這也標志著千尋智能「先工業、再商服、后家庭」路線向前推進了一步:先在價值明確、要求嚴格的工業等環境中打磨技術和穩定性,再進入開放程度更高、人機交互更頻繁的商用服務空間,最后才是復雜度最高、需求最分散的家庭環境。
結語
機器人進入日常生活,正在從一種想象變成可被具體觀察的過程。
誠然,現實的客廳依然比展臺復雜得多。沙發縫里可能卡著遙控器,桌上有不知道該扔還是該留的票據,地上還躺著一只永遠不肯配合的拖鞋。人類的指令也常常臨時變化,說完「都收起來」,又補一句「那個別動」。機器人最終要面對的,就是這樣一個不太講規則、隨時會變化的真實世界。
可以看到,行業開始不再只盯著某一個動作,而是把目光放在更長的任務過程上。從單步操作到空間級的連續任務,「整理客廳」這樣的長程任務,正在成為具身智能能力的一次自然延伸。
技術變革的早期現場,往往并不總是最震撼的。1903 年,萊特兄弟第一次完成動力飛行時,飛機只飛了十幾秒、幾十米;但從那一刻起,人類進入天空的路徑已經被打開。今天的具身智能也處在類似階段:展臺上的機器人仍在打磨細節,但當它開始圍繞一個完整目標自主執行,并在干擾中繼續推進任務時,變化已經發生。
展臺上的 Moz1 還在不斷打磨細節,但那句指令說完后,人類已經可以退到一邊。這或許正是變化開始的地方。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.