![]()
編輯丨%
在接下來的幾十年里,數十億臺由 AI 驅動的自主機器人將與人類并肩工作:它們會在工廠里干活,在倉庫里做枯燥的任務,照護老人,進入危險的災區,遞送包裹和餐食,最終也會在家里幫我們分擔工作。
這些機器人部分形似人類,但更多更具特色。不論外形如何,它們都將高度依賴 AI,才能在現實世界里創造真正的價值。這篇發表在 IEEE Spectrum 的文章認為,AI 機器人將迎來一個關鍵拐點,但這不會來自某個單一的「ChatGPT 式」突破,而會來自一整套協同工作的 AI 工具與系統。
文章指出,2025 年機器人公司總投資達到創紀錄的 407 億美元,約占全部風險投資的 9%。在這樣的背景下,真正的問題就變成了:AI 機器人究竟要怎樣才能開始產生足夠大的經濟影響?今天許多機器人公司都在做出大膽承諾,比如說人形機器人很快就會進入家庭,但承諾與現實之間仍然有很大鴻溝。
讓機器人與我們一起生活、工作的愿景已然流行了很久,許多程序員也一直試圖把這個愿景變成現實,但物理世界實在太復雜,傳統程序根本無法處理它所呈現出的無窮細節。正因為有了 AI,機器人不再只是被「編程」,它們開始通過學習來適應真實世界。
該文章的兩位作者分別來自機器人學與 AI 機器人產業的一線:一位是俄勒岡州立大學機器人學教授,同時也是 Agility Robotics 的聯合創始人和首席機器人官;另一位曾在 Google X 擔任 Everyday Robots 項目的副總裁,主導過相關 moonshot 項目。
基于他們在真實場景中部署 AI 機器人的經驗,作者認為:AI 在復雜機器人系統中的確會帶來巨大收益,但真正推動機器人進步的,不會是某個單點的「頓悟時刻」,而是多種 AI 工具組合起來、經過精心工程化后的系統能力。
他們接著提出,圍繞 AI 機器人有五個「硬道理」。
YouTube 演示與現實世界之間的鴻溝是真實存在的
這些年,我們在 YouTube 上見過太多令人驚嘆的人形機器人視頻:機器人能跳舞、跑障礙、甚至做出各種高難度動作。機器人圈里有句老話:「永遠不要輕信一段 YouTube 機器人視頻。」因為能夠在非結構化的人類環境中真正做事的機器人,與那些經過精心腳本、剪輯和排演的表演機器人之間,差距仍然非常大。
最近引發關注的是春晚上一場武術表演。雖然令人印象深刻,但這依舊屬于長期以來那類高度編排的機器人演示:一切都經過了提前設計與排練。底層控制、同步性和動作編排都非常驚艷,但這類表演展示出的自主性和智能,仍更接近工業機器人,而非民用的通用機器人。
這些演示確實會讓人追問:機器人技術究竟走到哪一步了?如果機器人都能打拳、后空翻、跳舞,為什么它們還不能在晚飯后替我把碗洗了?答案很簡單:讓 AI 機器人在多變的人類環境中執行通用任務,依然非常困難。春晚這類演示里用到的 AI,主要只是低層運動控制,它只是讓機器人走向通用能力道路上的一小部分。
數據仍然是一個未解難題
大語言模型最初是拿互聯網規模的文本數據訓練出來的。到了 2022 年底,ChatGPT 橫空出世,讓世界第一次意識到:AI 機器竟然真的可以用散文、詩歌,甚至幾乎關于任何主題的方式與人交流。后來,LLM 證明了它們有很強的泛化能力,也開始支持多模態輸入與輸出,比如文本、圖像和視頻。
但這類訓練數據有兩個關鍵特征:規模巨大,而且來自人類——而這恰恰是 AI 訓練的黃金標準。可問題是,把 AI 賦予身體、讓它以機器人的形式進入物理世界,一直都是一個非常困難、而且普遍沒有被解決的問題。面向通用機器人的 AI 模型,必須在非結構化、動態變化的環境中,同時滿足物理、幾何和時間上的多重約束。
![]()
圖示:實現機器人生活可能需要多種機器人形式實現。
為了實現泛化,機器人模型需要在高維配置空間里訓練;這里的「維度」可能包括文本、光照條件、自由度、關節限制、速度、力以及安全邊界等等。更重要的是,這必須是「好數據」——要覆蓋物理世界中幾乎無限多種可能狀態。
現實里幾乎沒有現成的數據源能滿足這一點,因此,遙操作、視頻分析、人類動作捕捉,以及在仿真和真實世界中的自我探索,都被視為重要的數據采集方式。這是一項極其艱巨的任務。比如在 Google X 的 Everyday Robots 項目里,團隊在 2022 年跑了 2.4 億個仿真機器人實例,就為了訓練一個垃圾分類模型。
要讓機器人在某項技能上達到接近人類的水平,可能需要再每一種技能上都花費與之類似規模的數據。眼下,這樣的能力還遠沒有達到人類水平。
并不會有一個單獨的 AI 解決一切
從現實角度出發,距離一個「單一 AI 模型就能讓通用機器人和我們一起生活工作」的時代還很遠。物理世界極其復雜,而且機器人周圍還會有各種人和動物。怎樣訓練一個模型,讓它在所有這些場景里都能安全、可靠地操作機器人?現在還做不到,至少短期內做不到。
相比于依賴一個全能的 AI,作者更看好的是「agentic AI」架構,也就是機器人上運行的高層協調模型。它們可以推理、規劃、使用工具,并從結果中學習,在有限監督下執行復雜任務。這樣的高層模型會調用專門負責不同任務的子系統。作者甚至預測,不久之后我們會看到多臺機器人通過各自的機載 agentic AI 協同工作。
AI 工具正在釋放機器人新的、強大的能力,也會帶來新的解決方案和新市場。作者樂于看到這些新模型被廣泛開放,甚至有些已是開源版本,因為這很像互聯網曾經經歷的過程:真正的進步,發生在普及之后。作者預期,隨著這些 AI 工具與技術的廣泛可得,機器人中復雜行為的普及也將不可避免地發生。
硬件之路任重道遠
機器人是個復雜的系統,很多部件都必須精確協同。要讓機器人真正有用且安全,感知系統、控制計算機以及執行器等每一個環節都要配合得非常精密。
執行器(也就是電機和齒輪)正是一個典型例子:過去能支撐工業機器人的技術,不一定能支撐未來要在人類環境中工作的機器人。如果這些機器人不小心撞到障礙物,沖擊會很硬、力會很大,最后容易損壞——人類可不是這樣運動的。
人類與世界的互動更具有順應性。想必讀者經常能在鑰匙孔周圍看到劃痕,或者在手機充電口看到類似的痕跡。這是人類對環境感知的代表。而機器人如果想達到類似的能力,它們就必須具有對應的執行器,并且將其大規模普及開來。
價值源自簡單小事
令人印象深刻的演示,與真正創造價值的現實任務之間,有著巨大差別。機器人技術正好體現了莫拉維克悖論:對人類很難的任務,往往對電腦很容易;而對人類很容易的任務,比如幼兒的動作,對電腦和機器人卻極其困難。
提供服務是一種非常嚴苛的現實檢驗,因為客戶只關心自己的問題是否真的被解決。要部署基于 AI 的機器人方案,它們必須在性能和安全上都優于現有做法。Agility Robotics 早期在客戶場景部署人形機器人 Digit 時,很快發現的第一個障礙就是安全:機器人在人的空間里保持平衡并操作物體,會給工作場所帶來新的風險。
在最初的部署中,物理隔離是必要的。Agility 之后圍繞安全問題展開了長達數年的工程工作,幾乎觸及機器人設計的每一個方面,并大量依賴新的、基于 AI 的人類檢測與行為控制方法。
另一方面,Google 的 Everyday Robots 早在 2019 年就在辦公樓里部署機器人,做清理咖啡桌、分揀垃圾之類的雜務。團隊很快就發現,真實世界對機器人來說「非常混亂,也非常困難」。這段經歷反過來塑造了他們 AI 系統的架構與部署方式,同時也積累了可與仿真數據結合的真實世界訓練數據。
![]()
圖示:Google 的 Everyday Robots。
于是作者得出了結論:只有產品滿足了需求,并持續推廣部署,才可能反過來塑造 AI 工具和基礎設施的結構,讓機器人在短期內獲得實用價值,并沿著通往更大能力和更強通用性的道路前進。
除非有極為豐富的經驗,不然就不要期待天降幸運與高級算法,就算真有,數據量也不夠喂的。
機器人會一步一步走來
展望未來,作者毫不懷疑:世界正在通過機器人把 AI 帶入物理世界。人類正處在有用智能機器「寒武紀大爆發」的開端。AI 不是單一工具,而是一整片巨大的技術前沿;它正在釋放新能力,而這些能力將強大到足以塑造未來經濟。
這場變化不會發生在某個唯一、 定性的時刻,而會以一個又一個大小不一的突破逐步展開:AI 驅動的機器人先在少數任務上提供真實價值,然后再擴展到更多任務,最終在眾多千億美元級市場中產生連鎖影響,顯著改善人類生活質量。
https://spectrum.ieee.org/robotics-ai-breakthrough
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.