林方舟 發自 凹非寺
量子位 | 公眾號 QbitAI
世界模型,是當前AI圈最火、也最沒有共識的領域之一。
它的概念沒有收斂、技術路線沒有收斂、訓練方式沒有收斂、數據標準沒有收斂、評測尺度沒有收斂……
7月19日,在WAIC“世界模型六小龍”論壇上,一場信息密度極高的圓桌討論,湊齊了六家公司的世界模型技術負責人。他們是:
- 大曉機器人首席科學家陶大程(主持人)
- 螞蟻靈波首席科學家沈宇軍
- 極佳視界聯合創始人&首席科學家朱政
- 無界動力聯合創始人兼CTO夏中譜
- 智元機器人AI算法總監任廣輝
- 自變量機器人聯合創始人兼CTO王昊
這些嘉賓的觀點,代表了行業對世界模型最前沿的思考,值得一聽。
![]()
什么能力重要?
共識不多講了,嘉賓們的分歧才是最有趣的部分。
先來看世界模型的技術路線之爭。
這六家公司目前押注的技術路線,按照“模型在什么空間里推演世界”的尺子,可大致歸類為三派:
- 像素生成派:代表公司是極佳視界
- 隱空間(JEPA)派:代表公司是無界動力
- 融合派:代表公司是大曉機器人(理解生成預測一體化)、螞蟻靈波(推出了多條路線的世界模型全家桶)、自變量機器人、智元機器人
由于走的技術路線不同,各家公司自然對許多焦點問題有不一樣的看法。
比如:世界模型究竟該對物理世界有多大程度的理解?
一邊希望它盡可能接近物理模擬器。
無界動力的夏中譜提出,評價世界模型要看它對幾何、運動、力等狀態的預測精度。
另一邊則認為,機器人沒必要先成為物理學家。
螞蟻靈波的沈宇軍認為“物理合理性”比“物理精度”更重要。機器人只需要明白同樣重量的鐵比棉花掉的快,但到底快多少,不需要知道,只需要觀察。
他說,機器人不必算清每一條軌跡、復現每一個物理參數,只要知道哪些差異會影響眼前的動作,就夠了。
對模型能力評價的標準,嘉賓們也存在分歧。
智元的任廣輝認為,推理的長時物理一致性,是評價是世界模型能力必不可少的指標之一。
而自變量的王昊卻直言:長程推演是“偽需求”,比起這個能力,他更看重推理的時效性。如果推理慢到錯過決策窗口,再完整的理解也沒有用。
在觀點碰撞背后,各個嘉賓捍衛的是自家模型擅長的能力。
模型對于物理世界的理解,隱空間里可以直接回歸物理量,所以敢要求物理精度;像素生成學到的天然是“看起來合理”,所以只承諾物理合理性。
而關于長時一致性,智元的世界模型,有一大用途是當仿真器,長程推演正是仿真器的生命線;自變量把世界模型與VLA整合進同一個端到端框架,預測是動作生成的前置步驟,預測鋪得越長,推理就越慢,占掉的決策時間就越多。
![]()
什么將率先收斂?
除了技術路線之爭,世界模型在下一階段最可能先收斂的是什么?
大家的判斷也不盡相同。
任廣輝和夏中譜認為是統一表征。語言模型找到了token,具身智能還沒找到自己的“token”,視覺、語言、動作這些模態得對齊進同一個表征。
王昊押的是融合,視頻生成貢獻未來預測、隱空間貢獻推理、3D顯式建模當空間記憶,各取所長拼出新架構,這在大語言模型歷史上發生過一遍。
沈宇軍的押注則落在觸覺上。他篤定,下一階段行業會率先形成共識:觸覺將成為機器人不可或缺的模態。觸覺數據一旦突破,物理世界和數字世界的世界模型,將分道揚鑣。
如今許多機器人的世界模型,從數字世界的視頻生成模型遷移而來;螞蟻靈波則在開發具身原生的世界模型,從控制執行的需求出發、基于自回歸架構從頭預訓練,讓模型為“邊預測、邊行動”、而非為生成好看的畫面而設計。
陶大程認為,世界模型最近的收斂不會發生在某一條技術路線上,而是發生在一把橫向的評測標尺上。
他舉例,就像深度學習的爆發,不是神經網絡在論戰里說服了特征工程派,而是ImageNet把所有方法拉到同一把尺子下。標尺統一了,收斂自然就會發生。
大曉機器人在論壇期間發布了PHYSICAL IQ,定位為首個具身原生、面向多場景、多本體、多任務的物理智能評測基準平臺,公平量化不同機器人本體與世界模型的物理智能水平。
![]()
從Demo走向Deployment
雖然各家的技術路線有分歧,但當機器人進入物理世界,最終的評價標準會變得很樸素:它能不能穩定完成任務?
按照夏中譜的定義,叫“決策有效性”;任廣輝說的偏技術,“最終為policy提升多少指標”;朱政的定義則是“多任務真機成功率”。這些指標雖然名字不同,但目標殊途同歸。
Demo穩定完成任務并不難,因為為了一個Demo可以不計成本,真正難的是在真實世界中規模化部署(Deployment)。
王昊分享了一個規律:模型能力從90%提升到99%,再從99%提升到99.9%,投入的成本并不是線性增長。
實驗環境里看似微小的錯誤率,落到部署現場,可能就是一次次人工接管、一次次返工,最后變成一筆算不過來的賬。
對隨機和突發情況的應對能力,也是機器人走出實驗室后必須要補上的短板。
沈宇軍舉了商超里的例子。機器人要找一包蔬菜,顧客卻可能順手把它放進了牛奶柜。單獨一起事件,可能是偶發情況;但對每天面對不同顧客的機器人來說,這就是日常。
大曉機器人的陶大程強調了端側能力對于部署的重要性。
很多世界模型跑在云端,但機器人留給自己做判斷的時間,可能只有幾十毫秒到幾百毫秒。網絡不能永遠在線,云端也不能總在等待。
他說,最難的不是讓模型變聰明,而是讓聰明變得便宜、可靠、及時。
一句話說:Demo展示的是能力上限,部署則考驗能力下限。
最后,還有一個問題值得深思:世界模型今年上半年才真正火起來,如果兩年后看,眼下的什么做對了,什么做錯了?
沈宇軍說,行業有時把“模型的能力”和“模型展現出來的能力”混淆了。模型的能力是泛化效率、可交互性這類內在屬性;展現出來的能力是生成效果這類外在呈現。
他認為,兩年后看,所有為模型架構能力做的工作,都做對了,但過于追求模型呈現出來的能力,并不好說;所有為數據鏈路做的準備,都做對了,但當下積累的數據最終是否會被用到、是否會被更新迭代,并不好說。
朱政說,眼下模型之外的太多事情分散了精力。在基模尚未收斂的時候,就去探索非常多的商業化場景,大概率不會成功。
任廣輝稱,兩年后,世界模型會走向更加“具身原生”,需要更大規模的具身原生數據和為具身而生的原生架構。
這場持續一小時左右的圓桌,討論了世界模型最值得關注的幾個話題,呈現出行業現階段代表性的共識和分歧。
陶大程的總結說得很好:分歧是論文的素材,重疊是產業的基底。對整個行業而言,分歧并不是問題,反而是當下的紅利。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.