作者 |郭月
編輯 |志豪
中國智駕出了國門,還能不能打?
過去幾年,中國汽車出口量節節攀升,中國汽車的競爭力已不止于動力與續航——智能化正在成為新的殺手锏。在全球路況最復雜市場磨出來的智駕技術,如今正跟隨整車一起,駛向海外。
多家中國車企紛紛落子布局:小鵬日前官宣,第二代VLA模型已實現同一套架構打通中國與歐洲市場,當前正推進歐洲地區的量產適配工作, 目標2027年逐步向海外用戶交付。
吉利旗下千里浩瀚G-ASD智能駕駛系統今年3月取得聯合國歐盟UNR171國際認證,蔚來也在歐洲落地智能駕駛技術中心。
與此同時,全球自動駕駛的法規通道也在打開。此前聯合國世界車輛法規協調論壇(WP29)正式批準發布了全球首個自動駕駛系統全球技術法規,2026年底開始自動駕駛可以合法進入全球市場。
但通道打開不等于路好走,國內練好的智駕系統到了海外,如何適應當地路況和規則?訓練數據從哪來?能否跟上適配節奏?本文將結合小鵬相關團隊發布的三篇論文,分析其如何將智駕系統帶向歐洲。
01.
歐洲“考場”難在哪?智駕規則得先“翻篇”
中國車企的智駕系統在歐洲,首先要面對三道坎。
第一道坎:路況、標識、規則完全不同。
一般來說,歐洲城市多窄巷、老街,車道寬度遠小于國內,道路標識體系也大不相同——限速牌、方向指示、路權標志的樣式和顏色與國內差異明顯。
![]()
▲歐洲道路通行權的優先級層級金字塔
更關鍵的是交通參與者行為的差異,國內許多路口依賴駕駛員相互觀察、互相禮讓來通行,但歐洲實行嚴格的優先路權規則,主干道車輛擁有絕對通行權,可以全速通過,沒有義務為輔路來車減速,輔路車輛必須停車讓行,如果輔路車輛搶行導致事故,輔路車輛往往要負全責。
![]()
▲如圖駕校車輛先行,因為它行駛在有優先通行標識的道路上,然后騎自行車的人才能通行
這些差異意味著,在國內訓練好的智駕模型,到了歐洲可能需要重寫決策邏輯。
第二道坎:法規限制嚴格,大規模實地路測困難重重。
歐洲各國的路測法規嚴格且各不相同,審批流程長、窗口期短,一支路測車隊在當地跑一天的成本可能是國內的數倍。
更關鍵的是,很多需要訓練的危險場景——比如前車突然掉落貨物、窄巷中突然竄出的自行車——在真實道路上本就罕見,想專門去采集幾乎不可能。車企每進一個新市場,都要從零建立路測隊伍,落地節奏被嚴重拖慢。
第三道坎:傳統仿真幫不上忙。
小鵬技術團隊在論文中指出,行業目前大量采用基于3D高斯濺射(3DGS)的傳統仿 真技術,本質上是“復現”采集過的場景——攝像頭掃過一條路,就能在仿真里重建出來。
但問題是,它缺乏對物理世界的真正理解,一旦被測的自動駕駛系統做出了與當初采集時不同的動作(例如為避讓障礙物而緊急變道),這個動作就超出了3DGS的重建“知識范圍”,系統就無法對后續場景進行有效生成與評估,換句話說,傳統仿真無法“想象”出未曾觀測過的視角。
這三道坎歸結起來是同一個問題:智駕系統到了歐洲市場,可能缺少足夠豐富的場景數據來訓練和驗證。
小鵬的解法是構建了一套全新技術體系,包含三項核心技術:X-World負責生成海量仿真場景,X-Cache讓生成速度足夠快,TuringViT則確保系統能“看清”歐洲復雜的道路細節。
三環相扣,為小鵬智駕出海打下了技術底座。
02.
仿真場景“隨心配”
AI輔助路測“跑遍”歐洲大街小巷
X-World是小鵬推出的可控多視角生成式世界模型,可以把它理解為“現實世界模擬器”。
![]()
▲X-World模型架構
它要做的事情很簡單:給定當前路況和駕駛操作,在給定動作條件下生成符合物理約束的未來視頻,同時在持續生成過程中保持良好的可控性與穩定性。
對出海場景來說,這意味著只需要輸入少量歐洲當地的真實駕駛畫面,X-World就能“舉一反三”,自動生成大量符合歐洲視覺風格和交通規則的仿真場景,大幅減少對當地大規模路測的依賴。
它怎么做到精準可控?
歐洲和中國的路況差異很大,X-World必須能按需生成特定場景。為此,它設計了四個維度的控制接口:
(1)控制自車動作:通過速度、轉向曲率等參數控制車輛軌跡,適配不同國家的駕駛習慣,比如左舵/右舵、不同限速規則。
(2)控制動態物體:指定車輛、行人的位置和移動軌跡,模擬不同國家的交通參與者行為,比如歐洲的優先路權規則、東南亞的摩托車混行。
(3)控制靜態元素:指定車道線、道路邊界、交通標志的樣式和位置,直接匹配當地的道路標準。
(4)控制全局外觀:調整天氣、時間、場景整體風格,適配海外當地的視覺風格。
這套能力相當于給研發團隊提供了一個“全球路況編輯器”,無需去當地采集海量數據,就能針對性地生成各類場景。
多攝像頭畫面會不會“穿幫”?
根據官方論文,智駕系統依賴多個攝像頭同時工作,而仿真生成時多攝像頭生成畫面,往往會出現同一個物體在不同視角里位置、形態對不上的“穿幫”問題。
X-World的解決辦法是在模型結構上強制約束:靠視角-時間自注意力機制,保證跨視角的一致性。
簡單說,模型生成畫面時,多個攝像頭不是各自獨立計算,而是會互相校準,保證同一個物體在所有畫面里的位置、大小、姿態完全統一;前后幀之間,上一幀的信息會傳遞給下一幀,保證視頻動起來連續平滑。
放到出海場景里,無論是狹窄的古城街道、寬闊的高速,還是人車混行的城市道路,多視角畫面的空間一致性都能得到保障,讓第二代VLA基于準確的多視角畫面做決策。
這套模型實際效果如何?
目前,X-World已經在小鵬汽車自動駕駛的閉環仿真測試、在線強化學習、數據生成等環節起到支撐作用。
閉環仿真測試方面,依托X-World,小鵬構建面向第二代VLA的閉環評估引擎,目前,小鵬自動駕駛仿真場景從一年前的3萬增加到50多萬個,每日仿真測試里程等效于3000萬公里實車測試。
![]()
▲基于世界模型的仿真測試
在線強化學習方面,X-World可充當在線強化學習的仿真平臺,便于智駕針對自動駕駛中的難點場景進行專項優化,例如重點優化模型在路口遭遇行人“鬼探頭”、擁堵路段變道猶豫等場景的表現。
數據生成方面,X-World可實現大規模數據生成與增強。X-World作為生成式數據工廠,既可以生成缺失的長尾場景數據,也能生成海外數據用于模型訓練,加速小鵬自動駕駛全球化落地進程。
03.
仿真太慢等不起?AI學會“抄近道”
場景生成能力有了,下一個問題是效率。
智駕系統要熟悉各國路況、測遍各類長尾場景,背后是海量的虛擬測試里程,如果畫面生成速度跟不上,同樣時間內能覆蓋的地區、能跑完的場景就很有限,整體適配的節奏也會被拖慢。
小鵬團隊為此打造了X-Cache方案——官方定義為“面向少步自回歸世界模型的跨段塊級緩存”。
![]()
▲X-Cache總體架構
這個解決思路很巧妙,它發現了一個規律:相鄰兩段畫面的中間計算結果高度相似——就像你看視頻時,前后兩幀畫面差別很小,那么能否復用上一段已經算好的結果,避免重復計算?
X-Cache正是這樣做的,它靠復用計算結果提速,在幾乎不影響畫質的前提下,復用相鄰畫面的中間計算結果,減少約七成的重復計算,對模型核心部分實現最高約2.7倍的推理加速。
![]()
▲X-Cache推理加速可提升2.7倍
畫質犧牲大嗎?
論文數據顯示,結構相似度(SSIM)在0.999以上(滿分1),學習感知圖像塊差異(LPIPS)在萬分之四以下,畫質損失處于人眼幾乎不可感知的級別。
這意味著仿真畫面與真實場景的差異足夠小,對應到出海場景中,X-Cache可加快多地區智駕場景的測試與訓練進度;同時極小的畫質損失,也讓仿真結果更貼近真實畫面,降低仿真與真實場景的差異。
![]()
▲X-Cache結構相似度在0.999以上
這個方案通用性如何?
論文指出,X-Cache不是X-World專屬,所有同類型的模型都可以適配。智駕業務需要拓展更多區域市場時,這套加速能力可以直接復用。
04.
智駕來到歐洲 “眼力”也是考驗
X-World解決仿真素材供給,X-Cache解決生成效率,整套智駕體系出海還有更底層的感知技術需要提升。
VLA“看懂”畫面的能力來自視覺編碼器——可以簡單理解為一個把畫面變成模型可理解信號的“翻譯官”。
歐洲場景對這位“翻譯官”提出了苛刻要求:歐洲路牌文字密集、字體小,攝像頭必須看得清細節;同時處理多路高清畫面,算力消耗巨大。
行業主流的開源方案普遍面臨算力吃緊、數據效率低、場景適配難的問題。
小鵬推出的視覺Transformer基礎模型TuringViT正是為此設計,它具備三大優勢。
![]()
▲TuringViT 的塊架構和模型配置
第一,算力效率高。該方案采用獨特的混合注意力結構,在高分辨率下推理速度達到主流方案的2~3倍,分辨率越高優勢越明顯。
![]()
▲三款視覺模型推理延遲對比
![]()
▲不同視覺模型所需訓練數據和精度對比
第三,原生支持動態分辨率。TuringViT采用了一套全新訓練范式,不同尺寸、不同長寬比的圖像可以直接輸入模型處理。
這對于智能駕駛場景尤其關鍵——多路環視攝像頭傳來的畫面分辨率各不相同,模型不需要任何適配就能直接處理,輸出低延遲、高質量的視覺特征給下游決策模塊。
![]()
▲數據清洗流水線
簡單說,TuringViT讓VLA在歐洲復雜路況下“看得清、看得全、看得快”。
小鵬通用智能中心負責人劉先明表示,TuringViT的特性可以支撐自動駕駛、座艙交互、機器人,也為從中國到全球的智能化出海打下基礎。
![]()
▲劉先明發文稱TuringViT助推智能化出海
05.
結語:把中國智駕“搬”到歐洲
小鵬搭好了三塊跳板
從X-World到X-Cache再到TuringViT,小鵬解決的不是某一個技術細節,而是智駕出海最核心的難題——讓智駕在海外市場,也能提前“練”好。
具體怎么練?
第一塊跳板是數據。X-World像一臺“世界模擬器”——給它歐洲當地的真實畫面和駕駛指令,它就能批量生成仿真場景。
這意味著不需要把每條歐洲街道都跑一遍,只需輸入少量當地真實畫面,X-World就能自動生成大量符合當地交通特征的仿真場景,讓智駕系統有足夠的素材可練。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.