2026年過半,自動駕駛行業(yè)最熱鬧的話題,莫過于VLA和世界模型這兩條技術(shù)路線的爭論。
從2025年端到端大模型全面上車,到2026年3月英偉達GTC大會上兩條路線的分歧被公開擺上臺面,再到CVPR 2026上各方開始討論融合的可能。
這場爭論的烈度、持續(xù)時間和影響范圍,已經(jīng)超出了單純的技術(shù)分歧,成為整個行業(yè)思考自動駕駛的下一個形態(tài)到底是什么的一個切口。
01
兩種智能,兩條邏輯
其實想要理解這場爭論到底是在爭什么之前,我們得先搞清楚VLA和世界模型到底能做些什么。
VLA的全稱是視覺-語言-動作模型,它是在視覺感知和動作執(zhí)行之間加入了一個關(guān)鍵中間層,即語言。
這個語言不是讓車開口說話,而是用大語言模型的推理能力來做駕駛決策。
VLA的工作流程是,先通過視覺感知識別道路狀況,再由語言模型分析當前場景的語義含義,最終輸出對應(yīng)的駕駛操作。
小鵬通用智能中心負責人劉先明就有一個精煉的總結(jié),VLA學(xué)的是人在這個世界中會怎么做。
目前已經(jīng)有OpenDriveVLA等模型在此基礎(chǔ)上進行探索,通過2D和3D實例感知、車輛狀態(tài)和語言指令等多模態(tài)輸入來生成駕駛動作。
官方數(shù)據(jù)顯示,小鵬第二代VLA也將決策延遲壓降至80毫秒,搭載該模型的車型首周每天開啟VLA的比例達到97.43%,月度活躍率96.97%,智駕里程占比突破50%。

圖片源自:網(wǎng)絡(luò)
世界模型的邏輯則完全不同,它不關(guān)心人怎么做,而是關(guān)心這個世界本身會怎么變化。
世界模型的核心能力是預(yù)測,這里的預(yù)測不是預(yù)測下一秒的圖像長什么樣,而是預(yù)測物理世界在車輛執(zhí)行某個動作之后會如何演化。
如系統(tǒng)看到路邊有一個彈跳的皮球,世界模型會基于對物理因果關(guān)系的理解,預(yù)判皮球后方大概率會跑出一個孩子。
目前行業(yè)中已經(jīng)有很多世界模型在自動駕駛上實際落地的案例。
Waymo在CVPR 2026上曝光了自研的世界模型,其基于Google DeepMind的Genie 3架構(gòu)構(gòu)建,能夠預(yù)測包括其他車輛和行人的行為意圖在內(nèi)的道路場景動態(tài)演化。
從這兩者在自動駕駛中完成的任務(wù)來看,根本差異在于處理世界的方式。
VLA用語言模型的推理能力來描述世界,世界模型則直接在狀態(tài)空間中模擬世界的物理演化,這兩個一個是理解后行動,一個是預(yù)測后行動。
華為車BU CEO靳玉志曾表示VLA是取巧方案,認為云端大模型蒸餾成車端小模型的做法在駕駛場景中隱患太大。
吉利汽車集團CTO李傳海、Momenta CEO曹旭東等人也對VLA提出過質(zhì)疑。
之所以會質(zhì)疑VLA,是因為駕駛不是做閱讀理解,語言模型一維的文本Token無法準確描述三維物理世界。
即VLA理解的是場景語義,但語義理解和物理因果是兩碼事。一個模型能看懂前方有行人這個語義,不等于它真正理解行人下一秒可能橫穿這個物理規(guī)律。
但VLA陣營也有自己的看法,理想汽車基座模型負責人詹錕在GTC 2026上就提出了自己的觀點,當視覺、語言和行動統(tǒng)一到一個模型中時,它已不再只是自動駕駛模型,而是在逐漸演化為面向物理世界的通用智能體。
02
站隊與轉(zhuǎn)向
2026年年初,VLA和世界模型之間的爭論是非常明顯的。
華為是世界模型路線最堅定的代表,2025年ADS 4發(fā)布時,華為就提出了WEWA世界模型架構(gòu),到2026年4月ADS 5推出,WEWA已升級到2.0版本,這次升級的核心在云端和車端兩個層面。

圖片源自:網(wǎng)絡(luò)
云端世界引擎引入了多智能體交互機制。
過去的訓(xùn)練好比讓一個司機在空曠道路上獨自練習,現(xiàn)在則是讓成百上千個AI駕駛員同時在虛擬環(huán)境里行駛,每個都有自己的行為邏輯,訓(xùn)練強度和效率因此提升了10倍。
車端的世界行為模型則新增了安全風險場技術(shù),從動能、勢能和行為三個維度實時評估風險分布,生成動態(tài)風險熱力圖,華為稱可將碰撞風險降低50%。
截至2026年4月,華為乾崑智駕累計輔助駕駛里程超過58億公里,云端算力達45 EFLOPS。
到2026年6月,累計里程已更新至128.09億公里,搭載量突破190萬臺。
Momenta在2026年4月也發(fā)布了R7強化學(xué)習世界模型,其采用三層架構(gòu)。
世界模型預(yù)訓(xùn)練層壓縮物理規(guī)律;仿真層推演長尾場景;強化學(xué)習層優(yōu)化自主決策。

圖片源自:網(wǎng)絡(luò)
吉利也在CES 2026上發(fā)布了WAM世界行為模型,構(gòu)建了統(tǒng)一的整車大腦。
VLA路線也有進展,英國Wayve公司2023年發(fā)布了LINGO-1,這是能用自然語言解說駕駛行為的VLA模型,但當時還屬于開環(huán)研究系統(tǒng),沒有真正用于控車。
2024年4月,Wayve推出了LINGO-2,實現(xiàn)了從感知到語言解釋再到動作輸出的閉環(huán)。
元戎啟行也于2025年開始布局VLA,2026年在IAA車展上展示了基于VLA的無圖智駕方案。
其CEO周光明確說這套方案是用VLA模型替代高精地圖的語義理解功能。
理想和小鵬雖然也對外宣稱走VLA路線,但實際方案中已經(jīng)融入了世界模型的能力,這一點后文會展開聊。
03
從二選一到都要做
到了2026年年中,VLA和世界模型之間的邊界開始變得模糊。
2025年底特斯拉FSD V14將xAI的Grok大模型能力整合進導(dǎo)航和決策系統(tǒng),模型參數(shù)量比V13提升了4.5到10倍。
Grok不是讓座艙變得能聊天,而是讓FSD的決策系統(tǒng)多了一層語言理解能力。
與此同時,特斯拉在底層技術(shù)上也運用了世界模型相關(guān)專利來生成訓(xùn)練數(shù)據(jù),這也讓很多智駕公司直觀地看到,VLA和世界模型并不是二選一,而是兩者可以一起做。

圖片源自:網(wǎng)絡(luò)
CVPR 2026首次設(shè)立的具身智能基座模型部署專題研討會上,特斯拉、Waymo、小鵬三家同臺,核心議題已經(jīng)轉(zhuǎn)向了基座模型的構(gòu)建。
黑芝麻智能CEO單記章也在2026智能電動汽車發(fā)展高層論壇上提出觀點,VLA加上世界模型,是高階智能駕駛未來最有可能的技術(shù)路線。
小鵬劉先明在CVPR 2026上就明確表示,VLA和世界模型并非競爭關(guān)系。
在小鵬的基座模型架構(gòu)中,第二代VLA從人類駕駛行為中學(xué)習如何行動,世界模型則通過對未來狀態(tài)的預(yù)測學(xué)習行動之后世界會如何變化,兩者共同構(gòu)成物理世界基座模型。
小鵬的VLA+世界模型方案在實際應(yīng)用中已展現(xiàn)出效果。
2026年7月,搭載第二代VLA模型的小鵬MONA L03在德國慕尼黑完成了本地化驗收測試,在未經(jīng)任何歐洲路測數(shù)據(jù)訓(xùn)練的條件下,自主完成了環(huán)島通行、有軌電車避讓和窄路會車。
官方披露,這套方案可減少約70%的海外實地數(shù)據(jù)采集成本,將單車市場適配周期從18個月壓縮至6到8個月。
理想也在做同樣的事,理想在GTC 2026上發(fā)布了MindVLA-o1,MindVLA-o1在語言模型承擔語義理解的基礎(chǔ)上,引入了預(yù)測式隱世界模型。
該模型訓(xùn)練分三個階段,先用海量視頻數(shù)據(jù)預(yù)訓(xùn)練隱世界詞元,再在模型中持續(xù)進行世界模型的推演,最后將世界模型、多模態(tài)推理能力和駕駛行為進行聯(lián)合訓(xùn)練。

圖片源自:網(wǎng)絡(luò)
理想汽車也有四篇世界模型方向論文入選CVPR 2026,分別從深度估計、三維重建、交通規(guī)則認知評估和安全風險預(yù)判四個層面展開。
之所以VLA和世界模型會走向融合,是因為VLA擅長理解當下的語義,但不擅長預(yù)測未來;世界模型擅長預(yù)測物理演化,但缺乏高級語義理解。
兩者結(jié)合,一個可以負責現(xiàn)在該怎么做,一個可以負責這么做之后會發(fā)生什么。
04
一點看法
回到一開始聊的那個問題,VLA和世界模型到底在爭什么?
表面上看,大家爭的是自動駕駛中應(yīng)該用語言模型做推理,還是用物理模型做預(yù)測,其實這兩條路線背后,反映出的是兩種完全不同的理念。
VLA認為,理解就是智能,只要模型能看懂場景、理解語義、調(diào)用常識,就能做出正確的駕駛決策,這個思路是將駕駛問題看作一個認知問題。
世界模型則認為,預(yù)測就是智能,只要模型能準確預(yù)判未來幾秒世界的演化,就能選出最優(yōu)的駕駛策略,這個思路其實是把駕駛問題看作一個物理問題。
這兩種假設(shè)都有道理,但也都有漏洞。
VLA面臨的問題跟大語言模型一樣,即會說人話不等于真的理解。
一個模型能準確說出前方有行人,我應(yīng)該減速,但這個輸出可能只是訓(xùn)練數(shù)據(jù)里見過的模式,模型本身并不真的知道減速意味著什么。
世界模型其實也存在問題,物理預(yù)測能力再強,也解決不了價值判斷的問題。
路邊有個球滾出來,世界模型可以精準預(yù)判后面會跟出一個孩子,但如果那只是個被風吹動的空球呢?要不要剎車?
這個判斷需要的是理解,而理解恰好不是世界模型的長項。

圖片源自:網(wǎng)絡(luò)
這中間其實還有一個關(guān)鍵問題,語言模型的Token和物理世界的狀態(tài),本質(zhì)上是兩種東西。
文本Token是離散的、有明確語義邊界的,物理世界是連續(xù)的、高維的。將連續(xù)的世界壓縮成一維的語言Token再去做推理,必然會丟失信息。
反過來,世界模型雖然保持了物理狀態(tài)的連續(xù)性,但它缺少一個語義層。
自動駕駛不是在一個真空環(huán)境里做物理推演,它需要在真實的社會規(guī)則下運行。
禮讓行人、救護車優(yōu)先這些規(guī)則不是物理規(guī)律,是社會約定,世界模型如果只有物理預(yù)測沒有語義理解,在這些場景下就會顯得很笨。
所以這兩條路線爭的其實是誰抓住了駕駛智能的本質(zhì),VLA認為是理解,世界模型認為是預(yù)測。
但真實駕駛中,理解和預(yù)測是纏繞在一起的,根本分不開,這也是為什么到了2026年下半年,兩者融合的方案被提了出來。
回頭看這場爭論,輸贏根本不重要,它反而讓自動駕駛行業(yè)認清了兩個問題,即理解要解決,預(yù)測也要解決,而且得放在同一個模型里解決。
融合并不是妥協(xié),而是兩條路都走到頭之后,唯一還能走的路。