ADS 5發布前夕,華為與上海交通大學合作,發了這樣一篇成果:
一個框架,2B模型,統一VLA和世界模型。
這意味著華為正在探索新的技術方向。
華為車BU CEO靳玉志此前曾表示,VLA是“取巧”方案,華為選擇的WA(世界行為模型)路線才能實現自動駕駛。
然而就在ADS 5即將上線之際,華為參與的這項工作,嘗試把VLA和世界模型融合了。這條路線與很多玩家不謀而合,比如小米和理想。

作者團隊認為,VLA和世界模型這兩大主流范式,各有各的短板。
VLA擅長推理,一看路就知道現在該怎么開,但問題是,VLA無法預測執行決策后,下一秒周圍環境會怎么變。理解當下能力強,預測未來不行。
而世界模型預測能力不錯,它能根據眼前的路況,推測出下一秒的環境變化,但也有問題,它只負責預測,不對預測結果進行反思推理,確定結果是否安全。
因此這篇論文的關鍵,不是單獨增強VLA或世界模型的能力,而是把“預測未來”和“反思未來”形成閉環。

為了將兩者優勢融合,團隊提出了VLA-World,在執行駕駛任務時,會先進行短期預測,生成對未來0.5秒的預測幀,然后對自己生成的這個未來幀,進行反思,預判其中的風險,最終輸出駕駛決策,以及未來3秒的預測軌跡。
為了打通從感知到預測,再到反思的鏈路,團隊設計了三階段訓練流程。
首先,團隊選擇Qwen2-VL-2B作為基模,然后進行多視圖未來幀預測預訓練,并強制不同視角生成圖片的一致性,激活模型的視覺生成能力。
第二步,對模型進行監督微調,利用nuScenes-GR-20K數據集,進行多任務混合訓練,把駕駛概念注入模型。
最后,采用GRPO算法對模型進行強化學習,增強模型的高級推理和決策能力。其中,獎勵函數由五個部分組成:
格式獎勵:確保輸出結構規范
短期預測獎勵:鼓勵準確的短期軌跡預測
視覺約束獎勵:確保生成的視覺token數量正確且合理
動作獎勵:基于F1分數評估高層動作決策
軌跡獎勵:確保軌跡精度與運動學一致性

通過上述方法,模型同時獲得了預測想象和反思推理能力。除此之外,還驗證了自動駕駛模型的Scaling Law。
團隊發現,將基模換成7B大小后,L2誤差即模型預測值和真實值的差距,明顯降低。

不過,這項工作還有一些潛在問題,比如生成的未來幀分辨率只有128X192,不太清晰,可能會損失一些場景信息,影響模型決策。
另外,目前模型的推理鏈條比較長,可能會影響駕駛任務的實時性。
最后簡單介紹一下作者團隊,這篇論文由上海交通大學和華為合作完成。第一作者單位是上海交通大學人工智能研究院,主要作者Wang Guoqing 、 Ren Xiangxuan和Tang Pin都是上交大的博士。
通訊作者馬超是國家優青、上海交通大學教授、博導,谷歌學術被引次數超1.4萬次,長期和華為合作,研究成果此前落地了華為達芬奇芯片和輔助駕駛MDC平臺。

此次他們和華為諾亞方舟研究室的Zhao Guodongfang、Feng Bailan合作,共同提出了VLA-World。
這項成果押注的方向,最近隱隱成為了行業趨勢。
比如不久前在英偉達GTC上,理想VLA負責人詹錕就在演講中介紹了MindVLA-o1,通過引入預測式的隱世界模型,讓模型能夠預判未來幾秒的場景變化,做出更好的決策。

幾乎同時,小米XLA認知大模型負責人陳龍也透露,小米最新的XLA將VLA和世界模型融合了,通過潛空間推理,推演當前場景的變化。

主機廠在模型層面實踐,推動VLA和世界模型融合。供應商也從更寬廣的行業視角,見證了這一趨勢。
數據基建玩家光輪智能的創始人謝晨,最近在采訪中透露,很多客戶正在把世界模型作為基座模型,提升VLA的能力。
兩條路線的評價基準,也正在融合。比如有一家叫ENACT的公司,就基于VLA的評價體系,打造了世界模型的評價體系。
“如果兩件事的評判標準越來越接近,那這兩件事,將來可能就會是一回事”
論文傳送門:
https://arxiv.org/pdf/2604.09059v1
參考資料:
https://valser.org/article-729-1.html
https://www.bilibili.com/video/BV1sLX9B4EqD
https://www.bilibili.com/video/BV148w9zJEyh
https://www.21jingji.com/article/20260413/herald/1b037cb81459b85b426769d75c3bcf35.html
— 聯系作者 —

— 完 —
【智能車參考】原創內容,未經賬號授權,禁止隨意轉載。
點這里??關注我,記得標星,么么噠~