最近,比亞迪汽車新技術研究院發布了一篇名為《HyWorldVLA》的學術論文,這是比亞迪首次在自動駕駛基礎模型領域的公開亮相。

圖片源自:比亞迪論文
這篇論文中提出了混合世界模型的概念,而這個混合模型,正是建立在像素級世界模型和隱空間世界模型之上。
這兩種世界模型到底是什么?它們各自有什么作用?比亞迪為什么要做混合世界模型?
01
什么是像素級世界模型?
像素級世界模型,顧名思義,就是讓AI像放電影一樣,一幀一幀地預測未來幾秒鐘的路況畫面。
比如前方有一輛車正在變道,模型會精確預測出這輛車在接下來每一幀畫面中的位置、形狀和運動軌跡。

在右轉過程中,盡管前視攝像頭輸入中未見車道標線,模型仍能可靠地預測未來的車道標線
圖片源自:比亞迪論文
它的作用是為自動駕駛提供密集的空間和動態訓練約束。
什么意思呢?就是模型必須真正理解場景的幾何布局和物體運動關系,才能準確預測出下一幀是什么。
這種高精度的預測能讓AI保留車道線走向、車輛運動軌跡、遮擋關系等大量細節信息,這對于安全駕駛來說是至關重要的。
但也正因為是逐幀預測畫面,像素級世界模型的短板也同樣突出。
像素級世界模型的計算成本極高,每一幀畫面都要精細計算,對算力的消耗巨大。
此外,現實世界中的雨、霧、傳感器臟污、光照突然變化等外部干擾,會在預測過程中被不斷放大,最終會讓預測結果嚴重跑偏。
這就像戴著沾了水霧的眼鏡看路,會越看越模糊。
02
什么是隱空間世界模型?
要理解隱空間世界模型,得先搞清楚隱空間是什么。
所謂隱空間,說白了就是將完整的視頻素材壓縮一下,丟掉像素級的畫面細節,只抽象記錄路上有什么、它們在怎么動等信息。
這就好比把一段行車記錄儀的視頻,濃縮成一篇文字筆記。
隱空間世界模型就是在這個壓縮后的抽象空間里做預測,它不關心每一幀畫面長什么樣,只關心抽象層面的狀態變化。
比如對向車道來了一輛車,隱空間模型不會去精細描繪這輛車的顏色和型號,只會抓住有一輛車正以什么速度、什么方向朝你駛來這樣的信息。
隱空間模型的優勢體現在兩個方面。
一個是計算效率高,由于是在緊湊的特征空間里做預測,會比在像素空間里省力。
還有就是抗干擾能力強,因為跳過了具體的像素畫面,雨霧、臟污這些視覺噪聲對它的影響微乎其微。

視覺干擾示意圖,圖片源自:比亞迪論文
但隱空間模型的問題也很明顯。
如果只靠抽象描述來訓練,缺少足夠的視覺監督信號,模型學到的可能只是空洞的統計規律,并且會丟掉車道線在哪、前車是加速還是減速這類對駕駛至關重要的細節信息。
畢竟純靠抽象想象畫面,終究不如親眼所見那么真切。
03
比亞迪的混合世界模型做了什么?
像素級模型看得清但怕干擾、算得慢;隱空間模型跑得快、抗干擾但看不清細節。
兩條路各有所長,也各有各的問題。

世界模型范式的對比。(a)像素的世界模型;(b)隱空間世界模型;(c)混合世界模型
圖片源自:比亞迪論文
比亞迪的HyWorldVLA給出了一個解法,即預訓練階段讓兩條路結合,實際推理時只用一條。
在預訓練階段,像素級世界模型和隱空間世界模型同時工作。
隱空間的抽象分析可以幫像素級模型穩住方向,即不讓雨霧、光照這些外部干擾把畫面帶偏。
像素級的高精度畫面又可以反過來幫隱空間模型校準精度,以確保抽象表征沒有丟失關鍵細節。
兩個信號一緊一松、一密一疏,共同將模型訓練到既富含信息又不過度敏感。
而到了真正上路推理的時候,模型只使用隱空間模型來做預測。這樣既保證了預測的準確性(因為訓練階段已經被像素級模型調教過),又保證了實際運行的效率(因為只用輕量的隱空間模型)。

HyWorldVLA的整體架構,圖片源自:比亞迪論文
這套方案在自動駕駛公開測試平臺NAVSIM上跑出了亮眼成績,NAVSIM v1綜合得分90.59分,刷新了公開榜單的最好成績;在指標更全面的NAVSIM v2上也拿到了89.71分。
測試采用的綜合指標EPDMS不是簡單地比誰看得準,而是綜合評估車輛是否會發生碰撞、是否保持在可行駛區域、是否保持安全距離、能否完成駕駛目標、行駛是否平順舒適。
04
比亞迪做這件事,到底有什么意義?
其實很長一段時間,外界對比亞迪的刻板印象一直是重制造、輕研發。
這篇論文由比亞迪汽車新技術研究院獨立完成,證明比亞迪不僅在做AI研發,還具備從0到1的基礎模型研發能力。
這篇論文其實也是比亞迪為L3級自動駕駛做的關鍵技術儲備。
就在論文發布前不久,比亞迪推出了自研的4nm高階智駕芯片璇璣A3,單顆算力約700TOPS。從自研算法到自研芯片,比亞迪正在構建完整的智駕技術閉環。
此外,世界模型一直是自動駕駛的前沿方向,其可以讓AI從識別道路走向理解世界。
這也是特斯拉FSD、Waymo、英偉達等頂尖玩家正在探索的方向,比亞迪選擇在這個時間點切入,說明它不想在下一階段的智駕競賽中掉隊。
05
最后的話
先前在智駕最前沿的評論區有人提及了這篇論文,小編也花了些時間學習了這篇論文。
坦白說,這篇論文確實讓人對比亞迪刮目相看。
過去提到比亞迪的智能化,大家更多想到的是供應鏈整合和規?;涞?。

圖片源自:網絡
但這篇HyWorldVLA至少在技術研發層面,證明了比亞迪有能力站在自動駕駛技術的前沿。
不過這只是一篇論文,還是要冷靜看待,論文成果和實際量產之間必然還有很長的路要走。
在仿真測試里拿高分,不等于在真實道路上就能開得好。真實道路的復雜程度和極端場景都不是仿真平臺能完全模擬的。
但話說回來,比亞迪手里有一張其他車企沒有的王牌,那就是巨大的銷量帶來的海量真實駕駛數據。
對于自動駕駛大模型來說,數據是訓練世界模型最好的燃料,比亞迪的保有量優勢一旦被有效激活,將成為它在智駕賽道上的護城河。
這篇HyWorldVLA論文,大概就是比亞迪往技術魚池里放的一條魚苗,至于這條魚能不能長成巨鯨,還是拭目以待吧。
#自動駕駛 #HyWorldVLA #比亞迪