2023年的CVPR會議上,特斯拉自動駕駛軟件總監Ashok Elluswamy用15分鐘介紹一個叫通用世界模型的東西。
他提出,僅憑車道線檢測、障礙物識別等離散感知模塊,無法構建對駕駛場景的?時序一致性理解?。
唯有通過神經網絡從海量駕駛視頻中學習以過去預測未來的能力,才能生成連貫、物理一致的場景演化,支撐安全決策。
這個模型可以在云端生成用于訓練和仿真的駕駛場景,也可以壓縮部署到車端,這一技術也成為大家熟知的世界模型。
那世界模型就是特斯拉提出的嗎?其實不然,世界模型的源頭,要比2023年早得多。
01
從認知科學到強化學習
1943年,蘇格蘭心理學家肯尼斯·克雷克出版了一本不到兩百頁的小冊子《解釋的本質》。
他在書中提出一個假說,人在對現實作出反應之前,會先在大腦中構建一個小規模的現實模型,用來模擬可能發生的過程,再據此選擇行動。
這個理論后來被稱為心智模型。彼時數字計算機尚未誕生,但克雷克的假說已經觸及了智能的核心,真正的智能不是被動反應,而是主動推演。

圖片源自:網絡
這個想法沉寂了近半個世紀,直到被人工智能研究者重新發現。
上世紀90年代,強化學習領域的先驅理查德·薩頓提出了Dyna架構,在強化學習領域首次將世界模型確立為智能體內部的一項基礎能力。
智能體在學習行動策略的同時,也要學習如果我采取某個動作,世界會如何變化。
1990年,于爾根·施密德胡貝爾發表了一份技術報告,描述了一個基于兩個循環神經網絡的強化學習和規劃系統,他把這兩個網絡分別叫作控制器和世界模型。
世界模型負責學習控制器發出動作之后會產生什么結果;控制器則利用世界模型進行心理實驗,在內部推演不同行動序列的后果,再選擇最優的那一個。
這是世界模型一詞在機器學習領域首次正式亮相。
02
從游戲到駕駛
真正讓世界模型成為一個獨立研究方向的,是2018年的一篇論文。
那一年,谷歌大腦的大衛·哈和瑞士AI實驗室IDSIA的于爾根·施密德胡貝爾在神經信息處理系統大會上發表了《Recurrent World Models Facilitate Policy Evolution》,他們用三個組件搭建了一個結構清晰的框架。
變分自編碼器負責將高維視覺觀測壓縮成低維表征;混合密度循環神經網絡在表征空間中預測未來的序列變化;輕量控制器則根據這些預測選擇行動。
整個系統最特別的地方在于,智能體完全在一個由自身內部世界模型生成的想象環境中訓練策略,然后再把這個策略遷移回真實環境。
這項研究是在賽車游戲環境中完成的。
智能體在虛擬賽道上通過想象學會了駕駛,并能在真實的賽車游戲中跑出不錯的成績。

圖片源自:網絡
這也是世界模型第一次在具體任務中被驗證有效,它證明了一件事,智能體不需要在真實環境中反復試錯,也能學會復雜的行為。
這篇論文及其提出的想象中學習范式,后來被DeepMind的Dreamer系列模型所繼承和發展。
Dreamer系列模型同樣讓智能體在世界模型內部通過想象進行行為學習,從而避免了大量真實環境的試錯。
Dreamer的測試環境從游戲擴展到了連續控制任務,但當時離現實世界的復雜場景還有距離。
2022年,圖靈獎得主楊立昆發表了一篇六十二頁的立場論文《通往自主機器智能的道路》。他將具備預測能力的世界模型置于其構建自主智能架構的核心位置。
楊立昆認為,構造自主智能需要預測世界模型,而世界模型必須能夠執行多模態預測。
這篇論文讓世界模型從強化學習社區的一個技術概念,變成了通用人工智能研究的主流議題。
03
世界模型進入自動駕駛
2023年是世界模型進入自動駕駛行業的轉折點。
除了特斯拉在CVPR上的演講,英國的自動駕駛公司Wayve也在同一年發布了GAIA-1。
GAIA-1是一個生成式世界模型,可以通過視頻、文本和動作輸入生成逼真的駕駛場景。
它擁有九十億個參數,訓練數據來自Wayve在英國城市道路上的真實駕駛數據。
模型不僅能生成視頻,還能對自車行為和場景特征進行精細控制。
2024年,蔚來在創新科技日上發布了中國首個智能駕駛世界模型NWM。

圖片源自:網絡
NWM是一個多元自回歸生成模型,能在100毫秒內推演出216種可能發生的場景,并從中尋找最優路徑。
它還可以基于三秒鐘的駕駛視頻,生成一百二十秒的想象視頻。
2026年2月,Waymo宣布推出基于谷歌DeepMind的Genie 3構建的Waymo世界模型。
Genie 3是DeepMind最先進的通用世界模型,能夠生成逼真且可交互的三維環境。
Waymo沒有選擇從零開始,而是直接在Genie 3的基礎上加入自動駕駛專屬的傳感器數據,再針對仿真與規劃進行微調。
這種做法很像大語言模型的發展路徑,先有一個通用的基礎模型,再通過領域數據把它變成專用模型。
04
最后的話
從1943年克雷克的心智模型到2026年Waymo的駕駛世界模型,這條脈絡跨越了八十多年,但每一次關鍵的躍遷都來自外部力量的注入。
認知科學提供了思想原型;強化學習提供了技術框架;深度學習的爆發提供了實現工具;而大語言模型的成功則為自動駕駛指明了基礎模型加領域微調的路徑。
然而技術演進的速度往往快于我們對它的理解。當前自動駕駛行業對世界模型的熱衷,多少帶有幾分期待它能解決所有問題的意味。

圖片源自:網絡
但生成式世界模型容易出現物理交互幻覺,生成的場景可能違反基本的物理規則。
此外,模型的視覺指標雖在持續進步,但這是否能讓駕駛安全有所提升,仍是一個懸而未決的問題。
當前主流的評測體系無法充分刻畫自動駕駛所需的魯棒性維度,這些問題不是靠更大規模的訓練數據就能解決的。
智駕最前沿以為,世界模型真正的價值,可能不在于它能生成多么逼真的視頻,而在于它能否讓自動駕駛系統擁有像人類一樣的內心推演能力,在做出每一個駕駛決策之前,先在腦海里預演一遍后果。
這個目標其實還很遠,但方向已經清晰了。
#自動駕駛 #世界模型 #自動駕駛世界模型