
因為公眾號平臺更改了推送規則。記得點右下角的大拇指“贊”和紅心“推薦”。這樣每次新文章推送,就會第一時間出現在訂閱號列表里。

世界并非由詞語構成
空間智能是AI的下一個前沿領域,而世界模型正是通往這一領域的路徑。在此,World Labs團隊與我想要更進一步:在當前被構建并被稱為“世界模型”的眾多事物中,哪些功能組件真正構成了這種能力?每一個組件又具體用于什么?
語言模型賦予了機器對概念、詞匯和推理的非凡掌控力,但物理世界——虛擬或是真實——是運行在不同的基質之上的。語言模型學習的是文本的統計結構,而世界模型則學習的是空間與時間的統計結構:光線如何照射到表面,花園從沒有相機拍攝過的角度看起來是什么樣子,物體如何響應外力并遵循物理定律。
這使得“世界模型”成為當今人工智能領域最重要且最被濫用的術語之一。計算機視覺、機器人學、強化學習和生成式AI都宣稱正在構建世界模型,但它們所指代的意義卻截然不同。一個能制造出美麗卻在物理上不可能存在的火焰的視頻模型,一個即興創作可玩游戲的語言模型,以及一個忠實模擬燃燒過程的物理引擎,它們都以同一個名稱出現。
古希臘人始終無法在世界由什么構成上達成一致——是火、水,還是不可分割的原子,因為“世界”從來不是一個單一實體,而總是某種思想者用來推理所依賴的整體的代稱。恰逢這個領域亟需精確性的時候,AI繼承了同樣的問題。
分類學之下的循環
這種混亂的打破始于一張比任何相關技術都更古老的圖表。幾十年來,包括經典教材《Sutton and Barto》在內的強化學習教科書,一直使用同一張圖示來描述智能體如何與世界互動。這一圖示的正式名稱為部分可觀測馬爾可夫決策過程(POMDP),而“世界模型”一詞的原始定義也源自這一傳統。
智能體可以是人類、機器人或軟件系統,它會采取行動,這些行動會影響世界的狀態,但智能體本身從未直接看到該狀態。它們依靠的是一系列觀測:落在視網膜上的光子、傳感器讀數,以及視頻幀中的像素。新的觀測會引發新的行動,而這一循環不斷持續。
“狀態”一詞需要進一步解釋,因為其含義在不同領域中有所變化。這并非化學家所說的固體、液體和氣體之間的區別;而是物理學家和機器人學家所理解的狀態:對世界某一時刻發生的一切事物的完整描述,包括每一個物體、每一個位置、每一個速度和每一個屬性。狀態是世界的底層現實;在原則上是完整的,卻從未直接被其中的任何智能體所看見。觀測則是智能體對該現實的部分認知。而行動則是它們為響應這些觀測所采取的行為。
這一循環——從智能體的行動,到狀態,再回到觀測,并返回智能體——正是現代術語“世界模型”獲得其技術含義的結構基礎。該術語本身的歷史更早,可追溯至Kenneth Craik 1943年提出的觀點:思維通過運行“小規模模型”來推理現實,這種思想在20世紀80年代末至90年代初通過神經網絡得以實現。此外,這一循環也解釋了當今人們使用該術語時所指的意義。如今被稱為“世界模型”的不同事物,實際上是同一循環的不同投影。它們各自輸出的是這一循環中的不同部分。
世界模型的三種功能
渲染器
第一類世界模型是渲染器。渲染器以像素形式輸出供人眼觀看的信息,其中最重要的是視覺真實度。例如,將文字提示轉化為電影級無人機拍攝畫面的視頻模型,就是一種渲染器。谷歌的Genie 3或World Labs自家的RTFM等交互式系統也是如此——這些模型根據用戶輸入實時生成畫面。這類模型并不具備對三維結構的明確理解,它所呈現的是觀眾看到的內容,而非現實本身。無人機拍攝的畫面中建筑從上方看可能完美無瑕,但當你試圖在下方駕駛穿過城市時,它們就會顯得支離破碎。
模擬器
第二種類型是模擬器。模擬器輸出的是狀態:即一個幾何、物理或動態上基于現實世界的真實表示,人類和計算機程序都可以計算并與其互動。渲染器的職責純粹是視覺呈現,而模擬器的職責則在于結構設計,需要具備經得起檢驗的幾何形態、符合牛頓定律的物理行為,以及根據物理規律所應呈現的動態特性。模擬器同時服務于兩類用戶:如建筑師、設計師、電影制作人等專業人員,以及需要準確性的游戲開發者,而不止于視覺上的合理性。強化學習智能體、機器人控制器和自動駕駛車輛等計算機程序使用模擬器作為訓練平臺,可以在大規模環境中與現實世界進行交互,測試那些在現實中危險、昂貴或無法運行的場景。
規劃器
第三類是規劃器。規劃器輸出行動。給定一個觀測和一個目標,規劃器會回答智能體下一步該做什么的問題。從許多方面來看,這與渲染器正好相反:渲染器以行動為輸入并生成觀測,而規劃器則以觀測為輸入并生成行動,從而完成感知-行動循環。視覺-語言-動作模型、基于模型的系統以及新興的“世界動作模型”等,這些都是對規劃器的嘗試——即能夠決定機器人在非結構化環境中應采取何種行動的系統。
這三個類別描述了當今大部分模糊不清的內容,它們之間的區別在實踐中非常有用。然而,這些類別并非從根本上相互獨立。所有類別背后都基于相同的世界運作原理——幾何學、物理學和動力學。一個能夠從任意角度呈現杯子的模型,在原則上應能模擬杯子被推動時的行為,并規劃出一只手去拾起杯子的動作。越來越多的前沿研究有意模糊這三者之間的界限。
為何模擬是關鍵所在
在這三個類別中,模擬器所獲得的公眾關注最少,卻是其中影響最為深遠的一個。本文將探討這種不對稱性。
渲染器無疑是目前商業上最成熟的。許多圖像或文本生成視頻的產品正在消費市場和企業市場迅速擴展。谷歌的Nano Banana模型已將具備渲染器級質量的圖像生成技術交到了潛在的數億用戶手中。這項技術是真實存在的,市場也是真實的。然而,渲染器優化的是視覺上的可信度,而非物理準確性,而這一上限至關重要。它們的輸出效果精美,但無法用于建筑設計或機器人訓練。
規劃器是最引人注目且最具前景的領域,與快速發展的機器人學習領域緊密相連。過去兩年中,該領域已推出了一些在視頻中令人印象深刻的機器人演示,但必須坦率地指出這些演示實際展示的內容幾乎所有演示都局限于高度受限的實驗室環境,對象種類狹窄,任務時長短暫。沒有任何一個系統經過了現實部署所要求的復雜性、變異性或持續時間的驗證。從令人信服的演示視頻到能在廚房、倉庫或手術室中穩定運行的機器人之間,仍存在巨大差距。盡管如此,商業上的押注依然巨大。一批資金雄厚的新進入者正競相推出通用型規劃系統,而最大的基礎設施提供商則正在將規劃技術整合到更廣泛的仿真架構之上。一個能夠規劃的機器人,才是能真正能夠工作的機器人。整個行業都在爭先恐后地成為第一個實現這一目標的企業。
模擬器是兩者之間的橋梁。如果語言是對世界的抽象,像素是對它的投影,那么幾何、物理和動力學就是世界本身。一個模擬器必須在這一層面上運行:它是結構基礎,從中可以推導出視覺表現(供渲染器使用)和行為后果(供規劃器使用)。
掌握仿真技術的模型,能夠將它的理解轉化為人類可感知的像素圖像,也能為具身智能體生成行為預測。而僅擅長渲染或僅擅長規劃的模型,則無法實現這兩點。這使得它的商業應用前景極為廣闊。僅以英偉達的Omniverse為例,據估計,該公司在工廠、倉庫、供應鏈和數字孿生等領域可觸及的市場規模就超過一萬億美金。機器人訓練、自動駕駛測試、建筑設計可視化、工程設計以及藥物研發等,都依賴于某種形式的仿真技術。
該領域中最難的開放性問題也存在于其中。具有明確幾何結構、材料屬性和物理標注的三維數據,其數量級遠少于渲染器所依賴的互聯網視頻。仿真與現實之間的差距依然存在,即物體在仿真環境中的行為與真實世界中的行為之間仍存在差異。生成式模擬器在此基礎上又引入了新的風險:AI生成的幾何體可能看起來正確,卻包含自相交或比例錯誤,從而導致物理行為不合理。大規模多物理場仿真——包括剛體、可變形物體、流體和布料之間的相互作用——其計算成本仍比單一領域的仿真高出數個數量級。
在World Labs,Marble是我們進軍這一領域的第一步。它能夠接收多模態提示(文本、圖像、視頻或空間草圖),并生成可探索的3D環境,同時輸出用于視覺探索的高斯點云以及物理引擎可用的碰撞網格。然而,Marble僅僅是整個領域更長發展篇章中的第一章,隨著渲染、模擬與規劃之間的界限逐漸消融,這一進程才剛剛開始。
邊界正在消融,接下來會發生什么
但變化遠未結束。當前領域最重要的趨勢是,這三個類別正開始相互融合。一個共同的觀點是:構建世界、模擬世界以及在其中行動所需的知識在很大程度上是相同的。繼續之前的例子,一個真正理解杯子如何放置在桌面上(包括其幾何形狀、材料特性、受力反應等)的模型,應該能夠從任意角度渲染出這個杯子,模擬杯子被推時的反應,并規劃出手去拿起杯子的動作。這三個類別,其實是同一底層理解的三種不同表現形式。
例如,近年來一些來自不同機器人實驗室的研究表明——至少在概念上——預訓練的視頻渲染器可用作共同的世界與動作預測的核心框架,從而在渲染器與規劃器之間架起橋梁,使單一模型能夠想象未來會發生什么以及該如何行動。World Labs 的 Marble 已經能通過單一模型輸出高斯點云和碰撞網格,消除了渲染器與模擬器之間的界限。各個層級正從被動輸出轉向交互式系統:渲染器變得具備動作條件性,模擬器生成更可控、可編輯的世界,而規劃器則不再只是被動響應,而是開始主動決策。
最終順理成章的目標是構建一個統一的世界模型:一種基礎模型,它能夠生成逼真的視覺效果,輸出物理上精確的結構,并規劃動作序列,根據下游使用者的需求在不同輸出模態之間靈活切換。然而,我們仍面臨諸多艱巨挑戰:數據分布極不均衡,渲染器擁有海量的網絡視頻資源,而模擬器和規劃器卻嚴重缺乏3D資源和機器人演示數據,追求視覺美感可能會犧牲機器人或高保真仿真所需的精確性。如何在一個統一架構中協調這些矛盾,是當前世界模型研究中的核心難題,而這正是World Labs在持續演進Marble的過程中所致力于解決的問題。

然而,方向是明確的。自20世紀80年代末以來,該領域一直相信著一個信念——即任何個體只要擁有足夠豐富的世界模型,便足以感知世界、構建世界并在此中行動。如今,這一“巨大賭注”正推動著整整一代的研究工作。使這一“大賭注”更具分量的是,目前已出現的融合趨勢:三個原本獨立的研究項目,各自驅動并塑造著價值數十億美元的產業,如今開始展現出協同效應。當它們相互交融、邊界逐漸消失時,將共同重塑更宏大的圖景:機器智能與其所處物理世界之間的關系——這正是空間智能的漫長軌跡。
語言為機器提供了描述這個世界的方式。世界模型是機器最終理解、想象、推理并與之互動的途徑。
原文鏈接:
高端微信群介紹 | |
創業投資群 | AI、IOT、芯片創始人、投資人、分析師、券商 |
閃存群 | 覆蓋5000多位全球華人閃存、存儲芯片精英 |
云計算群 | 全閃存、軟件定義存儲SDS、超融合等公有云和私有云討論 |
AI芯片群 | 討論AI芯片和GPU、FPGA、CPU異構計算 |
5G群 | 物聯網、5G芯片討論 |
第三代半導體群 | 氮化鎵、碳化硅等化合物半導體討論 |
存儲芯片群 | DRAM、NAND、3D XPoint等各類存儲介質和主控討論 |
汽車電子群 | MCU、電源、傳感器等汽車電子討論 |
光電器件群 | 光通信、激光器、ToF、AR、VCSEL等光電器件討論 |
渠道群 | 存儲和芯片產品報價、行情、渠道、供應鏈 |

< 長按識別二維碼添加好友 >
加入上述群聊

帶你走進萬物存儲、萬物智能、
萬物互聯信息革命新時代
