
芝能科技出品
在中國的車企和科技企業大量投入下,自動駕駛走到現在,感知不再是瓶頸,模仿學習也逐漸觸頂,現在更多的還是更好的策略,解決"看清了,該怎么辦"。
從看到到做決定,只有幾十毫秒。小米這次發布的 Xiaomi OneVL,就是在回答這個問題,當自動駕駛進入"需要推理"的階段,模型該怎么既快又準。

XLA路線,想清楚再開
如果把自動駕駛模型發展簡單分個階:
◎ 第一階段是感知驅動,核心是檢測和分割,把世界拆成"車、路、人";
◎ 第二階段是模仿學習,模型直接學人類怎么開;
◎ 第三階段,才真正涉及認知和推理,小米把這套思路叫XLA。
XLA的關鍵變化是,是從"像人一樣開",要解決“為什么這樣開"的問題。
前車減速、側方來車、道路收窄是決策鏈條里的變量。但是推理一加進來,系統延遲直接飆升。
行業里常見的解法是顯式思維鏈(CoT)。模型先把"思考過程"一步步生成出來,再給答案。這在語言任務里挺好用,但擱駕駛場景,基本等于沒用,逐token生成的延遲,在車規系統里是致命的。
另一條路叫Latent CoT:把推理過程壓進模型的隱空間,讓模型"心里想",而不是"說出來再想"。
但問題在于,過去的Latent CoT壓縮的是語言。而開車,本來就不是語言問題。
OneVL最有價值的地方是重新定義了推理對象。
◎ 傳統Latent CoT的思路是:把"我為什么這么做"壓縮成一段隱變量。
◎ OneVL的思路是:真正需要壓縮的是未來。
自動駕駛決策是對接下來0.5秒、1秒場景會怎么演化的判斷:
◎ 那輛車會不會并線?
◎ 行人會不會進道路?
◎ 繼續加速會不會撞上?
駕駛決策依賴的是一個隱含的"世界模型"。OneVL的關鍵一步,就是把推理的載體,從語言轉向視覺時空結構,也就是未來場景本身。

架構:三個克制但關鍵的設計
OneVL在結構上做了三件挺克制、但很關鍵的改變。
● 雙模態latent token:讓"想"和"理解"分開
模型內部引入兩類隱變量:
◎ 視覺latent token:負責編碼場景里的物理關系和時序變化
◎ 語言latent token:負責表達駕駛意圖和語義邏輯
相當于把"世界怎么變"和"我要做什么"分開建模。模型不再用語言強行描述物理世界,而是在視覺空間里直接推理。
好處是,信息不會在語言壓縮過程中丟失。過去Latent CoT的問題,本質就是把高維時空信息硬塞進語言結構,信息損耗不可避免。
● 雙解碼器監督:訓練時"想清楚",推理時"直接給答案"
OneVL引入了兩個解碼器,但只存在于訓練階段:
◎ 視覺解碼器:預測未來0.5s / 1s的場景
◎ 語言解碼器:重建人類可讀的推理過程
這一步很關鍵。等于是給latent token加了兩種約束:
◎ 模型必須學會正確預測未來世界,否則視覺監督會懲罰它;
◎ 另它還要能解釋自己的決策邏輯,否則語言監督也會拉回來。
但在推理階段,這兩個解碼器全部移除。
模型訓練時被逼"想清楚",但實際跑的時候直接給答案,典型的"訓練-推理解耦"。
● 一步式推理:徹底消滅自回歸
OneVL最激進的設計:推理階段不做任何逐token生成,所有latent token一次性預填充,模型并行計算,直接輸出軌跡或決策。
延遲理論上可以接近"只輸出答案"的模型,而不是傳統CoT那種需要逐步生成的結構。
相比顯式CoT,速度最高提升2.3倍,精度還更高。說白了,這不是優化,是換賽道。
OneVL容易被忽略的一點,是它的訓練流程,分三個階段:
◎ 先單獨訓練視覺解碼器,讓模型學會預測未來
◎ 再訓練主模型,學習基本的軌跡和表示
◎ 最后聯合微調,把三者對齊
聽著挺麻煩,但結果說話:跳過這步,性能直接掉20多分。軌跡、語言、視覺一起練會打架。如果不分階段處理,模型很容易陷入梯度干擾,OneVL是一套訓練方法的工程化解法。
從指標上看,OneVL在多個基準上已經超過顯式CoT,這在過去挺難想象的,同時解決了三個長期問題:
◎ 第一,CoT太慢。 自回歸推理在車規系統里幾乎不可接受,而OneVL把延遲壓到了0.24秒量級,已經進入可部署區間。
◎ 第二,隱式推理不夠強。 過去Latent CoT精度不如顯式CoT,本質是信息壓縮方式不對。OneVL通過引入世界模型監督彌補了這一點。
◎ 第三,可解釋性缺失。 端到端模型一直被吐槽"黑盒"。OneVL通過語言+視覺雙解釋,把決策過程重新暴露出來。
這三點,對應的是自動駕駛落地的三個核心門檻:性能、實時性、可驗證性。
這套方法,并不局限于自動駕駛。機器人、具身智能,甚至復雜決策系統,只要涉及"未來狀態預測+實時決策",都可以套用。
OneVL已經把延遲壓到了4Hz級別,在很多輔助駕駛場景里是可以接受的。
但距離真正大規模上車,還有幾個現實問題:
◎ 算力成本是否可控;
◎ 長尾場景下的魯棒性;
◎ 以及最關鍵的,數據規模是否足以支撐這種推理能力。
過去行業在"要不要推理"之間搖擺。OneVL的答案是,推理必須要有,但玩法得變。
OneVL真正做的事情是讓模型在有限時間里,用對的方式思考,小米的自動駕駛能后來居上嗎?