2026年5月13日,理想汽車CEO李想在一次公開對談中提出了一個非常有意思的觀點,那就是自動駕駛是具身智能的上半場,通用人形機器人是具身智能的下半場。這個判斷迅速在行業內傳播開來,被不少人拿來與當年王傳福電動化是上半場,智能化是下半場的論斷相提并論。僅從自動駕駛是具身智能的上半場這一論斷來說,這個說法準確嗎?
01
是技術底座,還是人才遷徙?
其實有很多人是支持這個觀點的,他們認為,自動駕駛已經在感知、決策、控制等核心技術上積累了相當深度,這些能力可以直接遷移到更廣泛的具身智能場景中。其實從系統架構來看,自動駕駛與具身智能確實共享相似的框架,它們都需要借助傳感器數據實時構建環境模型并做出決策。端到端大模型、VLA(視覺-語言-動作模型)、世界模型這些技術概念,也同時在兩個領域被廣泛討論和推進。

圖片源自:網絡
但也有一部分人認為,上半場的說法制造了一種邏輯慣性,將先后發生偷換成了因果必然。自動駕駛要解決的核心問題相對單一,即安全的導航移動,這一要求的關鍵在于環境感知、路徑規劃和碰撞規避。而具身智能需要同時解決導航移動、運動控制和靈巧操作三大問題,導航移動只是入場券,后兩者才是真正的核心挑戰。
從技術上看,這兩者的區別其實非常明顯,自動駕駛在高度結構化的交通規則下追求高效且安全的移動,而具身智能要應對的是更廣泛、更復雜的非結構化環境。做一個形象的對比,自動駕駛解決的是讓車在平面上不撞東西的問題,而具身智能要處理的是讓設備在三維空間里與物體發生交互,兩者面臨的物理約束和操作對象完全不同。
既然技術上有很多的區別,那上半場論斷真正的成立基礎在哪里?智駕最前沿以為,上半場的關鍵或許不在技術本身,而是在人。現階段,從智駕賽道沖殺出來的工程師們,正攜帶著被量產工程淬煉出的能力集體涌入具身智能領域,對于這個趨勢,智駕最前沿也和大家分析過:智駕人才涌向具身智能,是降維打擊還是會水土不服?。
據統計,僅地平線一家就有至少14位核心技術和管理層離職創業,其中13人進入了具身智能賽道;理想汽車前CTO王凱、前智駕技術研發負責人賈鵬等也相繼投身具身智能創業。這些人在智駕領域的經驗,讓他們擁有智駕開發的全套方法論,他們知道如何定義復雜問題、如何在不確定性中拆解任務、如何在資源約束下做關鍵取舍。
02
當VLA走出汽車,還活得下去嗎?
2026年,VLA模型成為了連接自動駕駛與具身智能最受關注的技術紐帶,VLA在視覺-語言模型的基礎上引入動作token,使模型能夠從視覺、語言與機器人軌跡數據的配對中聯合學習。理想汽車在GTC 2026上發布了MindVLA-o1,并表示自動駕駛只是物理AI的起點,這類基礎模型未來將驅動新的具身智能范式;小米開源的Xiaomi OneVL也明確將VLA、世界模型和潛空間推理統一到一個框架里,定位為自動駕駛和具身智能都能用的基礎件。

圖片源自:網絡
VLA技術可以共享,但存在一個不可規避的問題,那就是延遲,當前VLA模型的推理延遲普遍在100到300毫秒。對于自動駕駛來說,這個延遲的影響很大,當車速72km/h時,車輛在模型推理期間會向前行駛6至8米,在城市路口或高速跟車場景中足以導致碰撞或偏離車道的事故,因此自動駕駛要求端到端延遲必須壓縮到50毫秒以內。
但對于人形機器人,多數操作任務都是抓取靜止工件、擰螺絲等,對延遲的容忍度更高,即便推理需要200毫秒,機械臂的物理運動本身也會耗時數百毫秒到數秒,模型輸出可作為設定值下發,延遲只影響整體節拍而不會直接導致任務失敗;只有在應對快速交互時延遲才成為需要考量的關鍵,但這類場景在具身智能領域并不多見。由此可見,同樣的模型架構,在不同的物理載體上對實時性的要求截然不同。

圖片源自:網絡
世界模型其實也存在類似的情況,2026年上半年,吉利發布WAM世界行為模型,小鵬發布X-World,小米推出Xiaomi Auto World Model,幾乎每一家智能駕駛頭部企業都在布局世界模型。世界模型被視為實現通用人工智能的關鍵拼圖,也被產業界看作突破具身智能泛化瓶頸的關鍵技術,但世界模型在自動駕駛和具身智能兩個場景中承擔的任務并不相同。
在車端,它主要做場景推演和規劃驗證,用來測試和優化智駕策略;而在具身智能領域,它需要實現的是真正物理層面的交互推理,如抓取、裝配這類動作背后涉及的力學建模。世界模型在兩個領域,一個側重軌跡層面的預測,一個要處理物理接觸和操作規劃,兩者對物理規律的理解深度要求差了不止一個層級。
03
從跑起來到干起活來?
從產業的一些數據,也可以看到具身智能的發展潛力,2025年中國具身智能市場規模約9150億元,預計2026年將達10904億元,全國具身智能相關企業數量已突破萬家;2026年《政府工作報告》將具身智能列為前沿技術重點培育方向;工信部與國資委聯合啟動的具身智能專項行動,也首次將落地目標量化至萬臺級。由此可見,在具身智能領域,政策端和市場端的熱情已經就位。

圖片源自:網絡
市場潛力表現不錯,那真實的技術成熟度是否達標呢?有業內人士判斷,當前具身智能仍處在從L1向L2、L3過渡的階段)參照2025年發布的《人形機器人智能化分級》(T/CIE 298-2025)團體標準,L1為基礎感知,L2為自主決策,L3為復雜任務),人形機器人可以在部分專用場景中落地,但距離真正的跨場景泛化還有明顯距離。星源智創始人劉東將當前具身智能的落地狀態類比為2015、2016年的自動駕駛,彼時L2級輔助駕駛也才剛剛開始規模化落地。
現階段的具身智能確實取得了一些進展,但要說像自動駕駛那樣大規模替代人工,還有很長一段路要走。其實回頭看自動駕駛的來時路,從2017年大家對L4級量產普遍抱著三到五年就能成的預期,到2026年L2級滲透率才剛超過70%、L3級才剛開始商業化試點,前后經歷了差不多十年。具身智能要面對的場景比開車復雜得多,物理交互也豐富得多,這個周期大概率只會更長,不太可能更短。
04
自動駕駛是具身智能的上半場嗎?
回到最初的問題,自動駕駛是具身智能的上半場這個論斷成立嗎?
如果我們將上半場理解為時間上先發生、商業上先驗證,那它基本成立。自動駕駛確實是具身智能概念下產業化程度最高的應用場景,它率先跑通了從算法到量產的數據閉環,率先建立了傳感器、芯片、操作系統的供應鏈體系,也率先培養了一批懂得如何將AI模型部署到物理世界中的工程人才。
但如果我們將上半場理解為技術上的必經之路或能力上的充分準備,那它并不是嚴格成立。自動駕駛積累的感知和決策能力可以部分復用,但運動控制和靈巧操作則是新的領域,一套為四輪汽車設計的算法棧,無法直接驅動雙足機器人完成抓取和裝配。更關鍵的是,這兩者面臨的物理規律、交互對象和失敗代價完全不同,汽車失控可能造成生命危險,機器人抓取失敗可能只是需要重試一次,這種差異也決定了兩者的技術路線、安全標準和工程方法論都會走向不同的方向。

圖片源自:網絡
可以說,上半場是一個有用的比喻,它幫助產業界理解了兩個領域之間的關聯和演進次序,但比喻終究是比喻,它簡化了現實,也遮蔽了差異。自動駕駛不是具身智能的必然前奏,正如電動化不是智能化的不可逾越的前提。真正連接兩個領域的,是那些在智駕領域錘煉過的人才和他們攜帶的方法論。
從更宏觀的視角看,現階段物理AI的市場正在形成,各車企都在相繼發布物理AI,智駕最前沿也關注到了這一現象:各車企相繼發布的物理 AI大模型是什么?有何優勢?,思略特咨詢預計2030年全球物理AI市場規模將達到4300億歐元,其中自動駕駛和具身智能是核心應用。在這個更大的技術圖景中,自動駕駛和具身智能更像是并行推進的兩條賽道,共享部分底層技術,但也會各自面對獨特的工程挑戰。不可否認,它們之間的確存在人才、數據和方法的流動,但這種流動是雙向的、漸進的,而不是單向的、決定性的。
#自動駕駛 #具身智能