馬斯克還沒有賭成功的局,何小鵬剛剛說他做到了——
小鵬自研多模態(tài)大模型,迸發(fā)智能涌現(xiàn),從量產(chǎn)智能輔助駕駛開始,統(tǒng)一Robotaxi、具身智能、飛行汽車底層架構(gòu),升維到通用物理AI層面:

物理AI的“涌現(xiàn)”,不僅體現(xiàn)在小鵬人形機(jī)器人從去年蹣跚學(xué)步到今年邁著T臺(tái)貓步登場:

太過逼真而引來網(wǎng)友紛紛“打假”,小鵬只好一鏡到底證明真的不是cosplay:

何小鵬的回應(yīng)更有意思:

回到造車本行,小鵬這次最直接的進(jìn)展就是量產(chǎn)車系統(tǒng)超越“輔助”范圍,開始成規(guī)模成批次克服各種Corner case:

以及在Robotaxi和量產(chǎn)車?yán)ǖ讓榆浻布軜?gòu),掃清落地的范圍、規(guī)模限制:

換句話說,普通用戶買到的L4級體驗(yàn)量產(chǎn)車,小鵬率先實(shí)現(xiàn)。
所謂“物理AI”,和之前智能駕駛模型最直觀的不同,是終端AI直接操控的維度,從簡單前后左右二維,變成了飛行汽車的XYZ三維,甚至是機(jī)器人數(shù)十個(gè)不同的運(yùn)動(dòng)關(guān)節(jié)……
從車到復(fù)雜AI場景智能涌現(xiàn)的基礎(chǔ),何小鵬自述是從重構(gòu)車端VLA架構(gòu)開始。
從體驗(yàn)上看,小鵬第二代VLA最直觀的進(jìn)步,是打通智能輔助駕駛覆蓋的“最后一公里”。
包括郊區(qū)、城鄉(xiāng)結(jié)合部、胡同等等,平均接管里程提高了13倍。

小路、不規(guī)則路段做好了,何小鵬認(rèn)為本質(zhì)上代表城市NOA能力提高了10倍,高速輔助駕駛能力安全提高了100倍,這就是一個(gè)巨大的跳躍。
第二代VLA第二個(gè)特點(diǎn),是幾乎能和老司機(jī)一樣理解、處理路上的各種場景,既包括面對教官檢查時(shí)的自主“揮手停車”,也包括等待紅綠燈起步時(shí)自然而然的蠕行。
甚至左右兩邊各3公分極限窄路通行,現(xiàn)在VLA都能自主完成:

這些高度擬人化的操作,何小鵬說團(tuán)隊(duì)根本沒有針對性寫代碼開發(fā),全都是系統(tǒng)在訓(xùn)練過程中自主涌現(xiàn)的能力。
如果說端到端普及,讓智能輔助駕駛擺脫“開城”限制,VLA的迭代則讓車載AI一定程度擺脫數(shù)據(jù)分布的限制,不同國家和地區(qū)的道路,都能實(shí)現(xiàn)最基本的理解操作。
這個(gè)能力之上,小鵬開發(fā)了Super LCC加人機(jī)共駕,導(dǎo)航可開可不開,照樣在直路上絲滑的自動(dòng)輔助駕駛,滿足中國跟全球各地的法律法規(guī)。

小鵬最新VLA展現(xiàn)出的理解認(rèn)知能力,與現(xiàn)在市面上常見的VLA不同,并非直接來自大語言模型,而是進(jìn)行了徹底重構(gòu)。
從第一性原理出發(fā),小鵬認(rèn)為現(xiàn)行VLA結(jié)構(gòu)有比較嚴(yán)重的缺陷——通過語言模型理解描述場景耗時(shí)長,且信息遺漏比較多。
也就是說小鵬最新的VLA,不再以外掛的超大規(guī)模語言模型為核心,而是直接從vision到action,以物理世界模型為核心。

就好比車載AI腦內(nèi)有個(gè)小劇場,基于對物理世界的理解來推演可能的場景,再根據(jù)對各個(gè)目標(biāo)的軌跡判斷,不斷修正自身行車軌跡。
像人一樣認(rèn)知、學(xué)習(xí)和觀察世界。不用中間的語言翻譯,直接轉(zhuǎn)為運(yùn)動(dòng)的軌跡,首先是可以大幅度降低信息的損耗,因?yàn)橄到y(tǒng)直接看到完整世界。第二,推理效率更高,畢竟現(xiàn)在沒有了語言模型的中間轉(zhuǎn)譯。
至于語言模型,如今的作用其實(shí)是智駕可視化,讓用戶明白車在做什么,提升信任感。
第二代VLA基座模型的訓(xùn)練,用了接近1億個(gè)視頻的Clips,不是標(biāo)準(zhǔn)數(shù)據(jù)而是各種 corner case,“相當(dāng)于一個(gè)普通人駕駛65000年遇到極限場景的之和。

物理世界模型,內(nèi)部其實(shí)是不斷重構(gòu)改變攝像頭原始數(shù)據(jù),通過生成新的場景來尋找決策依據(jù)。
為了實(shí)現(xiàn)這個(gè)能力,小鵬使用了阿里云超3萬張卡的云端的超大算力集群,以及720億參數(shù)的基礎(chǔ)大模型。明年的需求可能會(huì)去到5~10萬張卡。
何小鵬自述,2024年開始內(nèi)部有兩個(gè)VLA團(tuán)隊(duì)并行,一個(gè)就是現(xiàn)在的量產(chǎn)上車的版本,另一個(gè)則是嘗試世界模型路線——即劉先明帶領(lǐng)的團(tuán)隊(duì)。

“月燒一億”,且長時(shí)間沒有突破,內(nèi)部一度想砍掉這個(gè)方向,但直到今年2季度某一天,智能“突然”就涌現(xiàn)了。
后面的故事是,劉先明的Title從年初的基座模型負(fù)責(zé)人,變成了如今的自動(dòng)駕駛中心組織負(fù)責(zé)人。

另一個(gè)角度看,隨小鵬新P7首發(fā)量產(chǎn)的VLA系統(tǒng),半年不到就成了被顛覆替代的版本。
不過用戶不必有絲毫被背刺的擔(dān)心,底層硬件架構(gòu)通用,最新的第二代VLA年底早鳥測試,預(yù)計(jì)明年一季度大規(guī)模OTA,其實(shí)也就最近幾個(gè)月的事了。
技術(shù)角度,小鵬承諾完全沒問題,所見即所得。
2026年開始,小鵬新車的智能化SKU,除了Max、Ultra,還會(huì)加推Robo版,算力、傳感器、軟件版本完全和小鵬即將量產(chǎn)落地的Robotaxi一樣:

當(dāng)然,回歸到普通用戶層面,買一輛無人車幫你拉活賺錢,技術(shù)上也許正在突破,但法規(guī)仍然模糊,并沒有放行。
小鵬在做的和特斯拉一樣,用大模型自動(dòng)駕駛技術(shù)體系去模糊、拆除L4與L2的壁壘,用體驗(yàn)去說服用戶、監(jiān)管自動(dòng)駕駛的可靠安全性。
比如,小鵬即將落地的Robotaxi算法架構(gòu)同樣源于最新VLA體系,只不過為了滿足L4全無人、萬無一失的要求,能力倍增:

四顆圖靈芯片,3000TOPS算力,其中有三顆2250TOPS提供運(yùn)算力,有一顆750TOPS提供算力冗余和安全增強(qiáng)。
同是第二代VLA,Robotaxi上小鵬會(huì)訓(xùn)練一種不同風(fēng)格的自動(dòng)駕駛,注重極致安全,注重全程零接管的體驗(yàn)。
2026年內(nèi)預(yù)計(jì)投入3款Robotaxi車型,全部是小鵬量產(chǎn)車同源,并且和高德地圖合作,一同提供Robotaxi服務(wù)。用一年時(shí)間走完傳統(tǒng)L4玩家近10年走過的路。
物理形態(tài)、AI大腦、商業(yè)場景三個(gè)層面,小鵬最新的人形機(jī)器人IRON跟去年比有了脫胎換骨的變化。
首先是物理形態(tài),姿態(tài)更絲滑流暢的貓步,背后是小鵬機(jī)器人團(tuán)隊(duì)重構(gòu)了整個(gè)“骨架”:

仿人的脊椎,可以像人類一樣彎腰、雙手觸地,機(jī)器人的站、坐、蹲、躺、爬、摔倒都可以自主完成。
然后是單手高達(dá)22個(gè)關(guān)節(jié)自由度的靈巧手,關(guān)節(jié)直徑只有16毫米。此外還有柔軟觸感的仿生皮膚,內(nèi)置一系列觸覺傳感器,交互過程中可以檢測觸覺信息作為決策依據(jù),同時(shí)還能給用戶觸覺方面的反饋。

其次是仿生的肌肉,讓機(jī)器人和人類一樣有不同的體型,可以根據(jù)用途定制:

機(jī)器人的頭部,集成了一塊3D曲面顯示,背后有攝像頭、毫米波雷達(dá)、慣導(dǎo)、魚眼相機(jī)等等,具備了聽說、看表情等系列的能力,也可以通過顯示屏做出各種表情跟人類互動(dòng)。

AI大腦層面,IRON置3個(gè)大模型,包括VLT、VLA、VLM,使用三顆圖靈AI芯片共2250TOPS支撐。

都和量產(chǎn)車、Robotaxi同源同架構(gòu)。其中VLA負(fù)責(zé)機(jī)器人的運(yùn)動(dòng)(和車載VLA同一個(gè)團(tuán)隊(duì)),VLM負(fù)責(zé)跟人類的交互,VLT則是機(jī)器人自主行動(dòng)、完成任務(wù)的核心引擎。
相當(dāng)于機(jī)器人的“慢大腦”,通過思考決策和任務(wù)分解,它會(huì)判斷在真實(shí)的物理環(huán)境下,下一步該怎么做。
包括身體怎么動(dòng),手怎么動(dòng),嘴怎么說、動(dòng)作該怎么執(zhí)行……把一個(gè)目標(biāo)拆分成一系列流程,再組合成一系列動(dòng)作、語言指令。
不過何小鵬認(rèn)為,現(xiàn)階段具身智能還沒走到大規(guī)模落地的泛化階段,核心原因是機(jī)器人與智能汽車不同,現(xiàn)階段數(shù)據(jù)來源實(shí)在太有限了。

就比如VLA在車上,只需要考慮前后左右雙維度運(yùn)動(dòng)場景,但I(xiàn)RON有82個(gè)關(guān)節(jié)需要協(xié)調(diào),不同場景任務(wù)中又有不同需求……
小鵬目前已經(jīng)建立了具身智能的數(shù)據(jù)工廠,具體怎么收集生產(chǎn)具身智能數(shù)據(jù),何小鵬表示還要保密一段時(shí)間。
不過就目前階段,小鵬人形機(jī)器人在一些場景中已經(jīng)能產(chǎn)生商業(yè)價(jià)值——導(dǎo)覽、導(dǎo)購跟導(dǎo)詢,比如購物中心的前臺(tái)信息咨詢、顧客引導(dǎo),公司的保安巡邏等等。

比如,寶鋼集團(tuán)是首個(gè)宣布成為小鵬機(jī)器人IRON項(xiàng)目的生態(tài)合作伙伴的企業(yè),將探索巡檢等復(fù)雜的工業(yè)領(lǐng)域應(yīng)用場景。
2026年底,小鵬人形機(jī)器人就能實(shí)現(xiàn)量產(chǎn)。
實(shí)際上第一代機(jī)器人已經(jīng)走進(jìn)小鵬4S店,作為導(dǎo)購服務(wù)進(jìn)店買車試車的用戶。
全球訂出7000輛的是已經(jīng)量產(chǎn)就緒的陸地航母:

還亮相了一款全傾轉(zhuǎn)混電飛行汽車“A868”:

“陸地航母”是滿足個(gè)人低空飛行體驗(yàn),而“A868”實(shí)現(xiàn)多人長航程高效出行。
飛行器本身就是鯤鵬超級增程系統(tǒng),續(xù)航500km+,最高航速360km+/h,可最多支持6人乘坐,目前飛行器已經(jīng)進(jìn)入試飛階段。
陸地航母首創(chuàng)了六軸六槳雙涵道安全構(gòu)型,即便對槳失效,仍能安全飛行且著陸,艙內(nèi)僅1塊屏幕、1個(gè)操作桿,單手可飛,顛覆了傳統(tǒng)飛行汽車操作邏輯,并配有副駕操作臺(tái),確保飛行安全。
值得一提的是,小鵬匯天執(zhí)行“高管先飛計(jì)劃”,管理團(tuán)隊(duì)親身驗(yàn)證飛行安全,量產(chǎn)交付前,必須飛行超5000公里——其中當(dāng)然包括何小鵬本人。
飛行汽車的商用落地場景,小鵬其實(shí)已經(jīng)有了初步明確。

比如小鵬已經(jīng)和旅游勝地敦煌當(dāng)?shù)剡_(dá)成協(xié)議,建立至少5個(gè)飛行營地,承擔(dān)空中游覽觀光任務(wù)。
個(gè)人用戶層面,小鵬在籌建全球首家飛行汽車6S店,集展示、銷售、交付、培訓(xùn)、服務(wù)為一體,買小鵬飛行器的同時(shí),“飛行駕校”一對一專班也安排上。
智能汽車狹義層面,小鵬展現(xiàn)出的思考和行動(dòng),和其他玩家并不相同。
VLA上車,絕大部分玩家都是采用已有開源的大語言模型做基礎(chǔ)(比如最常用的通義千問),采用外掛模式作為端到端系統(tǒng)的參考。
VLA本從大語言模型啟發(fā)而來,采用“外掛”方式應(yīng)用到車端一方面是慣性使然,一方面也是量產(chǎn)上車作為目標(biāo)驅(qū)動(dòng)的結(jié)果。

小鵬當(dāng)然也這么干了,但同時(shí)也沒放棄第一性原理思考,更加大膽得去花真金白銀驗(yàn)證。
也許從小鵬開始,國內(nèi)自動(dòng)駕駛駕駛的大模型路線,會(huì)徹底和語言模型分流,趨向完全不一樣的結(jié)構(gòu)、范式。
這個(gè)新范式,就是以世界模型為核心的大模型,從車延伸到其他物理場景的通用AI大腦。

如果小鵬能統(tǒng)一融合L4、L2架構(gòu),證明泛化性和安全性可以并存,Robotaxi“地理圍欄”范圍就有希望逐漸擴(kuò)大到普通乘用車一樣的程度,升維降維之爭也會(huì)徹底終結(jié)。
更進(jìn)一步,通用AI司機(jī)的基座大模型,啟發(fā)的不只是自動(dòng)駕駛…

2025年主流汽車工業(yè)終于開始力爭轉(zhuǎn)型,希望擺脫傳統(tǒng)制造業(yè)的標(biāo)簽,向智能汽車靠攏;
而在這個(gè)賽道第一梯隊(duì)的小鵬汽車,似乎已經(jīng)無法用“智能汽車”的標(biāo)準(zhǔn)維度來衡量了。
— 聯(lián)系作者 —

— 完 —
【智能車參考】原創(chuàng)內(nèi)容,未經(jīng)賬號授權(quán),禁止隨意轉(zhuǎn)載。
點(diǎn)這里??關(guān)注我,記得標(biāo)星,么么噠~