具身智能的重心正在發(fā)生偏移。
過(guò)去,行業(yè)熱衷的是展示機(jī)器人可以做什么——跳舞、翻跟頭、跑馬拉松,每一次動(dòng)作突破都能引發(fā)刷屏。同時(shí),大批各行各業(yè)的技術(shù)大牛入局,吸引資本競(jìng)相涌入。但浪潮之下,Demo的敘事也正在逐漸失效。
如今,行業(yè)普遍瞄準(zhǔn)了新的問(wèn)題:機(jī)器人能穩(wěn)定干活嗎?能復(fù)制到一千臺(tái)、一萬(wàn)臺(tái)嗎?能在真實(shí)產(chǎn)線上創(chuàng)造可量化的價(jià)值嗎?
不可否認(rèn),衡量標(biāo)準(zhǔn)已經(jīng)切換。量產(chǎn)一致性、數(shù)據(jù)閉環(huán)效率、場(chǎng)景作業(yè)成功率,取代了炫技式的動(dòng)態(tài)性能,成為新的行業(yè)坐標(biāo)。
在2026上海MWC(世界移動(dòng)通信大會(huì))現(xiàn)場(chǎng),智元機(jī)器人聯(lián)合創(chuàng)始人兼CTO稚暉君(彭志輝),分享了對(duì)于這一背景下產(chǎn)業(yè)路徑的看法。

他提出了一個(gè)“部署態(tài)”的概念,強(qiáng)調(diào)具身智能需從開(kāi)發(fā)驗(yàn)證轉(zhuǎn)向?qū)嶋H生產(chǎn)力輸出。
他還透露,依托“三智一體”的技術(shù)框架,智元已在工業(yè)場(chǎng)景中完成萬(wàn)臺(tái)級(jí)交付。這意味著具身智能正在脫離實(shí)驗(yàn)室,開(kāi)始在物理世界承擔(dān)具體的、可量化的生產(chǎn)任務(wù)。
演講實(shí)錄傳達(dá)如下,僅做流暢性編輯:
各位嘉賓,各位移動(dòng)通信、人工智能與機(jī)器人產(chǎn)業(yè)的朋友們,大家好,我是智元的彭志輝。
我今天分享的題目是“三智一體部署態(tài),共筑具身生產(chǎn)力新格局”。

過(guò)去幾年,我們談?wù)揂I時(shí),更多聚焦于數(shù)字世界——模型參數(shù)、算力、應(yīng)用入口。從MCP到Skill,到Harmony,再到如今的Loop Engineering,Agent生態(tài)持續(xù)演進(jìn)。
但我們認(rèn)為,接下來(lái)更關(guān)鍵的問(wèn)題是,AI如何從數(shù)字世界真正走向物理世界,如何從“回答問(wèn)題”走向“在物理世界中自主完成任務(wù)”。
這不是一次性的文本生成,而是持續(xù)運(yùn)行、持續(xù)學(xué)習(xí)、持續(xù)創(chuàng)造生產(chǎn)力的過(guò)程。
今天我想把這個(gè)問(wèn)題放到更大的產(chǎn)業(yè)視角來(lái)看:
當(dāng)大模型能力、本體硬件可靠性與真實(shí)場(chǎng)景數(shù)據(jù)在同一窗口開(kāi)始收斂,AI的落地方式將發(fā)生哪些根本性變化?我們?nèi)绾螐能浖?yīng)用時(shí)代,真正進(jìn)入具身智能大規(guī)模部署的時(shí)代?
這正是我們一直在說(shuō)的——從開(kāi)發(fā)態(tài)走向部署態(tài)。

對(duì)移動(dòng)通信領(lǐng)域而言,這件事同樣高度相關(guān)。過(guò)去,移動(dòng)通信連接的是人、手機(jī)與各類終端;未來(lái),越來(lái)越多的連接對(duì)象將是自主運(yùn)行的智能體。它們?cè)谡鎸?shí)世界中感知、決策、執(zhí)行、反饋,而且不是偶爾在線,而是長(zhǎng)期在線。
黃仁勛在GTC上提到,每一次推理、每一次決策、每一次生成,本質(zhì)上都是Token的流動(dòng)。我們非常認(rèn)同這一判斷——Token不只是技術(shù)計(jì)量單位,它越來(lái)越像AI時(shí)代的貨幣。
目前我們討論的Token消耗,更多集中在聊天工具、代碼助手、圖像視頻生成軟件上。這些任務(wù)邊界清晰,調(diào)用頻次有上限,Token大多流轉(zhuǎn)于數(shù)字世界之內(nèi)。
但具身智能體不同。它在物理世界中持續(xù)運(yùn)行,每時(shí)每刻都在感知環(huán)境、理解任務(wù)、規(guī)劃動(dòng)作、執(zhí)行反饋,并根據(jù)結(jié)果不斷修正下一步行動(dòng)。
具身智能體的任務(wù)空間,是數(shù)字世界與物理世界的總和,面對(duì)的是連續(xù)的、多模態(tài)的、充滿不確定性的輸出。
因此,未來(lái)最大的Token消耗者,將是現(xiàn)實(shí)世界中的具身機(jī)器人——它既是執(zhí)行器,也是流量入口;既是勞動(dòng)者,也是模型連接物理世界的端口。

這也不只是我們一家的判斷,整個(gè)行業(yè)都在發(fā)生類似的集體轉(zhuǎn)向。
特斯拉強(qiáng)調(diào)規(guī)模化量產(chǎn),計(jì)劃年底實(shí)現(xiàn)數(shù)千臺(tái)量產(chǎn),而我們目前走在其前面;NVIDIA也在推動(dòng)物理世界智能進(jìn)入生態(tài)建設(shè)階段,背后邏輯很清晰——GPU算力的下一個(gè)增長(zhǎng)極,可能不在數(shù)據(jù)中心,而在真實(shí)的物理世界。
就連以技術(shù)炫技著稱的波士頓動(dòng)力,近來(lái)也開(kāi)始聚焦商業(yè)價(jià)值的創(chuàng)造——資本已不再為單純的demo買單,真實(shí)場(chǎng)景下的落地價(jià)值才是關(guān)鍵。
我們內(nèi)部用一條“XYZ曲線”來(lái)描述具身智能產(chǎn)業(yè)的發(fā)展階段。

X曲線是過(guò)去兩年大家熟悉的階段——機(jī)器人跳舞、表演、展示情緒價(jià)值。這一階段體現(xiàn)的是基礎(chǔ)技術(shù)突破,驗(yàn)證了底層可能性,但價(jià)值天花板相對(duì)較低。
接下來(lái)我們將進(jìn)入Y曲線,即“部署態(tài)”的成長(zhǎng)期。
這一階段的重點(diǎn)是:機(jī)器人不只是能動(dòng),還要能干活。它將進(jìn)入交互智能與作業(yè)智能的場(chǎng)景化部署階段,數(shù)據(jù)飛輪開(kāi)始形成,生產(chǎn)力價(jià)值真正得以體現(xiàn)。
大約5年后,我個(gè)人預(yù)計(jì)將進(jìn)入Z曲線的普及期。屆時(shí),數(shù)據(jù)量將實(shí)現(xiàn)量變到質(zhì)變,具身智能將迎來(lái)類似大語(yǔ)言模型“GPT時(shí)刻”的突破,最終走向群體智能與更高水平的價(jià)值創(chuàng)造。
基于上述判斷,智元成立三年來(lái),一直在探索如何打通數(shù)字世界與物理世界之路,并由此提出了獨(dú)有的“三智一體”范式。
具身智能的實(shí)現(xiàn),不能依賴單一技術(shù)突破,而需要四個(gè)維度的協(xié)同:
本體決定了能進(jìn)入什么場(chǎng)景——雙足機(jī)器人適合與人交互,輪式機(jī)器人在安全性、效率與成本上更適合工廠應(yīng)用,四足機(jī)器人則適合特種場(chǎng)景。
我們擁有多形態(tài)本體,但它們基于同一套平臺(tái)框架構(gòu)建。
運(yùn)動(dòng)智能決定機(jī)器人能否在開(kāi)放環(huán)境中穩(wěn)定、可靠、高效地運(yùn)行。這是基礎(chǔ)智能,是一切上層能力的前提。
作業(yè)智能決定機(jī)器人能否創(chuàng)造勞動(dòng)生產(chǎn)力價(jià)值,是商業(yè)化的核心。機(jī)器人必須能夠自主閉環(huán)地完成搬運(yùn)、裝配、取放等具體任務(wù),而且要做得比人更快、更穩(wěn)、成本更低。
交互智能決定機(jī)器人能否順暢融入人類的工作流與服務(wù)流。機(jī)器人并非孤立存在,它需要與人協(xié)作、溝通、理解意圖。沒(méi)有交互智能,機(jī)器人永遠(yuǎn)只是工具,無(wú)法成為人類的伙伴。

目前,智元是全球唯一同時(shí)具備這四層全棧能力、且完成超過(guò)萬(wàn)臺(tái)量產(chǎn)的機(jī)器人公司——這一進(jìn)度甚至走在特斯拉前面。
在本體布局上,智元已形成多形態(tài)系列化矩陣:全尺寸的“遠(yuǎn)征系列”雙足機(jī)器人,中尺寸/半尺寸人形(去年單款出貨超過(guò)5000臺(tái)),面向工業(yè)制造的輪式機(jī)器人,以及四足機(jī)器人。
過(guò)去,機(jī)器人行業(yè)長(zhǎng)期存在實(shí)驗(yàn)室能力與量產(chǎn)能力之間的巨大落差——一臺(tái)樣機(jī)能跑,不代表1000臺(tái)能穩(wěn)定交付;1000臺(tái)能交付,也不代表10000臺(tái)能保持產(chǎn)品的穩(wěn)定性與一致性。
為此,我們非常重視量產(chǎn)驗(yàn)證,從2023年的幾臺(tái)樣機(jī),到2024年突破1000臺(tái),到去年底的5000臺(tái),到本月底即將突破15000臺(tái)。

這背后真正檢驗(yàn)的,是系統(tǒng)工程能力——供應(yīng)鏈與制造一致性是否可控,質(zhì)量體系是否能夠支撐。機(jī)器人要成為生產(chǎn)力基礎(chǔ)設(shè)施,必須首先成為可靠的工業(yè)品。
在商業(yè)化推進(jìn)方面,我們不是一上來(lái)就挑戰(zhàn)最復(fù)雜的任務(wù)(比如家庭保姆),而是沿著“環(huán)境復(fù)雜度”與“任務(wù)復(fù)雜度”兩個(gè)維度逐步升級(jí)。
2024年,我們從接待講解、科研教育、數(shù)據(jù)采集等相對(duì)簡(jiǎn)單的場(chǎng)景切入;2025年,開(kāi)始進(jìn)入安防巡檢、物流分揀、工業(yè)制造等高價(jià)值場(chǎng)景。
在三智能力進(jìn)展方面:

運(yùn)動(dòng)智能方面,我們推出了自研的運(yùn)動(dòng)基座模型BFM-2,核心思想是讓機(jī)器人的“小腦”不再學(xué)單一動(dòng)作,而是學(xué)習(xí)統(tǒng)一的泛化動(dòng)作分布,實(shí)現(xiàn)高效、實(shí)時(shí)、高魯棒性的動(dòng)態(tài)動(dòng)作執(zhí)行。
此外,我們的生成式運(yùn)動(dòng)模型,可以根據(jù)語(yǔ)音或上下文指令,讓機(jī)器人自主生成配套肢體語(yǔ)言;感控一體模型AGILE則將動(dòng)作與視覺(jué)感知端到端結(jié)合,快速響應(yīng)環(huán)境變化。
作業(yè)智能方面,我們的核心是讓機(jī)器人從“理解任務(wù)”走向“完成任務(wù)”。
我們推出了AGIBOT WORLD(真實(shí)世界數(shù)據(jù)平臺(tái))、Genie Sim(基于世界模型的仿真與評(píng)測(cè)系統(tǒng))、自研VLA基座模型,以及SOP在線分布式強(qiáng)化學(xué)習(xí)系統(tǒng),讓機(jī)器人在真實(shí)部署中實(shí)現(xiàn)自我閉環(huán)、自我糾錯(cuò)與自我進(jìn)化。
我們用真實(shí)世界產(chǎn)數(shù)據(jù)→仿真訓(xùn)練→模型輸出→真實(shí)執(zhí)行→數(shù)據(jù)反饋,最終形成完整的數(shù)據(jù)飛輪。
我們的模型能力在各項(xiàng)權(quán)威基準(zhǔn)上,均超越了海外標(biāo)桿(Physical Intelligence的π0.5及Root),世界模型也登頂WorldArena榜首。

一個(gè)典型案例是江西南昌龍旗的平板生產(chǎn)線,具體工作需要將易碎的平板玻璃精細(xì)放入工裝夾具。
傳統(tǒng)工業(yè)機(jī)械臂因軌跡化編程無(wú)法勝任,過(guò)去只能依賴工人手感操作。我們通過(guò)數(shù)據(jù)驅(qū)動(dòng)方式,實(shí)現(xiàn)了接近100%的成功率,且節(jié)拍快于人工,目前正在進(jìn)行7×24小時(shí)直播驗(yàn)證。
交互智能方面,我們推出了機(jī)器人原生的端到端交互模型WITA-Omni。
區(qū)別于將視覺(jué)、語(yǔ)音、動(dòng)作分割處理的傳統(tǒng)方案,WITA-Omni將看、聽(tīng)、說(shuō)、動(dòng)全部端到端融合訓(xùn)練,讓機(jī)器人真正成為有連續(xù)存在感、在場(chǎng)感、人格感的智能體,而非一個(gè)會(huì)說(shuō)話的音箱。
我們將其定位為“靈犀”產(chǎn)品線,認(rèn)為人形機(jī)器人將是人機(jī)交互的終極形態(tài)——
從一維文本命令行,到二維圖形界面,再到三維具身實(shí)體,人機(jī)交互的下一次革命將發(fā)生在人形機(jī)器人上。目前已在安踏、海底撈等客戶及地鐵場(chǎng)景實(shí)際運(yùn)營(yíng),今年下半年將大規(guī)模推廣。

封閉生態(tài)無(wú)法支撐繁榮的產(chǎn)業(yè)發(fā)展。我們持續(xù)推進(jìn)開(kāi)源工作,包括最大的具身數(shù)據(jù)集、作業(yè)開(kāi)發(fā)平臺(tái)、Go系列VLA基礎(chǔ)模型等,目前已吸引超過(guò)2萬(wàn)名開(kāi)發(fā)者、累計(jì)下載量超過(guò)100萬(wàn)次。
在生態(tài)技術(shù)體系層面,我們推出了業(yè)界首個(gè)開(kāi)放完整的具身智能生態(tài)技術(shù)架構(gòu)AIMA(AI Machine Architecture),以統(tǒng)一架構(gòu)融合三智一體,構(gòu)建開(kāi)放標(biāo)準(zhǔn)化的具身智能開(kāi)發(fā)與應(yīng)用生態(tài)。
底層我們還在構(gòu)建具身時(shí)代原生操作系統(tǒng)“靈渠OS”——之前我在華為工作過(guò),操作系統(tǒng)被卡脖子的教訓(xùn)讓我意識(shí)到,宜早不宜晚,我們現(xiàn)在就開(kāi)始布局。
4月17日,我們正式啟動(dòng)智元原生生態(tài)發(fā)展計(jì)劃,未來(lái)5年投入22億元(今年已投入超過(guò)1億元),涵蓋科技創(chuàng)新與教育人才培養(yǎng),希望集合各方力量共建生態(tài)基礎(chǔ)設(shè)施。

在商業(yè)模式上,我們今年推出了機(jī)器人租賃模式——我們叫RaaS(Robot as a Service)。
其實(shí)就像雇傭人類員工,買的是他的工作時(shí)間,而非買斷其人生;同理,隨著機(jī)器人智能化作業(yè)能力的提升,租賃將成為未來(lái)機(jī)器人落地部署的主流模式。
我們通過(guò)子公司擎天租,將逐步構(gòu)建全球化的機(jī)器人租賃網(wǎng)絡(luò)。

最后,在過(guò)去幾年,智元主要做了三件事:
第一,用多形態(tài)本體與超萬(wàn)臺(tái)量產(chǎn)驗(yàn)證,將具身智能從實(shí)驗(yàn)室推向工業(yè)與生產(chǎn)生活;
第二,用運(yùn)動(dòng)智能、作業(yè)智能、交互智能與真實(shí)場(chǎng)景數(shù)據(jù)閉環(huán),將單點(diǎn)demo推向可部署、可復(fù)制的真實(shí)場(chǎng)景落地;
第三,通過(guò)開(kāi)源數(shù)據(jù)集、基礎(chǔ)模型、操作系統(tǒng)等生態(tài)開(kāi)放,將公司內(nèi)部能力轉(zhuǎn)化為行業(yè)可復(fù)用、可共建的基礎(chǔ)能力。
這件事不是一家公司能唱的獨(dú)角戲,需要機(jī)器人公司、模型公司、運(yùn)營(yíng)商、云服務(wù)商、行業(yè)客戶、開(kāi)發(fā)者與全球生態(tài)合作伙伴共同參與。
智元希望以三智一體的全棧能力、部署態(tài)的數(shù)據(jù)飛輪和開(kāi)放生態(tài),與大家一起推動(dòng)具身智能從技術(shù)階段走向真正的規(guī)模部署,共同開(kāi)啟物理世界智能基礎(chǔ)設(shè)施的新階段。
— 聯(lián)系作者 —
— 完 —
【智能車參考】原創(chuàng)內(nèi)容,未經(jīng)賬號(hào)授權(quán),禁止隨意轉(zhuǎn)載。
點(diǎn)這里??關(guān)注我,記得標(biāo)星,么么噠~