
要點
人形機器人正在推動機器視覺從單純的檢測工具,演進為物理AI(Physical AI)的“感知神經系統”。隨著人形機器人逐步從概念驗證(PoC)階段邁向真實工業和商業場景部署,視覺感知正迅速成為最關鍵的基礎使能技術之一。
與在固定且可預測環境中運行的傳統工業機器人不同,人形機器人必須持續感知、理解并響應動態變化的周圍環境,同時在與人類協同工作的過程中確保安全性。這意味著機器人不僅需要“看見”世界,更需要實時理解場景、識別目標、判斷意圖并做出相應決策。視覺系統因此成為連接物理世界與人工智能決策能力的核心橋梁,也是實現物理AI的重要感知層。
人形機器人純視覺與多模態傳感融合方案對比
當前行業在人形機器人視覺感知領域正逐步收斂至兩大主要技術路線:純視覺(Pure Vision)與多模態傳感融合(Multimodal Sensor Fusion)。盡管這兩種架構都以實現空間智能與自主決策為目標,但它們在成本、規模化能力、AI集成方式以及系統魯棒性等方面,代表著截然不同的技術理念。
以純視覺AI架構推動人形機器人感知能力規模化
純視覺方案主要依賴多個2D RGB攝像頭,并結合AI模型來估計深度、重建環境以及理解運動。通過去除激光雷達(LiDAR)并降低對專用深度傳感器的依賴,該架構顯著降低了硬件復雜度、成本、功耗以及系統集成難度。
純視覺方案也天然契合端到端AI學習框架。隨著人形機器人開發者不斷追求通用具身智能(Embodied AI)以及基于視覺-語言-動作模型(VLA)的自主能力,這一方向的重要性正持續提升。然而,該方案的代價同樣明顯:純視覺架構對GPU與NPU算力提出極高要求,同時需要海量訓練數據、仿真基礎設施以及實時推理優化能力。此外,由于人形機器人頭部結構限制,雙目基線較短,也進一步制約了深度精度與遠距離感知能力。
目前,包括特斯拉(Tesla)、傅利葉智能(Fourier Intelligence)以及優必選(UBTECH)在內的多家領先人形機器人廠商正在積極推進這一技術路線。其中,特斯拉Optimus是AI原生人形機器人感知體系的典型代表。Optimus采用源自特斯拉自動駕駛(FSD)系統的八攝像頭感知架構,并利用占據網絡(Occupancy Networks)對可見及部分遮擋環境進行實時重建。
特斯拉的優勢不僅體現在傳感器層面,更在于其將多年自動駕駛領域積累的核心能力整體遷移至人形機器人領域,包括仿真系統、PB級視頻數據集、標注流程、占據網絡架構以及神經網絡訓練框架等。
同時,特斯拉自研Dojo D1訓練芯片及Dojo超級計算機的引入,進一步凸顯出行業的一個關鍵趨勢:未來人形機器人的競爭力,可能越來越取決于具身AI的訓練規模與數據飛輪能力,而不僅僅是單一傳感器配置。
這一趨勢也反映出自動駕駛技術棧與人形機器人生態正在加速融合。包括占據式建圖、邊緣AI加速、仿真系統、傳感融合以及低延遲感知計算在內的核心技術,正在成為兩大行業共同的基礎能力。
多模態傳感融合在人形機器人中的作用
第二類主要感知架構是多模態傳感融合方案,該方案將RGB(紅、綠、藍)攝像頭與多種3D感知技術相結合,包括雙目視覺、結構光、飛行時間(ToF)以及激光雷達(LiDAR)。該類系統不再完全依賴基于2D視頻流的AI推理,而是通過融合多種感知模態,以提升系統的魯棒性、冗余能力以及環境感知水平。
然而,這類架構也帶來了顯著的復雜性。隨著感知模態數量的增加,標定、時間同步、延遲管理、控制回路穩定性以及多模態數據融合等問題都會變得更加復雜。更重要的是,異構傳感架構可能會增加端到端策略學習的難度,并降低基于視覺-語言-動作模型(VLA)的自主系統效率。
Omdia認為,在近期至中期階段,多模態傳感融合仍將是工業級人形機器人不可或缺的技術路徑。與純視覺方案相比——后者即便在單攝像頭深度估計中也需要大量算力——多模態融合架構能夠更高效地實現邊緣端處理,并將數據順暢傳輸至GPU平臺進行計算。此外,多攝像頭配置會指數級增加純視覺方法的計算負擔,從而進一步凸顯多模態方案在工程落地中的優勢。
分布式感知架構:頭部、手部與軀干視覺系統
與傳統機器人不同,人形機器人越來越需要采用分布式感知架構,以適配不同的操作任務與工作場景。



領先人形機器人OEM的感知棧垂直整合趨勢
多家領先的人形機器人開發商正逐步構建自有的感知架構,而不再完全依賴第三方視覺供應商。
特斯拉(Tesla)強調垂直整合的純攝像頭AI感知體系。
Figure AI開發了Helix 02視覺-運動神經網絡,將所有機載傳感器直接連接至執行器。
傅利葉智能(Fourier Intelligence)將視覺、聽覺與觸覺感知融合為完整的多感官交互系統。
波士頓動力(Boston Dynamics)持續為Atlas開發專有感知軟件。
優必選(UBTECH)開發了被動式雙目視覺系統,能夠實時生成高密度深度圖。
這一趨勢表明,人形機器人感知系統正逐步從“碎片化組件市場”向高度集成的全棧生態體系演進。視覺供應商也正在積極布局這一人形機器人發展機遇。隨著具身智能的快速增長,全球視覺與傳感器供應鏈正迎來新的重要機會窗口。

許多供應商正從視覺相機硬件方案轉向集成式感知平臺,將傳感、標定、同步、嵌入式AI以及機器人軟件能力整合為一體。
人形機器人市場正在推動傳統機器視覺供應商從以檢測為核心的解決方案,向具身AI(Embodied AI)平臺轉型。康耐視(Cognex)、基恩士(Keyence)、Photoneo、Zivid以及Basler等公司,正積極拓展至視覺引導操作、機器人引導、自主移動機器人(AMR)、邊緣AI視覺以及緊湊型3D傳感等領域。
然而,競爭格局正在快速變化。人形機器人OEM廠商越來越傾向于采用高度集成的感知生態系統,而非單一視覺相機或孤立算法。能夠提供同步多傳感器架構、嵌入式計算能力、標定工具、機器人中間件,以及GMSL(千兆多媒體串行鏈接)或FPD-Link(平板顯示數據鏈路)接口和AI加速能力的供應商,將更有可能獲得戰略優勢。相反,如果傳統機器視覺廠商無法向更廣義的物理AI生態系統供應商轉型,將面臨被逐步 “硬件化”和商品化的風險。
邊緣AI半導體對人形機器人空間智能的影響
人形機器人自主能力的演進,正越來越依賴于新一代AI半導體的發展。這些芯片專為邊緣端推理、多模態融合以及實時感知加速而優化,是支撐機器人空間智能能力提升的關鍵基礎設施。
多家半導體廠商正在積極布局這一機遇:
三星電子(Samsung Electronics)正在開發具備AI能力的人形機器人圖像傳感器
安森美半導體(Onsemi)推出Hyperlux HDR圖像傳感器,針對復雜光照環境進行優化
安霸(Ambarella)專注于低功耗邊緣AI感知SoC
意法半導體(STMicroelectronics)與Leopard Imaging聯合開發面向人形機器人的多模態視覺模組
萊迪思半導體(Lattice Semiconductor)聚焦機器人低功耗傳感融合架構
這些布局顯示出,半導體產業正在圍繞人形機器人空間智能加速構建專用AI感知基礎設施。
競爭格局正加速向低功耗邊緣AI處理、多模態融合以及實時感知加速方向演進。下一階段的競爭護城河不再只是傳感器本身,而是空間智能能力(spatial intelligence)。盡管技術進展迅速,行業仍面臨多項尚未解決的關鍵挑戰:人形機器人在長期運行穩定性、動態光照適應、運動模糊與振動干擾,以及機器人行進過程中的實時感知能力方面仍存在明顯不足。
與此同時,行業正朝著感知、仿真、AI算力與運動控制基礎設施更緊密融合的方向發展。根據Omdia預測,到2030年,通用型具身智能機器人出貨量將超過44.6萬臺,將帶動超過220萬顆RGB/3D機器視覺相機以及40萬余顆激光雷達(LiDAR)的需求。
然而,長期來看,行業勝出者未必是擁有最佳機器視覺相機或深度傳感器的企業,而更可能是具備完整物理AI平臺能力的廠商,其核心優勢體現在以下方面的系統整合:
AI原生感知能力
多模態傳感融合
仿真能力
運營數據飛輪
低功耗邊緣AI計算
運動控制系統
視覺-語言-動作(VLA)模型
在物理AI時代,“感知”不再只是“看見世界”,而是“驅動自主行動”的能力。因此,人形機器人視覺市場正在從單一組件競爭,演進為圍繞全棧空間智能的系統性競爭。
Omdia《人形機器人的視覺感知》報告提供了全面的分析與預測,幫助客戶把握人形機器人視覺、傳感與物理AI感知市場的演進趨勢。
本文作者

沈悅沁
(Yueqin Shen)
分析師,制造技術
文章版權和解釋權歸微信平臺Omdia所有


Omdia隸屬于Informa TechTarget, Inc. d/b/a Informa TechTarget(納斯達克代碼:TTGT),是一家全球領先的技術研究與咨詢機構。依托對科技市場的深刻洞察、與行業領導者的深入對話以及龐大數據資源,Omdia幫助客戶洞察趨勢、把握機遇,搶占市場先機。從研發到投資回報,我們識別最具潛力的機遇,推動科技產業持續發展。
omdia.com.cn
Joyce.Liu@omdia.com
