--關注、星標「智駕最前沿」、回復“40429”--
↓↓免費領取:《汽車駕駛自動化分級》(GB/T 40429-2021)↓↓
后臺回復:原稿5,即可獲取:本文英文版pdf文件
自動駕駛社區見證了采用端到端算法框架的方法的快速增長,這種框架利用原始傳感器輸入生成車輛軌跡規劃,而不是專注于單獨的任務如檢測和運動預測。與模塊化流水線相比,端到端系統受益于感知和規劃的聯合特征優化。由于大規模數據集的可用性、閉環評估以及自動駕駛算法在復雜場景中有效表現的日益需求,該領域得到了蓬勃發展。
在這篇綜述中,我們對270多篇論文進行了全面分析,涵蓋了端到端自動駕駛的動機、路線圖、方法論、挑戰和未來趨勢。深入探討了幾個關鍵挑戰,包括多模態、可解釋性、因果混淆、穩健性和世界模型等。此還此外討論了基礎模型和視覺預訓練的當前進展,以及如何將這些技術整合到端到端駕駛框架中,作者維護了一個活躍的資源庫,其中包含最新文獻和開源項目,地址為:https://github.com/OpenDriveLab/End-to-end-Autonomous-Driving。

主要貢獻
傳統自動駕駛系統采用模塊化設計,每個功能模塊(如感知、預測、規劃)獨立開發并集成。規劃模塊通過復雜的基于規則的設計生成轉向和加速輸出,但在處理多變的道路情況時效果不佳。因此,趨勢是利用大規模數據和基于學習的規劃方法。端到端自動駕駛系統使用原始傳感器數據生成計劃和控制動作,進行聯合和全局優化。

圖1:綜述概覽。(a) 將端到端自動駕駛定義為一種基于學習的算法框架,以原始傳感器輸入和規劃/控制輸出為基礎。作者深入研究了270多篇論文,并將其分類為模仿學習(IL)和強化學習(RL)。(b) 基準測試。將流行的基準測試分為閉環和開環評估,分別介紹了閉環模擬的各個方面以及開環評估的局限性。(c) 挑戰。這是我們工作的主要部分,作者列出了多個主題的關鍵挑戰,并深入分析了這些問題的重要性,同時也討論了這些挑戰的潛在解決方案。(e) 未來趨勢。討論了端到端范式如何通過基礎模型和視覺預訓練等快速發展的技術獲益。
圖2展示了端到端自動駕駛關鍵成就的時間軸,每一部分都標志著重要的范式轉變或性能提升。2021年左右發生了重要的轉折點,隨著在合理計算預算內可用的多樣傳感器配置,研究重點轉向了結合更多模態和先進架構,如Transformers以捕捉全局上下文和代表性特征。

圖2:端到端自動駕駛路線圖
我們按時間順序展示了關鍵里程碑,將相似的工作歸類在同一主題下。
總結來說,本綜述有三個主要貢獻:
(a) 首次對端到端自動駕駛進行了全面分析,包括高層次的動機、方法論、基準測試等。我們提倡設計整體算法框架的理念,而不是優化單一模塊,最終目標是實現安全和舒適的駕駛。
(b) 廣泛調查了當前方法面臨的關鍵挑戰,在調查的250多篇論文中,總結了主要方面并提供了深入分析,包括泛化性、語言引導學習、因果混淆等話題。
(c) 探討了如何接受大型基礎模型和數據引擎的更廣泛影響。我們相信,這一研究方向及其提供的大規模高質量數據將顯著推動該領域的發展。為了促進未來的研究,作者維護了一個活躍的資源庫,定期更新新文獻和開源項目。

內容概述
端到端的三種流行范式。行為克隆(BC):展示行為克隆如何基于監督學習原則訓練模型,以模仿專家的行動。逆優化控制(IOC):說明逆優化控制或逆強化學習如何從專家示范中學習獎勵函數,以指導決策過程。在線強化學習:展示強化學習方法如何通過與環境交互迭代學習最優策略,可能使用策略梯度或Q學習等技術。每種范式通常會伴隨解釋性的注解或標題,描述它們在端到端自動駕駛背景下的工作原理和區別。

圖3: 端到端自動駕駛方法概覽。這里展示了三種流行的范式,包括兩種模仿學習框架(行為克隆和逆優化控制),以及在線強化學習

基準測試
自動駕駛系統需要全面的評估來確保安全。研究人員必須使用適當的數據集、仿真器、評估指標和硬件對這些系統進行基準測試。這里闡述了三種用于基準測試端到端自動駕駛系統的方法:
(1)真實世界評估;
(2)仿真中的在線或閉環評估;
(3)駕駛數據集上的離線或開環評估。
作者側重于可擴展和基于原則的在線仿真設置,并總結了真實世界和離線評估,以確保全面性。
真實世界評估:早期自動駕駛基準測試的努力包括實際環境評估。值得注意的是,DARPA啟動了一系列賽事推動自動駕駛技術的發展。首次賽事提供了100萬美元的獎金,要求車輛自主導航穿越莫哈韋沙漠的240公里路線,然而沒有任何團隊成功完成。最終系列賽事被稱為DARPA城市挑戰賽,要求車輛在一個模擬的96公里城鎮賽道上行駛,遵守交通法規并避開障礙物。這些賽事促進了自動駕駛領域的重要發展,如LiDAR傳感器的應用。秉承這一精神,密歇根大學建立了MCity,一個大型的控制實際環境,旨在促進自動駕駛車輛的測試。除了學術項目外,那些有能力部署無人駕駛車隊的產業也依賴于實際世界評估來基準測試其算法的改進。
在線/閉環仿真:在實際世界中測試自動駕駛系統成本高且風險大。為應對這一挑戰,仿真是一個可行的替代方案。仿真器可以促進快速原型設計和測試,快速迭代創意,并以低成本提供多樣化場景進行單元測試。此外仿真器還提供了準確測量性能的工具。然而它們的主要缺點是,在仿真環境中獲得的結果不一定能推廣到現實世界。閉環評估涉及構建一個模擬實際駕駛環境的仿真環境。評估過程中,在仿真中部署駕駛系統并測量其性能。系統必須在安全通過交通的同時,向指定目標位置前進。開發此類仿真器主要涉及四個子任務:參數初始化、交通仿真、傳感器仿真和車輛動態仿真。
參數初始化和交通仿真利用程序生成和數據驅動的方法來創建仿真環境和模擬交通行為。
傳感器仿真采用基于圖形和數據驅動的方法生成逼真的傳感器數據。
車輛動態仿真通過更準確的物理建模來實現現實世界的運動模擬。
基準測試通過多個基準測試和仿真器來評估端到端自動駕駛系統的性能,確保其在現實世界中的魯棒性和安全性。
離線/開環評估:開環評估主要通過與預先記錄的專家駕駛行為對比來評估系統的性能。該方法需要評估數據集,包括:(1) 傳感器讀數,(2) 目標位置,(3) 對應的未來駕駛軌跡,通常由人類駕駛員提供。以傳感器輸入和目標位置為輸入,通過比較系統預測的未來軌跡與駕駛日志中的軌跡來衡量性能。系統的評估基于其軌跡預測與人類真實值的匹配程度,以及與其他代理碰撞的概率等輔助指標。開環評估的優點是使用現實交通和傳感器數據,易于實現,因為它不需要模擬器。然而,其主要缺點是它無法衡量系統在部署期間遇到的實際測試分布中的性能。在測試過程中,駕駛系統可能偏離專家駕駛走廊,因此需要驗證系統從這種偏離中恢復的能力。此外在多模態場景中,預測軌跡與記錄軌跡之間的距離并不是理想的指標。例如,在并入轉向車道的情況下,立即并入或稍后并入兩種選擇都可能是有效的,但開環評估會對數據中未觀察到的選項進行懲罰。因此,除了測量碰撞概率和預測誤差外,還提出了一些指標以涵蓋更全面的方面,如交通違規、進展和駕駛舒適度。這種方法需要從綜合的軌跡數據集中抽取數據。最常用的數據集包括nuScenes、Argoverse、Waymo和nuPlan。所有這些數據集都包含大量現實世界駕駛軌跡,難度不一。


感知與輸入模態的困境
感知:雖然早期的研究通過單目相機實現了車道跟隨,但這種單一輸入模態無法應對復雜的駕駛場景。因此,現代自動駕駛車輛引入了多種傳感器,如RGB相機提供豐富的語義細節,LiDAR和立體相機提供精確的3D空間信息,而毫米波雷達和事件相機在捕捉物體相對運動方面表現優越。此外,車輛狀態信息(如速度計和IMU)和導航指令也是關鍵輸入。由于各傳感器具有不同的視角、數據分布和成本,設計合理的傳感器布局并實現有效融合成為一大挑戰。
多傳感器融合:在感知領域(如目標檢測和語義分割),多傳感器融合被廣泛研究,通常分為早期、中期和晚期融合。端到端自動駕駛算法也采用類似的融合方法。早期融合在傳感器輸入送入共享特征提取器之前進行融合,常見方法是拼接。中期融合在網絡內部實現,通過分別編碼輸入并在特征層進行融合。晚期融合則結合來自多模態的多個結果,但由于性能較差,較少被討論。最近的研究采用Transformer來建模特征間的交互,其注意力機制在聚合不同傳感器輸入的上下文信息方面表現出色。未來的發展方向包括在統一空間(如鳥瞰圖)中建模多模態輸入,并采用更先進的Transformer融合機制。

圖4:輸入模態和融合策略的示例。不同模態具有不同的特性,導致有效傳感器融合面臨挑戰
語言作為輸入
人類駕駛不僅依賴視覺感知,還依靠內在知識,這些共同形成了因果行為。在自動駕駛相關領域(如具身AI),將自然語言作為細粒度的知識和指令來控制視覺運動代理取得了顯著進展。然而,駕駛任務相對更直接,不需要任務分解,同時戶外環境更復雜,動態主體眾多,缺乏明顯的錨點來進行定位。為了將語言知識納入駕駛任務,一些數據集被提出用于基準測試戶外定位和視覺語言導航任務。最近的研究利用大語言模型(LLMs)來處理復雜指令和泛化不同數據域,盡管在實際駕駛中應用LLMs仍面臨挑戰,如推理時間長、定量精度低和輸出不穩定。潛在的解決方案包括將LLMs用于云端處理復雜場景,僅用于高層次行為預測。
依賴視覺抽象挑戰
端到端自動駕駛系統大致分為兩個階段:將狀態編碼為潛在特征表示,然后用中間特征解碼駕駛策略。在城市駕駛中,輸入狀態(即周圍環境和自車狀態)比常見的策略學習基準(如電子游戲)更加多樣且高維,這可能導致表示與策略制定所需的關注區域不對齊。因此,設計“良好”的中間感知表示或首先通過代理任務預訓練視覺編碼器是有幫助的。這樣可以使網絡有效提取駕駛所需的信息,從而促進后續的策略階段。此外,這還可以提高強化學習方法的樣本效率。
表示方式設計。簡單表示是指通過各種骨干網絡提取。經典的卷積神經網絡(CNNs)在平移等變性和高效性方面仍然占優勢。經過深度預訓練的CNNs顯著提升了感知和下游性能。相比之下,基于Transformer的特征提取器在感知任務中展示了很好的可擴展性,但尚未廣泛用于端到端駕駛。駕駛特定表示指研究人員引入了鳥瞰圖(BEV)概念,將不同傳感器模態和時間信息融合到統一的3D空間中。這也促進了下游任務的簡單適應。
此外基于網格的3D占用被開發用于捕捉不規則物體并在規劃中用于避免碰撞,然而,與BEV方法相比,密集表示帶來了巨大的計算成本。地圖表示是指傳統的自動駕駛依賴高清地圖(HD Maps)。由于高清地圖的高成本,可用性,在線映射方法被設計成不同的形式,如BEV分割、矢量化車道線、中心線及其拓撲和車道段。然而最適合端到端系統的形式尚未得到驗證。
盡管各種表示設計提供了如何設計后續決策過程的可能性,但它們也帶來了挑戰,因為需要共同設計這兩個部分。除此之外考慮到在擴大訓練資源的若干簡單而有效的方法中觀察到的趨勢,明確表示(如地圖)的最終必要性是不確定的。
表示學習通常包含某些歸納偏差或先驗信息。在所學表示中不可避免地存在可能的信息瓶頸,且與決策無關的冗余上下文可能會被刪除。
語義分割表示:一些早期方法直接使用現成網絡的語義分割掩碼作為后續策略訓練的輸入表示。SESR通過VAE將分割掩碼編碼為類別解耦表示。預測的通行指示器(如紅綠燈狀態、車道中心的偏移量和到前車的距離)被用作策略學習的表示。
中間特征表示:一些人選擇從預訓練任務的中間特征作為強化學習訓練的有效表示。在VAE中的潛在特征通過從分割和深度圖的擴散邊界獲得的注意力圖進行增強,以突出重要區域。TARP利用一系列先前任務的數據進行不同任務相關的預測任務,以獲取有用的表示。ACO通過在對比學習結構中添加轉向角分類來學習判別特征。
最近PPGeo提出通過運動預測和深度估計在未經校準的駕駛視頻上以自監督方式學習有效表示。ViDAR利用原始圖像點云對,并通過點云預測任務預訓練視覺編碼器。這些工作表明,從大規模未標注數據中進行自監督表示學習以進行策略學習是有前途的,值得未來探索。
在模型化強化學習中的世界建模復雜性挑戰
深度強化學習在自動駕駛中面臨高樣本復雜性的問題,而基于模型的強化學習(MBRL)通過允許代理與學習的世界模型交互,提供了提高樣本效率的方向。世界模型包括轉移動態和獎勵函數,特別適用于慢速仿真器如CARLA。
然而,建模高度動態的駕駛環境仍然是一個挑戰,各種簡化方法如非反應性世界模型或概率順序潛在模型被提出。為了解決學習的世界模型可能存在的不準確性,研究采用了輟學正則化和多模型集成等方法。盡管在原始圖像空間中學習世界模型具有挑戰性,例如可能會忽略交通燈等重要細節,但通過像Dreamer等方法將視覺動態分解為可控和不可控狀態,可以有效訓練策略。總體而言,端到端自動駕駛的世界模型學習是一個新興且有前景的方向,需要進一步研究以確定需要建模的內容和如何有效地建模世界,特別是考慮到駕駛環境的復雜性和動態性。
多任務學習在端到端自動駕駛中的關鍵性依賴和挑戰
多任務學習通過共享表示來同時執行多個相關任務,包括語義分割、深度估計和3D物體檢測等,以減少計算成本、共享領域知識,并提升模型的泛化能力。對于端到端駕駛來說,這種方法尤其有利,因為它要求模型對環境有全面的理解才能進行最終的策略預測。
然而,優化不同任務的組合和損失加權以達到最佳性能是一個顯著的挑戰,尤其是在面對稀疏信號和高度動態的駕駛環境時。此外,構建大規模數據集以支持多種高質量注釋的對齊仍然是一個重要的問題,因為當前模型在多任務學習方面的依賴性需要更深入的研究和解決。
低效專家與策略蒸餾挑戰
模仿學習及其主要子類行為克隆,是一種簡單的監督學習方法,旨在模仿專家行為,通常采用“師生”范式。挑戰主要包括兩個方面:首先,像CARLA提供的手工制定的專家自動駕駛員并非完美駕駛員,盡管可以訪問周圍代理的地面真實狀態和地圖;其次,學生只能通過傳感器輸入監督學習,需要同時提取感知特征并從零開始學習策略。部分研究建議將學習過程分成兩個階段:首先訓練更強大的師傅網絡,然后通過策略蒸餾將知識傳遞給學生。
例如,Chen等人利用特權代理學習環境狀態下的行動,然后通過輸出蒸餾讓傳感器運動代理近似特權代理。此外,一些方法在特征級別進行知識蒸餾,如利用分割和光流模型作為輔助教師來指導特征訓練。盡管研究人員致力于設計穩健的專家并在多個層次上傳遞知識,但師生范式仍面臨蒸餾效率低下的問題。例如,特權代理能夠訪問交通燈的地面真實狀態,但由于這些細節在預測圖像中很難蒸餾,導致視覺運動代理與特權代理之間存在顯著性能差距。
解釋能力的缺乏
首先,針對訓練好的端到端駕駛模型(通常被稱為“黑盒子”),可以采用事后的可解釋人工智能(X-AI)技術,如顯著性圖,來揭示模型在視覺輸入中主要依賴的區域。然而,這些技術提供的信息有限,其有效性和有效性難以評估。其次,直接增強模型設計中的解釋性是另一種策略。例如,注意力機制通過學習的注意力權重從中間特征圖中聚合重要特征,提供了一定程度的解釋性。這些方法能夠顯示模型在決策過程中關注的重要區域,但其忠實度和實用性仍受到限制。
此外,許多基于模仿學習的方法通過將潛在特征表示解碼為語義分割、深度估計、物體檢測、可供性預測等有意義的信息,引入了更多的解釋性。然而,大多數情況下,這些預測僅被視為輔助任務,對最終駕駛決策沒有直接影響。規則整合和成本學習方法展示了一定程度的解釋性,類似于傳統的模塊化系統。這些方法結合了檢測和運動預測結果構建成本體積,通過包括安全性、舒適性和交通規則等預定義規則來評估軌跡的成本,從而提高了系統的魯棒性和安全性。
最后,使用自然語言作為解釋能力的一種手段,可以幫助人類理解系統的決策過程。例如,某些研究開發了數據集,將駕駛視頻或圖像與描述和解釋配對,并提出了既有控制又有解釋輸出的端到端模型。

圖6: 不同形式的可解釋性總結。它們有助于人類理解端到端模型決策過程及其輸出的可靠性
缺乏安全保證?
在實際場景中部署自動駕駛系統時,確保安全至關重要。然而,與傳統基于規則的方法不同,端到端框架的學習性質固有地缺乏關于安全性的精確數學保證。盡管如此,需注意的是,模塊化駕駛系統已經在其運動規劃或速度預測模塊中納入了特定的與安全相關的約束或優化措施,以強制執行安全性。這些機制可以作為后處理步驟或安全檢查的一部分,潛在地被整合到端到端模型中,從而提供額外的安全保證。
自動駕駛中的因果混淆問題
駕駛任務具有時間平滑性,使得過去的運動軌跡成為預測下一個動作的可靠指標。然而,使用多幀訓練的方法可能會過度依賴這種簡化的規律,這被稱為復制貓問題或因果混淆。在駕駛環境中,例如等待紅燈時,車輛的動作可能高度依賴于其速度,因為此時車輛速度為零且動作為剎車。當交通燈從紅變為綠時,這種因果關系的變化會導致模型性能的不穩定性。
解決因果混淆問題的方法包括使用單幀輸入來避免外推過去的動作預測,盡管這會限制對周圍車輛運動的理解能力。其他方法包括使用對抗訓練來消除過去動作的影響,以及在訓練過程中增加關鍵幀的權重,以強調決策變化時的重要性。還有一些技術利用離散編碼和隨機丟棄來消除因果混淆,或者使用LiDAR歷史記錄來保留其他車輛過去狀態的信息。盡管這些方法在簡化的環境中表現良好,但在復雜的視覺駕駛任務中的性能提升仍然是一個挑戰。因此,如何在現代自動駕駛系統中有效地解決因果混淆問題仍然需要進一步研究和創新。

圖 7: 因果混淆。車輛當前的行動與低維度的偶然特征(如速度或車輛過去的軌跡)之間存在強相關性。端到端模型可能會依賴這些特征,導致因果混淆
缺乏魯棒性
長尾分布問題:數據集中少數類別占據大多數情況,導致模型難以泛化到多樣化環境。解決方法包括過采樣、欠采樣、數據增強和基于權重的方法。針對此問題,一些研究依賴于仿真中的手工制作場景和對抗生成技術來增加數據多樣性。
協變量轉移:訓練后的代理策略在未見測試環境中可能與專家策略的狀態分布不同,導致嚴重的性能下降。DAgger算法及其擴展用于解決這一問題,通過從專家策略中補充標記數據來提高代理策略的泛化能力。
領域自適應:處理源領域與目標領域之間的差異,包括仿真到真實的適應、不同地理位置的適應、天氣變化的適應等。主要方法包括圖像翻譯器、領域隨機化和其他技術來減少真實世界與仿真器之間的差距,特別是在使用LiDAR等傳感器時的適應技術的設計。

挑戰和機遇
零樣本學習和少樣本學習:自動駕駛模型最終將面對超出訓練數據分布的真實世界場景。這引發了一個問題,即我們是否能成功地將模型適應到一個未見的目標域,其中有限或沒有標記數據可用。為端到端駕駛領域形式化這一任務,并結合零樣本/少樣本學習文獻中的技術,是實現這一目標的關鍵步驟。
模塊化端到端規劃:模塊化端到端規劃框架優化多個模塊,同時優先考慮最終的規劃任務,在解釋性方面具有明顯優勢。最近的文獻和某些行業解決方案(如特斯拉、Wayve等)都支持類似的理念。在設計這些可微分感知模塊時,會涉及一些問題,例如選擇損失函數的必要性,例如物體檢測是否需要3D邊界框,是否在靜態場景感知中選擇BEV分割而不是車道拓撲,以及在有限模塊數據情況下的訓練策略。
數據引擎:大規模高質量數據對于自動駕駛至關重要,建立具有自動標注流水線的數據引擎能夠極大地促進數據和模型的迭代開發。自動駕駛的數據引擎,特別是模塊化端到端規劃系統,需要通過大型感知模型的幫助,簡化高質量感知標簽的注釋過程。它還應支持挖掘難/邊界案例、場景生成和編輯。
基礎模型:語言和視覺基礎模型的最新進展表明,大規模數據和模型容量可以釋放AI在高級推理任務中的巨大潛力。微調或提示學習等優化范式適用于端到端駕駛領域。然而,直接采用LLMs(大型語言模型)用于駕駛可能會有難度。建立一個“基礎”駕駛模型的可行解決方案是訓練一個世界模型,能夠預測環境的合理未來,無論是在2D、3D還是潛在空間中。為了在規劃等下游任務上表現良好,模型優化的目標需要足夠復雜,超出幀級別感知的范圍。

總結
在這篇綜述中概述了基本方法論,并總結了仿真和基準測試的各個方面。我們深入分析了迄今為止的廣泛文獻,并突出了許多關鍵挑戰和有前景的解決方案。多年來工業界已經付出了大量努力,開發能夠在高速公路上實現自動駕駛的先進基于模塊的系統。
然而這些系統在面對復雜場景(如城市內部街道和交叉口)時面臨重大挑戰。因此,越來越多的公司開始探索專門針對這些環境設計的端到端自動駕駛技術。預期通過廣泛收集高質量數據、大規模模型訓練和建立可靠基準,端到端方法將很快在性能和效果上超越模塊化堆棧。總之端到端自動駕駛同時面臨巨大的機遇和挑戰,最終目標是構建通用智能體。
-- END --
聲明:內容源自點云PLC,文中觀點僅供分享交流,不代表本公眾號立場,如涉及版權等問題,請您告知,將及時處理!
