

本文提供了最近基于transformer的3D目標檢測任務的文獻綜述,主要集中于傳感器融合,介紹了視覺transformer(ViT)的基礎知識,還簡要論述了用于自動駕駛的傳感器融合的幾種非transformer式較少占主導地位的方法。最后總結了transformer在傳感器融合領域中的作用,并提出了該領域的未來研究方向。
更多內容可以參考:https://github.com/ApoorvRoboticist/Transformers-SensorFusion
傳感器融合是整合來自不同信息源的感知數據,利用不同傳感器捕獲的互補信息,融合有助于減少狀態估計的不確定性,并使3D目標檢測任務更加穩健。目標屬性在不同的模式中不具有同等的可識別性,因此需要利用不同的模式并從中提取補充信息。例如,激光雷達可以更好地定位潛在物體,radar可以更好地估計場景中物體的速度,最后但并非最不重要的是,相機可以通過密集的像素信息對物體進行分類。

現有的傳感器融合模型的總體架構圖如上所示,基于transformer的Head(綠色),基于CNN的特征提取器(藍色),用于預測3D鳥瞰圖(BEV)邊界框(黃色塊),每個傳感器具有中間BEV特征(紫色塊),該傳感器融合設置為從多視圖相機、激光雷達和雷達接收輸入。
雖然CNNs可用于在單個模態內捕獲全局上下文,但將其擴展到多個模態并精確地建模成對特征之間的交互是非常重要的。為了克服這一限制,使用transformer的注意力機制將關于2D場景的全局上下文推理直接集成到模態的特征提取層中。序列建模和視聽融合的最新進展表明,基于Transformer的體系結構在序列或跨模態數據的信息交互建模方面非常有效。
1.應用基于神經網絡的主干從所有模態中單獨提取空間特征;
2.在transformer模塊中迭代細化一小組學習嵌入(目標Query/proposal),以生成一組3D box的預測;
3.計算loss;
該架構如圖1所示。



-END-
