
----追光逐電 光引未來----
論文作者 | Xiaoxue Chen等
編輯 | 自動(dòng)駕駛之心
清華大學(xué)與小米汽車聯(lián)合推出 DGGT(Driving Gaussian Grounded Transformer):一個(gè)pose-free、feed-forward的4D動(dòng)態(tài)駕駛場景重建框架。
DGGT 只需未標(biāo)定的稀疏圖像,單次前向即可同時(shí)輸出相機(jī)位姿、深度、動(dòng)態(tài)實(shí)例與基于 3D Gaussian 的可編輯場景表示。模型在 Waymo 上訓(xùn)練,卻能在 nuScenes 與 Argoverse2 上實(shí)現(xiàn)強(qiáng)勁的零樣本泛化——在關(guān)鍵感知指標(biāo)上相比STORM提升超過 50%。此外,系統(tǒng)通過lifespan head建模場景隨時(shí)間的外觀演變,并配合單步擴(kuò)散精修,有效抑制運(yùn)動(dòng)插值偽影,提升時(shí)空一致性與渲染自然度。

DGGT 的核心思想是:一次前向就預(yù)測出“完整的4D場景狀態(tài)”,并把相機(jī)位姿從前提變成結(jié)果。這使得系統(tǒng)無需外參標(biāo)定即可從稀疏、未標(biāo)定圖像里恢復(fù)動(dòng)態(tài)場景,而且能自然跨數(shù)據(jù)集部署。圖1展示了DGGT 的整體能力與速度-精度位置:在0.4 秒量級完成重建的同時(shí),DGGT 在重建質(zhì)量上超越一系列前向與優(yōu)化方法,并將相機(jī)姿態(tài)、深度、動(dòng)態(tài)分割、3D Gaussian、追蹤等輸出一并給出,便于后續(xù)實(shí)例級場景編輯。

在系統(tǒng)結(jié)構(gòu)上(圖2),DGGT 采用 ViT 編碼器融合 DINO 先驗(yàn),通過交替注意力得到共享特征,再由多個(gè)預(yù)測頭并行輸出:


在Waymo數(shù)據(jù)集上的定性與定量評估(見表1)表明:以往的前饋式靜態(tài)重建方法(如 MVSplat、NoPoSplat、DepthSplat)在存在大范圍運(yùn)動(dòng)目標(biāo)的場景中難以維持時(shí)間一致性,且會(huì)產(chǎn)生明顯的錯(cuò)配與偽影;而STORM雖然通過前饋式建模緩解了對逐場景優(yōu)化的依賴,但在處理更長的時(shí)序跨度或更復(fù)雜的動(dòng)態(tài)行為時(shí)仍可能出現(xiàn)性能退化。相比之下,DGGT能夠在渲染級別上實(shí)現(xiàn)對靜態(tài)與動(dòng)態(tài)成分的有效分離,保持幀間外觀與幾何的一致性,從而顯著提升整體視覺質(zhì)量與重建穩(wěn)定性。在定量指標(biāo)上(表2),DGGT 在場景流估計(jì)上的EPE_3D為0.183 m,明顯優(yōu)于多種既有方法,證明了通過渲染監(jiān)督學(xué)得的稠密三維對應(yīng)具有良好的可靠性與精度。

跨數(shù)據(jù)集的零樣本泛化能力是 DGGT 的另一項(xiàng)核心優(yōu)勢。模型僅在Waymo上訓(xùn)練,但在未做任何微調(diào)的情況下,在nuScenes與Argoverse2上均取得超越現(xiàn)有SOTA的結(jié)果(見表3):如在nuScenes上 LPIPS從0.394 降至0.152(下降 61.4%);在 Argoverse2上從0.326降至 0.155(下降52.5%)。這種跨域魯棒性主要得益于DGGT 的pose-free 設(shè)計(jì):將位姿從輸入轉(zhuǎn)為模型輸出,減少了對固定拍攝軌跡與相機(jī)配置的依賴,從而降低了對特定數(shù)據(jù)采集設(shè)置的過擬合風(fēng)險(xiǎn),使模型在不同傳感器布置與行駛路徑下仍能維持良好性能。

在可擴(kuò)展性方面,DGGT 能自然支持任意數(shù)量的輸入視角與長序列。從表4可以看到,當(dāng)輸入視角從 4 → 8 → 16 擴(kuò)增時(shí),DGGT 的重建與新視角插值(NVS)指標(biāo)基本不變,而對比方法會(huì)明顯下滑。這意味著 DGGT 不僅適合研究場景,更適合在大規(guī)模輸入中做工程級預(yù)處理與批量重建,視角變多時(shí)不需要額外改模型或調(diào)參數(shù)。

Lifespan head 的作用在圖3中的消融對比非常直接:去掉 lifespan 后,PSNR 從 27.41 降至 24.21,原因在于系統(tǒng)失去了對靜態(tài)區(qū)域在時(shí)間維度上的細(xì)微變化(如亮度、反射、陰影過渡等)的建模能力。世界坐標(biāo)靜態(tài)的地方一旦無法隨時(shí)間正確更新,就會(huì)破壞渲染的時(shí)空一致性與真實(shí)感,從而顯著拉低最終畫面質(zhì)量。

Motion head負(fù)責(zé)把動(dòng)態(tài)像素在時(shí)間上對齊(圖4):它直接預(yù)測像素級的 3D 位移,用于將同一物體在相鄰幀中對齊并做插值。也就是說,模型不只是預(yù)測靜態(tài)形狀,而是學(xué)會(huì)了像素到像素的時(shí)序?qū)?yīng),從而在生成中間幀或執(zhí)行編輯時(shí)顯著減少錯(cuò)配與拖影,保證運(yùn)動(dòng)物體在時(shí)間上的連續(xù)性與視覺自然度。

在場景編輯與擴(kuò)散精修方面(圖5),DGGT 直接在 3D Gaussian 表示層面支持實(shí)例級操作——可以對單個(gè)高斯體執(zhí)行“新增/刪除/平移/替換”等編輯;隨后引入的擴(kuò)散精修模塊會(huì)自動(dòng)填補(bǔ)因遮擋產(chǎn)生的空洞、弱化邊緣鋸齒并修復(fù)紋理縫隙。經(jīng)過這兩步處理,合成結(jié)果在幾何與外觀上都保持高度一致且自然可信。
這意味著 DGGT 不只是“重建器”,更是“可編輯的 4D 場景資產(chǎn)生成器”,非常契合自動(dòng)駕駛仿真、評測與數(shù)據(jù)合成等下游需求。

申明:感謝原創(chuàng)作者的辛勤付出。本號轉(zhuǎn)載的文章均會(huì)在文中注明,若遇到版權(quán)問題請聯(lián)系我們處理。

----與智者為伍 為創(chuàng)新賦能----

聯(lián)系郵箱:uestcwxd@126.com
QQ:493826566