
----追光逐電 光引未來----

3D Gaussian Splatting(3DGS)作為一種新興的3D場景表示方法,近年來迅速發(fā)展,成為神經(jīng)輻射場(NeRF)的有力替代方案。3DGS不僅具備高保真、逼真的渲染能力,還能實(shí)現(xiàn)實(shí)時(shí)性能。除了新視角合成外,3DGS結(jié)構(gòu)顯式且緊湊的特性,使其具備良好的幾何與語義理解能力,從而廣泛應(yīng)用于各類下游任務(wù)中。本綜述系統(tǒng)梳理了近年來3DGS在各類應(yīng)用中的研究進(jìn)展。我們首先介紹了支持3DGS語義理解與可控生成的2D基礎(chǔ)模型,隨后回顧了與3DGS發(fā)展密切相關(guān)的NeRF方法。接著,我們將3DGS的應(yīng)用劃分為分割、編輯、生成及其他功能性任務(wù),并圍繞每類任務(wù),總結(jié)了代表性方法、監(jiān)督策略和學(xué)習(xí)范式,歸納了其中的通用設(shè)計(jì)原則與新興趨勢。此外,我們還匯總了常用數(shù)據(jù)集與評估協(xié)議,并對近期方法在公開基準(zhǔn)上的表現(xiàn)進(jìn)行了對比分析。

題目:A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
作者:Shuting He, Peilin Ji, Yitong Yang, Changshuo Wang, Jiayi Ji, Yinglin Wang, Henghui Ding
論文:http://arxiv.org/abs/2508.09977
內(nèi)容簡介:對3DGS的下游應(yīng)用進(jìn)行系統(tǒng)梳理,包括分割、編輯與生成
代碼倉庫:https://github.com/heshuting555/Awesome-3DGS-Applications
近年來,3D Gaussian Splatting(3DGS)因其顯式表示結(jié)構(gòu)、高質(zhì)量的渲染效果以及實(shí)時(shí)性優(yōu)勢,迅速成為繼NeRF之后的新一代三維場景建模技術(shù)。相較于NeRF,3DGS在結(jié)構(gòu)可解釋性、優(yōu)化效率和直接可控性方面具有明顯優(yōu)勢,不僅推動了新視角合成的發(fā)展,也為更高層次的視覺與圖形任務(wù)帶來了新的契機(jī)。隨著研究的不斷深入,3DGS的應(yīng)用邊界持續(xù)拓展,已逐步延伸至語義分割、內(nèi)容編輯、三維生成、SLAM、人形建模等下游任務(wù)。這些任務(wù)通常要求模型具備豐富的語義理解、空間關(guān)系建模及多模態(tài)融合能力,使得3DGS在高層語義場景理解中的作用愈發(fā)突出。
盡管已有若干綜述關(guān)注3DGS的發(fā)展現(xiàn)狀,但大多聚焦于渲染流程、壓縮方案或整體分類,對于其驅(qū)動下的下游應(yīng)用仍缺乏系統(tǒng)梳理和深入分析。為此,我們撰寫了首個(gè)聚焦3DGS下游任務(wù)的綜述文章,系統(tǒng)回顧其在分割、編輯與生成三大方向的最新研究進(jìn)展與挑戰(zhàn)。我們還簡要回顧了支撐這些任務(wù)的2D基礎(chǔ)模型與NeRF方法,建立3DGS發(fā)展的概念連續(xù)性。在本綜述中,我們從方法設(shè)計(jì)、監(jiān)督范式與學(xué)習(xí)策略三個(gè)維度對代表性方法進(jìn)行歸類與比較,進(jìn)一步總結(jié)主流評測數(shù)據(jù)集與性能指標(biāo),并指出當(dāng)前面臨的核心挑戰(zhàn)與未來的發(fā)展方向,期望為新入門者和資深研究者提供一份系統(tǒng)、可讀性強(qiáng)的參考資料,推動3DGS在高層三維理解任務(wù)中的廣泛應(yīng)用與深入研究。


為系統(tǒng)梳理3DGS其在下游應(yīng)用中的角色,我們首先給出問題形式化與任務(wù)分類,其次概覽支撐語義理解與控制的主流 2D 基礎(chǔ)模型,并簡要回顧與 3DGS 發(fā)展密切相關(guān)的 NeRF 研究脈絡(luò)。
我們將 3DGS 下游應(yīng)用歸納為三類:
3DGS 分割任務(wù)類型繁多(語義/實(shí)例/全景、交互/開放詞匯/指代等)。為避免按任務(wù)定義割裂,我們從技術(shù)路徑出發(fā)做概覽:
(1)特征蒸餾
將 CLIP / SAM / DINO 等 2D 基礎(chǔ)模型的語義先驗(yàn)蒸餾到 3DGS,實(shí)現(xiàn)開放詞匯與跨模態(tài)理解(如 LangSplat、Feature3DGS)。新進(jìn)展圍繞兩條線:
(2)2D 掩碼升維到 3D
基于 SAM/SAM2 掩碼進(jìn)行升維,核心難點(diǎn)是跨視一致性與過/欠分割:
(3)前饋式方法
跨場景共享參數(shù),一次前向完成 3D 語義場構(gòu)建,適合稀疏視圖與大規(guī)模部署(如 SLGaussian、Dr. Splat、LangScene-X、SceneSplat)。配合自監(jiān)督與大規(guī)模數(shù)據(jù),兼顧速度與泛化。
3D 編輯任務(wù)旨在對三維場景的幾何、外觀或光照等屬性進(jìn)行靈活且精細(xì)的修改,保持多視角下的結(jié)構(gòu)和視覺一致性。基于3DGS的編輯方法利用其顯式且可微的場景表示,結(jié)合文本或圖像提示,支持添加、刪除、變換及風(fēng)格遷移等多種操作,為實(shí)現(xiàn)高精度、可控且多模態(tài)驅(qū)動的三維內(nèi)容創(chuàng)作提供了強(qiáng)大工具。
并系統(tǒng)地將其分為三大類:(1)基于文本提示的編輯,利用文本描述作為引導(dǎo),通過與 2D 文本到圖像擴(kuò)散模型結(jié)合,控制 3D 場景在幾何、外觀或語義上的精確修改,實(shí)現(xiàn)添加、刪除或變換目標(biāo)對象等操作,具備較強(qiáng)的靈活性與開放性;(2)基于圖像提示的編輯,以參考圖像為條件約束,通過匹配外觀風(fēng)格或局部結(jié)構(gòu),實(shí)現(xiàn)目標(biāo)區(qū)域的內(nèi)容替換、紋理重繪或外觀修復(fù),能夠在多視角下保持一致性;(3)風(fēng)格遷移,將源場景的高斯表示與目標(biāo)風(fēng)格特征融合,使整個(gè) 3D 場景在保持幾何結(jié)構(gòu)不變的同時(shí)呈現(xiàn)統(tǒng)一的藝術(shù)化或特定視覺風(fēng)格效果。這三類方法充分發(fā)揮了 3DGS 的可微可編輯特性,并結(jié)合 2D 擴(kuò)散模型的生成能力,為多模態(tài)驅(qū)動的三維可控創(chuàng)作提供了高精度與高一致性的解決方案。此外,我們還分析了編輯領(lǐng)域的其他方向研究,例如物體刪除,視頻編輯,以及重繪等任務(wù)。
3D生成任務(wù)旨在從有限的輸入(如單張圖片、稀疏視角或文本描述)合成完整的三維場景或物體。基于3DGS的方法利用其高效且精細(xì)的顯式表示,結(jié)合多模態(tài)信息,實(shí)現(xiàn)結(jié)構(gòu)化且高質(zhì)量的三維內(nèi)容生成,推動了自動化三維建模和創(chuàng)作在虛擬現(xiàn)實(shí)、游戲和數(shù)字資產(chǎn)等領(lǐng)域的應(yīng)用發(fā)展。
近年來,基于3DGS的三維生成技術(shù)在效率和速度上顯著優(yōu)于傳統(tǒng)NeRF方法,極大地推動了文本和圖像驅(qū)動的三維內(nèi)容創(chuàng)作。綜述將3DGS生成方法可細(xì)分為對象級和場景級兩大類,對象級生成包括基于優(yōu)化的方法,利用強(qiáng)大的二維擴(kuò)散模型作為先驗(yàn),通過梯度優(yōu)化引導(dǎo)三維高斯表示的細(xì)致調(diào)整;以及基于前饋式的方法,針對優(yōu)化耗時(shí)長的問題,通過訓(xùn)練泛化模型實(shí)現(xiàn)快速、一鍵式的三維對象生成。場景級生成則進(jìn)一步細(xì)分為逐場景優(yōu)化方法,針對每個(gè)獨(dú)立場景單獨(dú)優(yōu)化高質(zhì)量三維高斯表達(dá),支持文本到三維、圖像到三維等多模態(tài)輸入;迭代生成方法通過反復(fù)渲染與優(yōu)化循環(huán),持續(xù)提升場景重建質(zhì)量和細(xì)節(jié)表現(xiàn);以及前饋式方法,借助多場景訓(xùn)練實(shí)現(xiàn)跨場景泛化,支持實(shí)時(shí)推理和大規(guī)模部署。這些多樣化的技術(shù)路線不僅豐富了3DGS在三維生成領(lǐng)域的表現(xiàn)力,也為虛擬現(xiàn)實(shí)、數(shù)字資產(chǎn)制作、游戲開發(fā)等多種應(yīng)用場景提供了高效、可控的生成解決方案,展現(xiàn)出廣闊的應(yīng)用前景與發(fā)展?jié)摿Α?/span>
3DGS在同步定位與建圖領(lǐng)域應(yīng)用(SLAM)
基于3DGS的同步定位與建圖(SLAM)技術(shù),作為機(jī)器人與計(jì)算機(jī)視覺領(lǐng)域的核心任務(wù),實(shí)現(xiàn)了相機(jī)位姿估計(jì)與三維環(huán)境重建的高效融合。我們將近幾年的研究主要分為兩大方向:一是幾何驅(qū)動的SLAM,側(cè)重于精準(zhǔn)恢復(fù)場景的空間結(jié)構(gòu)與細(xì)節(jié);二是語義感知的SLAM,結(jié)合語義信息提升場景理解與地圖表達(dá)能力。3DGS憑借其顯式且高效的三維表示,推動SLAM技術(shù)在實(shí)時(shí)性、精度和語義豐富性方面的突破,為智能機(jī)器人導(dǎo)航、增強(qiáng)現(xiàn)實(shí)等應(yīng)用提供了強(qiáng)有力的技術(shù)支撐。
3DGS在頭像重建領(lǐng)域應(yīng)用(Human Avatar)
基于3DGS的人體數(shù)字化建模技術(shù),推動了虛擬空間中沉浸式交互體驗(yàn)的發(fā)展,廣泛應(yīng)用于游戲、虛擬會議和元宇宙等領(lǐng)域。這些研究主要聚焦于兩大方向:一是基于人體骨架參數(shù)模型(如SMPL、SMPL-X)引導(dǎo)的全身高斯初始化,實(shí)現(xiàn)精準(zhǔn)的體態(tài)建模與動作表達(dá);二是以頭部為核心,強(qiáng)調(diào)面部幾何、表情及語音驅(qū)動動態(tài)的細(xì)粒度重建,提升頭像的真實(shí)感與交互自然度。3DGS技術(shù)憑借其高效顯式的三維表示能力,為數(shù)字人頭像的高保真重建和實(shí)時(shí)渲染提供了堅(jiān)實(shí)基礎(chǔ),助力虛擬人技術(shù)邁向更廣泛的應(yīng)用場景。
3DGS在物體檢測領(lǐng)域應(yīng)用(Objection Detection)
3DGS 目標(biāo)檢測作為三維場景理解的重要任務(wù),聚焦于在三維空間中準(zhǔn)確識別與定位目標(biāo)對象。我們總結(jié)了近幾年的相關(guān)研究,將該領(lǐng)域的方法分為兩類:(1)基于提示的檢測;(2)通用檢測。基于提示的檢測,又稱開放詞匯檢測或視覺定位,通過文本輸入指導(dǎo)模型定位目標(biāo),具備靈活的語義理解能力。許多基于3DGS的分割方法天然支持該檢測形式,通過生成最大響應(yīng)點(diǎn)實(shí)現(xiàn)目標(biāo)定位,體現(xiàn)出3DGS在實(shí)現(xiàn)多模態(tài)交互和高精度空間感知方面的強(qiáng)大潛力,為智能機(jī)器人、自動駕駛等應(yīng)用提供了基礎(chǔ)。
本節(jié)詳細(xì)整理了覆蓋所有主要任務(wù)和數(shù)據(jù)集的頂尖(State-of-the-Art)方法性能對比表,為研究者高效評估各類方法的優(yōu)勢與不足提供了權(quán)威參考。我們首先總結(jié)了在3DGS的分割,編輯,生成任務(wù)中常用的數(shù)據(jù)集及其特點(diǎn),可供研究者便捷的參考,其中,圖3展示了 13 個(gè)常用的分割、編輯和生成數(shù)據(jù)集的示例。其次,我們系統(tǒng)的匯總了3DGS應(yīng)用領(lǐng)域的頂尖研究在不同任務(wù)以及數(shù)據(jù)集上的方法性能表現(xiàn),例如分割領(lǐng)域的3D實(shí)例分割(3D instance segmentation)與交互式分割(Interactive segmentation);編輯領(lǐng)域的風(fēng)格遷移(Style Transfer)任務(wù),以及生成領(lǐng)域方法的性能表現(xiàn)。




在我們提出的任務(wù)分類體系,我們?nèi)嬖u估了當(dāng)前基于3D高斯點(diǎn)的語義分割方法在四大代表性任務(wù)設(shè)置中的表現(xiàn),涵蓋實(shí)例分割、交互式分割、開放詞匯語義分割等關(guān)鍵場景。
在 Replica 和 LERF-Mask 數(shù)據(jù)集上,Unified-Lift 展現(xiàn)出最優(yōu)的整體性能,充分驗(yàn)證了一種基于一致性約束的端到端學(xué)習(xí)框架的有效性。(見表4)

在 NVOS 數(shù)據(jù)集上,GaussianCut 取得了最佳結(jié)果;在 SPIn-NeRF 數(shù)據(jù)集上,Click-Gaussian 獲得了最高的 mIoU。值得注意的是,GaussianCut 是一種無需訓(xùn)練的輕量方法,支持2D點(diǎn)擊與文本提示等多種交互形式,實(shí)用性強(qiáng)。(見表5)

在 ScanNet-OVS 數(shù)據(jù)集上,PanoGS 和 InstanceGaussian 在基于點(diǎn)的評估設(shè)置下表現(xiàn)最佳,而在基于3D高斯表示的評估中,CAGS 方法領(lǐng)先。(見表6)

在 3D-OVS 基準(zhǔn)上,VLGaussian 達(dá)到了目前最高的 mIoU(97.1%),顯著優(yōu)于現(xiàn)有方法,樹立了新的性能標(biāo)桿。(見表7)

在 LERF-OVS 的兩個(gè)子任務(wù)上:FMLGS 在語義分割任務(wù)中表現(xiàn)最佳,而VLGaussian 則在目標(biāo)定位(檢測)任務(wù)中領(lǐng)先。(見表8)

在我們構(gòu)建的評測體系中,我們選取了兩個(gè)主流數(shù)據(jù)集Mip-NeRF 360 和 IN2N,作為3D圖像編輯任務(wù)的標(biāo)準(zhǔn)基準(zhǔn),用于評估現(xiàn)有方法在真實(shí)3D場景中的編輯能力。
當(dāng)前大多數(shù)3D編輯方法均基于不同的場景子集進(jìn)行評估,導(dǎo)致難以在統(tǒng)一標(biāo)準(zhǔn)下實(shí)現(xiàn)全面、客觀的對比。為此,我們采用 IN2N 作為參考基線,并在此基礎(chǔ)上報(bào)告各方法相對提升幅度,以實(shí)現(xiàn)間接但相對公平的比較(見表9)。其中,GaussianVTON 方法在多個(gè)指標(biāo)上展現(xiàn)出最優(yōu)的綜合性能。

在 3D風(fēng)格遷移方面,我們采用 Mip-NeRF 360 數(shù)據(jù)集作為標(biāo)準(zhǔn)基準(zhǔn),對比多個(gè)方法在外觀一致性、風(fēng)格保真度等方面的表現(xiàn)(見表10)。其中,SemanticSplatStylization 方法取得了最好的整體表現(xiàn),兼顧了風(fēng)格呈現(xiàn)與內(nèi)容保持的雙重需求。

在3D內(nèi)容生成任務(wù)中,我們選取了兩個(gè)具有代表性的數(shù)據(jù)集GSO 和 Objaverse,作為基準(zhǔn),用于系統(tǒng)評估基于3D高斯點(diǎn)表示(3DGS)的生成方法在不同場景中的建模能力與泛化性能。
在 GSO 數(shù)據(jù)集上,NovelGS 通過對擴(kuò)散過程進(jìn)行定制以更好適配 3D Gaussian 表示,在現(xiàn)有方法中表現(xiàn)最優(yōu)(見表11)。該方法同時(shí)支持文本生成3D與圖像生成3D兩種輸入形式,在多模態(tài)輸入下展現(xiàn)出強(qiáng)大的泛化能力,成為通用3D生成模型的重要代表。

在大規(guī)模開放域的 Objaverse 數(shù)據(jù)集上,Atlas-Gaussians 利用潛空間優(yōu)化策略顯著提升了生成質(zhì)量,支持基于文本的3D內(nèi)容創(chuàng)作(見表12)。其在處理開放語義、復(fù)雜形狀的物體生成任務(wù)中表現(xiàn)出色,是當(dāng)前通用性最強(qiáng)的3D文本生成方法之一。

未來,3D Gaussian Splatting(3DGS)技術(shù)將迎來多元化、跨領(lǐng)域的突破。一:大規(guī)模前饋式學(xué)習(xí)將成為核心趨勢,通過大規(guī)模、多樣化場景訓(xùn)練,實(shí)現(xiàn)跨領(lǐng)域泛化,擺脫逐場景優(yōu)化的低效瓶頸;二:針對當(dāng)前評估體系與3DGS目標(biāo)脫節(jié)的問題,亟需構(gòu)建面向三維高斯視角的全新評估指標(biāo),不僅衡量投影到二維平面的精度,更注重三維幾何與語義一致性。 與此同時(shí),將大型語言模型(LLMs)與3DGS深度融合,將推動語義理解、文本驅(qū)動的三維編輯與生成,實(shí)現(xiàn)具備空間推理能力的交互式智能應(yīng)用。四:面對三維標(biāo)注數(shù)據(jù)稀缺的挑戰(zhàn),3DGS的生成能力將用于合成高質(zhì)量、可擴(kuò)展的三維數(shù)據(jù)集,并結(jié)合領(lǐng)域自適應(yīng)技術(shù)增強(qiáng)模型的魯棒性與泛化性。五:構(gòu)建可同時(shí)勝任分割、編輯與生成等多任務(wù)的通用型3DGS架構(gòu),支持多種下游任務(wù),提升模型效率、魯棒性與任務(wù)遷移能力。六:結(jié)合3D基礎(chǔ)模型:集成如VGGT、FLARE等預(yù)訓(xùn)練3D模型,引入幾何先驗(yàn),進(jìn)一步提升3DGS在復(fù)雜任務(wù)中的表現(xiàn)。
這一系列方向不僅將推動3DGS技術(shù)的邊界擴(kuò)展,更將加速其在虛擬現(xiàn)實(shí)、機(jī)器人感知、數(shù)字孿生等領(lǐng)域的落地與普及。

申明:感謝原創(chuàng)作者的辛勤付出。本號轉(zhuǎn)載的文章均會在文中注明,若遇到版權(quán)問題請聯(lián)系我們處理。

----與智者為伍 為創(chuàng)新賦能----

聯(lián)系郵箱:uestcwxd@126.com
QQ:493826566