大部分關注GPU的同學都知道,近代NVIDIA GeForce RTX GPU,里面也充斥著所謂的Tensor core。一般我們說Tensor core是用于AI與HPC計算加速的,或者說用于加速矩陣乘運算。從Volta架構開始,到現在的Ada Lovelace/Hopper架構,Tensor core已經走到“第四代”了。
Tensor core并不是傳統意義上的圖形渲染單元——它的存在也一定程度讓GPU變得不再那么Graphical...從我們能找到的數據來看,早在Turing架構時期,Frizchens Fritz公開TU106(Turing)的高分辨率紅外die shot,提到TU106的一個TPC(Texture Processing Cluster)占die面積約為10.89mm²,其中的Tensor core大約1.25mm²——包含ALU、scheduler、cache相關部分。

Turing架構TU106 die shot,來源:Frizchens Fritz
從整個GPU die的角度來看,TU106的Tensor core占die面積大約在10%左右——當然這個數字未必可靠,因為我們還從其他來源聽說,Turing時代的這一數值可能在20%左右;無論如何,這起碼說明了傳統圖形處理器上,至少已經有這么大一片晶體管是“不務正業”的了。
這已經是前兩年的數字了,TU106的Tensor core單純看核心數是288個;這一代AD102(Ada Lovelace)的Tensor core數量已經增加到576個(RTX 4090并未全部用上這些核心);換句話說現在的GeForce圖形卡,用在AI上的料可著實不少了。
這就涉及到一個問題,AI對于游戲和圖形視覺類應用究竟有什么價值?這些die size拿來堆shader core之類的圖形單元他不香嗎?現在的AI計算,于游戲應用的一個重要價值在于:生成(generate)像素與幀——它和圖形單元的區別在于,后者是渲染(render)像素與幀。
“生成”和“渲染”有啥不同呢?說點兒實際的,NVIDIA最新的DLSS 3技術支持超分辨率(Super Resolution)和幀生成(Frame Generation):玩個1080p分辨率的游戲,如果超分辨率到4K分辨率,就有75%的像素和一半的幀是AI生成的,而不是由圖形渲染單元算出來的。而Tensor core投入的die size,遠遠不到圖形渲染單元的一半,功耗更是低了不止一個數量級,這筆投入是不是還挺劃算的?
也就是說,如果這些像素和幀都要由圖形單元去算,那所需的晶體管數量、顯卡售價、功耗水平都會沖著爆炸級別而去。最近NVIDIA在上海辦了一場GeForce RTX 40系顯卡品鑒會——這次品鑒會的主題之一就是DLSS 3,當然相關的還有全景光線追蹤,以及OEM產品展示。不過我們重點就關注一下和AI關系最大的DLSS 3,以及其他與GeForce顯卡相關的AI技術。
做游戲、做動畫也用AI的話...
去年NVIDIA GTC開發者大會上,我就寫文章說游戲方面讓人眼前一亮的是一個叫RTX Remix的工具,這個工具能給一些DirectX 7/8老游戲做MOD,讓老游戲也立馬支持光線追蹤、DLSS之類的新技術。NVIDIA演示的《上古卷軸3:晨風》加上RTX之后的效果,的確堪稱驚艷。
這次我們在品鑒會上看到了當時NVIDIA親自下場給游戲《傳送門:序曲》,基于RTX Remix做的《傳送門:序曲》RTX版,讓這個2008年度最佳游戲,看起來跟現在的新游戲似的。就玩家層面來看,和AI技術最相關的自然是DLSS——不過有關DLSS 3的部分,我們放到后面再去談。

這里NVIDIA 作為開發者與《傳送門:序曲》(Portal Prelude) 的原創Nicolas "NykO18" Grevet以及著名Mod愛好者David "Kralich" Driver-Gomm合作對《傳送門:序曲》RTX版進行現代重構時,本身也是受惠于AI的。如果你仔細閱讀了我們剖析RTX Remix的技術文章會了解,RTX Remix并不單純是給老游戲加上光追、DLSS之類的支持這么簡單。
這套工具里面有個AI紋理工具——一方面能夠將低分辨率的資源(asset)upscale為4倍高分辨率,比如1080p分辨率就upscale為4K;另一方面,AI可以對老游戲中的紋理進行inference,將比較老舊的紋理,轉為某種材質精美的紋理,NVIDIA在此前的媒體會上稱其為“Re-Texturing”,AI紋理工具“看到”畫面以后,能夠“理解畫面原本想要呈現的材料”,比如看到一扇木頭門,就能很快用高分辨率、高質量的木質紋理對原有紋理做替換。
那么很顯然這里的AI紋理工具,是首先需要NVIDIA去做個網絡模型的。NVIDIA方面說是對游戲紋理的大量圖片做了訓練,這樣的網絡可應用于紋理、物理屬性之類的推理。是不是還感覺挺神奇的?

《上古卷軸3:晨風》開關RTX前后變化
我們在這次品鑒會上問了NVIDIA,除了DLSS這樣的技術,在游戲對AI的利用上還有什么樣的規劃。NVIDIA談到了NVIDIA Omniverse ACE(Avatar Cloud Engine)已經在和“開發者合作中”,“后續應該就會有比較好的呈現”。
去年GTC報道中我們談過ACE,這兩年在網上還挺火的Toy Jensen——就是那個黃仁勛3D卡通形象,也部分基于ACE;還有包括Violet、Tokkio之類的虛擬形象應用,都有ACE技術成分。去年我還撰文談過Toy Jensen這個角色形象身上存在多少種不同的AI技術和“microservices”,包括Audio2Face生成式AI——基于音頻就能構建臉部動畫、Riva——將單純的文本說出來的text-to-speech、Nemo生成式AI——可以理解為針對特定領域的定制版ChatGPT等等...

從最簡化的工作框圖來看,文字、音頻、視頻數據輸入到ACE網絡,就能輸出2D或者3D形象(模型訓練流程應該是在DGX Cloud上進行的)。從NVIDIA市場宣傳老是愛換某些概念的名字和定位(不是...)的傳統來看,ACE未來囊括的AI技術應該會持續擴展。
那么很容易想見,將這些應用到游戲開發中會有怎樣的化學反應。前兩個月的Computex上,黃仁勛特別發布了NVIDIA ACE 游戲開發版,用于構建游戲中的NPC,NPC的角色反應通過生成式 AI 變得更智能。想象游戲中的NPC都有ChatGPT般的聊天能力...
我們現在暫時還不清楚,將來基于ACE的網絡模型inference具體會怎么做。不過聽NVIDIA的意思,具體到玩家這一側,與NPC對話的AI inference可能是由GeForce顯卡的Tensor core來完成的。
我倒是覺得,這對Tensor core的利用相比DLSS更為充分了。雖然這東西一聽就知道,又是個需要生態和開發者支持的大工程——好在從現有市場來看,NVIDIA生態構建能力,在圖形和AI領域都是無出其右的,DLSS不是發展得就挺好么。

AI短片《Flower》
內容創作部分,最后再來談一個品鑒會上的demo:NVIDIA請來了B站up主特效小哥008和拓星研究所的達威,展示他們用AI輔助制動的特效短片《Flower》——后續應該也會在B站發布。據說這個短片在AI輔助創作下,4個人只用了5天時間完成,008說按照以往的流程,這樣一個短片可能需要長達1個月的時間去制作。
從現場聽到的介紹來看,該短片制作至少用到兩個AI相關的工具,其一是NVIDIA Canvas——這應該也是現在Omniverse生態里的工具,即在畫布上,用筆刷簡單畫幾筆,Canvas就能基于AI自動生成photorealitic真實風格的風景畫。今年CES上,NVIDIA對此做了更新,新特性叫Canvas 360,即開始支持360°全景圖——構成環繞場景。
《Flower》的創作應該就是基于Canvas 360特性,CG短片的背景是用Canvas完成的。感覺比較奇特的是,Canvas 360特性中,創作者可以構建等矩陣(equirectangular)環境圖,導入到3D應用里——然后就能改變場景光照,增加反射之類的。008告訴我們,Canvas生成的山、云等背景,對于短片制作非常方便。

品鑒會現場用筆記本演示Canvas應用
其二是Stable Diffusion——這個text-to-image生成式AI,大部分同學應該也很熟悉了。“搭好場景,渲染好之后,丟進Stable Diffusion,讓AI去做更進一步的工作。”“AI幫我們填充了很多東西”,比如機器人身上的金屬劃痕細節、“手部細節”,“這些都是原資產里沒有的,AI填補出來的”;在模型精度較低的情況下,“AI幫我們填充了很多想要的細節”。
不過整個短片制作應當不僅限于這兩個AI構成,包括動作捕捉(Move AI),以及文字腳本、視頻最后總結的一行字甚至也都是AI完成的。全部工作流用上了“4張40系顯卡,結果還是挺夢幻的”,008說。
NVIDIA現場也提到了自家AI工具的一些合作應用案例,比如Canvas已經在火星時代做應用;好像每年GTC或者包括SIGGRAPH、Computex之類的會,NVIDIA都要宣布一堆AI相關的新合作,多少也是要表明自家AI生態的構建情況。
我們在這部分談《傳送門:序曲》RTX版游戲、NVIDIA ACE 游戲開發版,以及《Flower》短片的這三個例子,都是要說明AI技術于游戲開發和內容創作,正在扮演越來越重要的角色,Tensor core在娛樂與生產力方向也正變得預發重要。
其實我們始終覺得,現在的AI應用,于創作流程仍然只呈現出了點狀,就好像《Flower》短片制作,是某些地方用上AI做輔助;生產力、游戲,和多媒體創作上,AI的參與度未來還會越來越深入,尤其是在生成式AI為這個路徑指明了方向以后。
從NVIDIA Omniverse和AI這兩大板塊的加速庫到應用框架,仍然可以看到很多東西可在游戲、生產力上做應用的潛力;而且這里還沒有談到AR/VR之類的部分。舉個例子,我記得去年GTC上,黃仁勛展示了某個AI-powered character,這些角色基于人類動作數據來學習人類的真實動作,包括走路、跑步、揮劍——據說角色訓練機制原本要求10年期的模擬,但基于大規模并行GPU模擬,只需要現實世界3天就訓練完成。

訓練完成后的角色掌握各種技能,還能執行更復雜的任務,比如撞倒某個東西、往不同方向前進,甚至我們用自然語言能去控制它。不說這東西對Isaac之類有什么用,感覺于游戲3D角色的動作多樣化、自然流暢都有相當的價值(雖然可能這東西云端和本地算力需求也十分巨大),遠比現在的游戲體驗更好、更豐富。
DLSS 3和游戲AI的生態推進
談游戲AI嘛,自然少不了DLSS——相比前面談到的內容,DLSS對玩家可產生的直觀感受提升應該是更為顯著的。大部分玩家對于DLSS 3應當都挺熟的了,這里不再細說其技術細節。
簡單來說,DLSS 3是在原本DLSS 2能夠做AI超分辨率的基礎上,加入了幀生成和Reflex低延遲技術。如文首所述,DLSS 3幀生成是通過AI生成的——它更像是image圖像領域的技術,而非由graphic圖形計算獲得。
具體是怎么補的,可以參見我之前撰寫的文章,總結起來是運動矢量+光流。GPU硬件層面,這代Ada Lovelace是加入了光流加速器的。另外,配套的Reflex通過抹去渲染隊列的延遲,不僅抵消了補幀在流程上增加的延遲,而且讓輸入到顯示設備響應全鏈路的延遲降低到一個新的水平。
此前GTC上演示DLSS 3比較讓人印象深刻的是Racer X,GeForce RTX 4090 + DLSS 3相比RTX 3090 + DLSS 2,設計場景實現了將近4倍的幀數提升。DLSS 3的幀生成在其中是起到了相當大的作用的。

這次品鑒會讓我印象比較深刻的一是跑Unreal Engine虛幻引擎的實時渲染官方demo,現場工作人員說當場景變得非常復雜時,RTX 4090的實時渲染幀率也只有差不多20fps;引入DLSS 2做超分,則幀率能夠提升到接近30fps;而藉由DLSS 3補幀,畫面提升到接近60fps;
其二是NVIDIA與國內的建筑軟件D5的合作,在D5加入DLSS 3支持以后,建筑場景實時渲染可以從30fps提升到60fps。這些對于創作者、設計師而言都是體驗層面質的提升。
之前總有部分游戲玩家說,AI生成的像素和幀“不算數”,渲染算力才是“真正的”算力。這話或許得分兩部分來看。其一是評價一個復雜系統的性能,應當以高抽象層級的性能表現為判斷依據,而不是系統中的某一個組件。在游戲和設計類別的應用里,所謂的“高抽象層級”就是玩家和用戶的體驗。畫面好不好看、動起來流暢不流暢、綜合體驗行不行是鐵一般的判斷標準。
實際上即便在傳統的圖形渲染管線里,也有各種諸如數據壓縮之類的奇技淫巧在發揮作用——這些取巧的技術算不算數呢?何況在圖形學生態變得復雜、多樣時,衡量一個系統的優劣,早就脫離了FP32算力的范疇。圖形加速卡發展的歷史長河中誕生過很多不同的技術,AI現在作為其中一環,“怎么不算呢?”
另一個關鍵問題是,半導體行業的摩爾定律停滯。單純靠堆shader core和存儲資源,要達成品鑒會上Unreal Engine或者D5演示demo的60fps,現階段所需付出的代價恐怕是任何玩家、工作室,乃至HPC數據中心都無法承擔的;AI的誕生可以說是摩爾定律停滯時代的必然——因為這是系統層面提升面積與成本效益,外加能效的最佳選擇。
這里面最應該擔心的應該是DLSS的生態建設情況。因為要動用Tensor core加速,必然要求游戲和其他圖形應用開發者在代碼層面做支持。如果這個生態吸引不到足夠多的開發者參與,那么Tensor core和AI技術才是白白浪費了。

好在品鑒會上,NVIDIA說DLSS 3在推出半年內的普及速度,相比于DLSS 2同期,已經快了7倍。到目前為止,支持DLSS 的游戲已經超過了300款,其中38款游戲和應用現已支持DLSS 3。
品鑒會現場展示了不少支持DLSS 3的游戲,不僅是《賽博朋克2077》這類在光追特性上需要耗費大量算力的3A游戲——尤其在overdrive超速模式誕生以后;還包括《暗黑破壞神IV》這樣的網游——DLSS能夠走進網游,應當也某種程度表明了這項技術大眾化的開始。
現場工作人員說,《暗黑破壞神IV》1080p分辨率下,RTX 4060就能穩定在100fps以上;而“有些玩家期望做到極致,開4K分辨率,那么有了DLSS 3,也能達到60fps”。這是GPU這種大芯片在即將突破reticle limit的時代,AI在體驗層面實打實的加成。
其實這次NVIDIA期望展示的重點,應該在國產網游對DLSS 3的積極支持上,包括《永劫無間》《鳴潮》的PC端,是尚未公開、未來很快就要加入DLSS 3支持的demo演示;現場還有尚未上線的《重生邊緣》獨家Demo,對光線追蹤的完整支持引入,有了DLSS 3以后,RTX 4060玩2K分辨率也能有100+fps的幀率。
也有《無畏契約》這種追求低延遲,因此單獨加入Reflex的FPS游戲——現場工作人員告訴我們目前排名前10的FPS游戲,9款都已經集成了Reflex。這些也都是NVIDIA圖形生態的組成部分。
摩爾定律死了,顯卡靠AI救贖
去年我們跟芯片行業內的不少企業高層聊元宇宙,大家都認同電子游戲就是元宇宙的某種雛形——玩家在里面消費、交流、游覽…元宇宙作為虛擬世界,圖形構建需要依托GPU——而元宇宙相比游戲會惠及更多人,GPU的市場還會有一次井噴。
也不光是元宇宙、電子游戲、專業視覺設計,社會數字化轉型整體都對算力有著指數級增長的需求,則單靠摩爾定律支撐下GPU的圖形和通用計算單元頂著,是真的不夠看。何況摩爾定律還延續不下去了。
這時候我們看到,NVIDIA面向游戲在圖形卡上加入用于AI計算的Tensor core,為游戲布局DLSS 3、ACE等各種AI技術。大體思路就是圖形和AI一邊渲染、一邊生成像素,GeForce RTX 40系時代更像是未來世界的某種模板。GPU是在摩爾定律走不下去,單位面積再難成倍塞下晶體管時,獲得了AI的救贖的。
當這種思路擴展到更大范圍,不就是元宇宙和新時代的數字生活么?現階段還真的只有NVIDIA這一家做到了牢牢把持圖形與AI/HPC兩邊的生態,并且雙方還正以相輔相成的姿態往前走。
