今年8月的SIGGRAPH大會上,黃仁勛在演講中給了個演示,給AI輸入一張工廠規(guī)劃的2D CAD平面圖——這張平面圖就只是個PDF文檔,然后跟生成式AI(Generative AI)講幾句話、提幾句需求,AI就能輸出一個完整的3D虛擬工廠——或者用現(xiàn)在流行的話來說,叫工廠數(shù)字孿生——包括工廠倉庫地面材料、廠房布局等,基于OpenUSD 3D格式的模型。

這個以前需要投入相當人力物力和時間的工作,現(xiàn)在AI能在很短的時間里完成。當然具體的實現(xiàn)細節(jié)還是待調(diào)整的,但這個演示讓我們看到了,生成式AI在行業(yè)應用中的潛在價值,是突破了ChatGPT、Stable Diffusion這些爆款的;當然還有就是這個新晉入主市值萬億俱樂部的英偉達,在現(xiàn)如今的AI市場有多么風生水起。
我們今年接觸的不少AI芯片企業(yè),乃至IP供應商普遍都在說,數(shù)據(jù)中心的AI訓練市場已經(jīng)被英偉達雄踞了,這部分市場很難再被撼動:比如驅(qū)動ChatGPT、new Bing這類云服務的算力基礎;以及各類大模型的訓練,就是英偉達A100, H100之類的芯片。
但對整個行業(yè)來講,生成式AI這個東風可不能都被英偉達都給借走了:云市場搶不過你,那咱還不能搞搞邊緣推理市場嗎?所以今年從上至下不同層級的企業(yè)都在宣傳邊緣,乃至端側(cè)的生成式AI。
從廣義的“邊緣”概念來看,不光是邊緣數(shù)據(jù)中心、企業(yè)網(wǎng)關這些邊緣,端側(cè)市場上Intel已經(jīng)宣傳了大半年的AI PC,聯(lián)發(fā)科則在年底收官前發(fā)布了能跑生成式AI的手機AP SoC,甚至還有一些搞嵌入式芯片的企業(yè)也在談生成式AI。
但實際上即便是邊緣市場,英偉達也是有自己的殺手锏的,拋開各類Jetson芯片、IGX平臺這些更偏行業(yè)和企業(yè)應用的邊緣不談,英偉達在PC端的GeForce顯卡不就是現(xiàn)在個人用戶做AI研究,以及AI技術愛好者使用最廣泛的平臺么?
其實自疫情結(jié)束后,PC市場開始呈現(xiàn)出頹勢之際,PC行業(yè)的主要市場參與者就開始了AI PC的宣傳。現(xiàn)在看來,生成式AI大概的確會成為接下來這一波讓PC市場再度上揚的大熱門。市場上談AI PC最大聲的,現(xiàn)階段顯然就是Intel及各OEM企業(yè)了。但實際在包括CUDA生態(tài)在內(nèi)的Nvidia AI全棧構(gòu)建AI生態(tài)最久,大概也最有資格說AI PC的,應該就是英偉達本達了。

今年9月,英偉達發(fā)布了開源的TensorRT-LLM,這是個專用于LLM大語言模型推理的工具,特點是能夠加速LLM的推理性能——不過當時主打的仍然是為H100推理加速。10月份TensorRT-LLM for Windows版本發(fā)布,主要是實現(xiàn)了裸金屬Windows平臺的單卡GPU推理,重點是特別明確了對GeForce RTX 40系顯卡的支持,使PC 生成式AI速度提高 4 倍。與此同時,TensorRT 加速也已應用于熱門應用Stable Diffusion WebU中,將生成式AI Diffusion模型的速度提升2倍。這就顯然有著意AI PC的意思了,大概可以說是正式打響英偉達在AI PC戰(zhàn)役的開端,即便英偉達從來不是最近才開始在PC上做AI的。
我們來展開看看在AI PC這個概念上,尤其生成式AI加速,英偉達都有哪些東西。順便聊聊AI PC是不是真的有價值。
GeForce顯卡的生成式AI實現(xiàn)基礎
想在端側(cè)AI市場分一杯羹的市場玩家還是很多的,比如Intel要在新一代面向PC的Meteor Lake處理器中加入專門的NPU加速單元,AMD Ryzen處理器現(xiàn)在還有專門的Ryzen AI品牌概念宣傳,聯(lián)發(fā)科的天璣9300手機芯片內(nèi)部的AI單元特別集成了所謂的“生成式AI加速引擎”...響應的OEM廠商就更多了,微軟也期望能在這一局里做AI/ML的標準制定者。
顯然,在去年底今年初以ChatGPT為代表的生成式AI再度引爆AI市場以后,主要的市場參與者對端側(cè)AI是抱著巨大的期望的。其實強調(diào)端側(cè)或者本地AI推理的原因很好理解:第一是如文首所述,這么好的技術和熱點可不能英偉達一家獨美,大家都要分蛋糕;第二是本地AI推理有著云無法比擬的一些優(yōu)勢。
這些優(yōu)勢應該已經(jīng)老生常談了,無非就是云和邊緣兩側(cè)各自的優(yōu)缺點,這些優(yōu)勢再搬到AI上來:包括數(shù)據(jù)安全與隱私,延遲需求,以及無法確保實時的云連接等。不過實際上對AI而言,像ChatGPT、Midjourney這類面向大眾的云AI,相比于本地部署AI模型還有個巨大的弱勢,即不能根據(jù)個體需求做定制。
如果把視野放寬到消費市場以外,AI走向邊緣也因此成為必然:起碼企業(yè)一定需要邊緣AI來提升生產(chǎn)力,這也是我們預判明年生成式AI發(fā)展的模式走向。對個人用戶來說,無論是做科學研究,還是用于具體的生產(chǎn)力,端側(cè)本地的AI也有可定制和更為自由靈活的優(yōu)勢,比如說用Stable Diffusion這類復合式模型畫小姐姐的需求,在Midjourney上有被拒絕服務的可能(不是)...
作為云上AI的王者,英偉達在端側(cè),尤其具體到PC端又有什么樣的儲備呢?絕大部分同學應該都知道,英偉達從Turing架構(gòu)開始給GeForce RTX GPU加入了Tensor Core,也就是可加速AI運算的專用硬件單元。與此同時,2021年的秋季GTC上,黃仁勛在主題演講中就多次強調(diào)了Transformer的價值,以及LLM的潛力。
次年英偉達發(fā)布Hopper架構(gòu)的H100加速卡,就果斷引入Transformer Engine庫,搭配新一代的Tensor Core硬件以數(shù)倍提升Transformer模型處理的性能。當時在GPU上做明確更偏專用的加速,看起來還是挺大膽的。同年10月,對應的Ada Lovelace架構(gòu)的GeForce RTX 40系GPU發(fā)布,很自然的也有了Transformer引擎支持——雖然它只是個圖形卡。

Dall-E, ChatGPT在全球范圍內(nèi)的爆發(fā)實際上是在Hopper和Ada Lovelace加入Transformer引擎以后。當然LLM和Stable Diffusion這類大模型的火熱還是趨勢使然,只不過英偉達能在熱點引爆以前就著力于硬件部署,然后在今年的GTC上英偉達很自然地播放了一段此前黃仁勛將DGX交給OpenAI的名場面。很快英偉達的市值就飆升萬億了。這前瞻水平的確不可謂不高...
這里我們再稍微談一談Transformer和生成式AI究竟是什么關系。Transformer在結(jié)構(gòu)上采用一種所謂的自注意力(self-attention)機制,捕捉全局相關性、在一個隊列內(nèi)不同element的關系。Transformer最早主要適用于NLP(natural language processing,自然語言處理),因為其自注意力機制能夠讓隊列中每個element與其他所有element相關聯(lián),模型就能基于element關聯(lián)上下文,來權(quán)衡其重要性。
說點人話,GPT就是Generative Pre-trained Transformer的縮寫,基于或部分基于Transformer是很符合這種模型特性的。LLM大語言模型普遍是基于Transformer結(jié)構(gòu),比如ChatGLM,比如Llama,這兩年都挺火。
另外,原本CNN卷積神經(jīng)網(wǎng)絡和Transformer的工作領域是有差別的,前者被認為更適合做圖像分類、對象識別之類的工作。但后來谷歌發(fā)了個paper,說把圖像切割成小片,每一片當成一個單字、token,則也能以較高精度來學習如何識別對象,達成不錯的并行度和靈活性,令Transformer也適用于大規(guī)模圖像識別、CV工作。Diffusion模型就有基于Transformer的嘗試。
也不用去細究Transformer和Diffusion是個什么關系,發(fā)展?jié)摿θ绾巍Sミ_此前在發(fā)布L40和RTX 6000 GPU時,就特別強調(diào)了Stable Diffusion出圖(推理)性能提升——這倆也都是基于Ada Lovelace架構(gòu)的,只不過和GeForce的市場定位不同。
所以總的來說,英偉達在AI PC硬件層面的準備工作是比其他競爭對手快了幾個身位的——雖然這一點似乎主要還是依托于英偉達在數(shù)據(jù)中心AI HPC領域的先期成功——當然在生態(tài)上就涵蓋了已經(jīng)十多年歷史的、讓GPU能夠做各類通用計算的CUDA,及其后AI作為一部分的布局了。
工具與生態(tài):生成式AI本地推理要提速
在AI訓練和推理的問題上,大量市場研究數(shù)據(jù)都表明推理的市場一定是更大的——施耐德電氣的數(shù)據(jù)是,從用電量的角度來看,全球范圍內(nèi)AI訓練和推理功耗,兩者現(xiàn)在的比例大約是2:8;未來還會更進一步偏向推理側(cè)。所以很顯然英偉達是不會放過推理市場的。
我們每次和ChatGPT說上一句話,ChatGPT就要進行一次AI推理(inference);每次Stable Diffusion出圖個小姐姐,也就在本地進行了一次AI推理。這兩者的算力量級還是不一樣的。今年的春季GTC上,英偉達有特別面向LLM推理發(fā)布過一款H100 NVL,著眼的是需求較大算力需求的推理。
至于PC端側(cè),和數(shù)據(jù)中心顯卡一樣,大家都是Ampere或Ada Lovelace架構(gòu),基于英偉達構(gòu)建的軟件棧,用GeForce RTX顯卡做AI推理也是水到渠成。而且似乎PC行業(yè)媒體做顯卡評測時,前兩年就已經(jīng)把Stable Diffusion的本地推理納入考量范疇了——大部分主要是基于Stable Diffusion WebUI(A1111,能跑Stable Diffusion的一個GUI圖形用戶界面)。用GeForce RTX顯卡跑Stable Diffusion WebUI的基礎當然是CUDA。
所以最早有“AI PC”實現(xiàn)基礎的就是英偉達,畢竟其生態(tài)和軟件棧的布局,以及社區(qū)發(fā)明的各類玩法算是相當早了。Intel從今年初開始推AI PC的概念,事實上是比英偉達晚了不少的。我們之前一直說Intel的軟件工程師今年加班應該會很多,雖然Intel很大程度借助了開源社區(qū)的力量,但是把全棧搭得像模像樣,讓Stable Diffusion及各類LLM模型跑在自家CPU和GPU上,的確還是下了不少功夫的:無論是年初能跑起來,還是下半年的優(yōu)化工作。
感覺今年10月,英偉達是明確開始更重視AI PC這個議題了。10月份英偉達親自下場為Stable Diffusion WebUI做了個TensorRT擴展。TensorRT是啥呢?這里的RT是runtime的意思,所以它首先是AI應用部署的一個runtime庫;另外這也是個推理優(yōu)化工具——它給出API和分析器,導入AI模型,然后生成優(yōu)化過的runtime運行時引擎。

換句話說,這個TensorRT插件,是讓AI模型在Stable Diffusion WebUI里面跑(推理)得更快了。B站up主Nenly給出的實測數(shù)據(jù)是AI推理性能提升3倍,也就是用Stable Diffusion畫小姐姐比之前沒有TensorRT插件要快3倍吧;英偉達給的數(shù)據(jù)是,這個插件跑在GeForce RTX 4090上,Stable Diffusion推理速度比M2 Ultra快了7倍(也算是欺負蘋果的生態(tài)了),正式讓AI生圖進入秒速時代。

Stable Diffusion TensorRT實測成績 by Nenly同學
其實TensorRT這個工具本身的引入也有些年頭了,遙想2019年和更早的年份,這個中間件的版本迭代還是GTC歷年更新的熱點。
而9月發(fā)布的TensorRT-LLM顯然就是基于TensorRT的,后綴LLM則是大語言模型。Github上給出的定義是,TensorRT-LLM為用戶提供易于使用的Python API來定義LLM,并構(gòu)建包含高水準優(yōu)化的TensorRT引擎,在英偉達GPU上執(zhí)行高效的推理(另外也包含能夠跑TensorRT引擎的runtime組件)。
英偉達將其定義為,令生成式AI應用投入生產(chǎn)的主干(backbone)。簡單來說也就是能夠為LLM推理加速、優(yōu)化的工具。英偉達的宣傳資料中提到TensorRT-LLM v0.6.0“帶來至高達5倍的推力性能提升,并支持更多熱門的LLM”。
英偉達官網(wǎng)介紹中還特別提到TensorRT-LLM有利用FastTransformer——這是英偉達針對Transformer模型開發(fā)的優(yōu)化庫。從這些組成部分來看,TensorRT-LLM也算得上是集合多年經(jīng)驗的成果。用英偉達在Q3財報電話會議上的話來說,就是“我們投入安裝基礎(installed base)20多年了;任何時間你看到英偉達GPU,它都跑我們的棧”,當然也包括GeForce。

10月份,TensorRT-LLM for Windows發(fā)布,明確了對于GeForce RTX單卡推理的支持。這東西和Stable Diffusion WebUI的TensorRT插件算是同時發(fā)布,怎么看都有要把AI PC真正做起來的意圖。宣傳中提到TensorRT-LLM for Windows使PC生成式AI速度提高4倍。
在PC本地跑生成式AI也會因此變得更實用,包括Llama這類比較流行的LLM模型,有興趣的同學可以嘗試在本地部署。具體是做LLM研究,還是用來聊天、寫文案、寫代碼、查資料,或者和別的技術再做結(jié)合,那就是PC端用戶及開發(fā)者要思考的問題了。
這部分最后再談一點:在PC端的AI軟件棧尚未真正統(tǒng)一的情況下,微軟的AI API也是很值得觀察的,比如DirectML。DirectML算是DirectX 12的組成部分,是微軟以操作系統(tǒng)供應商的身份給出的機器學習API,現(xiàn)在對大部分芯片廠的GPU都提供AI加速支持,通用性更好。像Stable Diffusion WebUI也有DirectML版,只不過效率上可能會略差于芯片廠給的專用API。
這次英偉達也和微軟一起特別為跑在DirectML API上的Llama模型做了優(yōu)化,英偉達可能主要是做了GPU驅(qū)動層面的優(yōu)化。這也算是AI PC生態(tài)構(gòu)建的多面出擊吧。
擁抱生成式AI,擁抱AI PC
其實邊緣、端側(cè)AI也未必得限定在生成式AI上。雖然“AI PC”這個概念主要是今年才被提出的,但PC平臺應用AI技術卻應該是自英偉達Turing架構(gòu)(RTX 20系顯卡)引入就開始的,要不然Tensor Core出了這么多年,用來干啥呢?
PC游戲中的AI深度學習超級采樣技術DLSS,就屬于典型的AI在游戲領域的應用:很多像素都不是靠GPU圖形單元渲染出來的,而是靠AI生成的——DLSS 3都開始生成幀了,3.5都開搞光線重建了,這些都是AI在做的。
還有像是最近更新的RTX VSR視頻超分辨率,將低分辨率的流播畫面通過AI超分為高分辨率,新版本據(jù)說還能在原始分辨率播放內(nèi)容時,消除畫面?zhèn)斡昂蛪嚎s失真......加上英偉達還有視頻會議眼神注視、畫面超分等AI技術與特性,此類技術都應該算是AI PC的組成部分,即便它們并不算是生成式AI。
而生成式AI的到來則必將加速AI PC對于AI技術的深入應用。有關生成式AI在PC平臺的應用問題,預計隨著生成式AI、大模型自身的發(fā)展,我們在明后年就能找到答案,大概率會有對應的殺手級應用出現(xiàn),就看開發(fā)者們天馬行空的創(chuàng)意了。
ChatGPT引爆市場以來,大眾討論最多的一個問題似乎是生成式AI要搶占人類的工作和地位了,我們是不是要失業(yè)了?在機械重復性工作的確可能面臨時代淘汰的危機下,這個時代愿意擁抱生成式AI的,也大有人在。而他們是真正將生成式AI作為生產(chǎn)力工具,引導自身和時代未來發(fā)展的一批人。

趙恩哲
比如最近首位獲得雨果獎的華人藝術家趙恩哲就以自己的手繪設計為基礎,借助GeForce RTX顯卡,用Stable Diffusion創(chuàng)作了主題為《虛空之舟》的作品。趙恩哲說:“從游戲電影行業(yè)產(chǎn)品的角度,用AI與算力降本增效來賦能開發(fā),這是值得肯定的。我個人喜歡手繪未來感的戰(zhàn)艦,更希望將這些戰(zhàn)艦與我心中的世界變成一部大片,一部游戲,原來靠我一個人的生產(chǎn)力是不太可能實現(xiàn)的。”
“現(xiàn)在有了AI輔助創(chuàng)作工具,可以基于我的想象力,給到我各種技術實現(xiàn)的可能性,原來要實現(xiàn)現(xiàn)在的結(jié)果至少需要很多工作者,幾個月的努力,現(xiàn)在卻在幾秒鐘內(nèi)呈現(xiàn)在我的面前。”這個例子應該是頗具代表性的,藝術家將AI與算力變成自身想象力擴展的工具。


虛空之舟
回到AI PC的話題。其實從高維度的系統(tǒng)層面來看,雖說現(xiàn)階段PC行業(yè)幾個主要市場競爭者的芯片跑生成式AI的上層軟件棧差別非常大,但最終都是為知名的大模型服務。就系統(tǒng)層面來評判各家跑AI的效率是可行的,比如說在所有層級都達成芯片企業(yè)部署的最高優(yōu)化水平時,用Stable Diffusion生成圖,看各家芯片和軟件需要多久。
明年我們應該能看到這樣的比較,對幾家主要競爭者而言都會是考驗。先預測一波,就英偉達在這個領域的多年積累,即便不說芯片架構(gòu)水平,軟件棧和生態(tài)的實力應該都足夠GeForce RTX GPU在這類競爭中拔得頭籌。對于生成式AI所需的大模型而言,算力仍然是必須的資源,而生態(tài)是高效利用資源的保障。
在PC行業(yè)的新一輪革命中,擁抱生成式AI的AI PC在當下才真正具備了競爭力。