這個(gè)時(shí)代談到AI,硬件層面首先想到的一定是英偉達(dá),以及英偉達(dá)的數(shù)據(jù)中心加速卡——A100, H100之類。不過實(shí)際上,最早用于AI計(jì)算的英偉達(dá)GPU是游戲顯卡:GeForce GTX 580。也就是近代AI發(fā)展史最知名的ImageNet圖像識別大賽上,有團(tuán)隊(duì)率先用英偉達(dá)GPU外加CUDA來跑卷積神經(jīng)網(wǎng)絡(luò),隨后開啟GPU加速AI的新時(shí)代。
可見AI的GPU加速,發(fā)端還得是PC。所以雖然貌似AI PC這個(gè)市場概念的宣傳晚于這波AI大潮,但推進(jìn)生產(chǎn)力、拯救人類的,還得是臭打游戲的...
早兩年的GTC上,黃仁勛雖然主要談的都是AI和元宇宙,但他還在記者會上特地強(qiáng)調(diào)過,“別擔(dān)心,游戲仍然是我們關(guān)注的重點(diǎn)。”截至去年10月末的Q3 FY24財(cái)季,英偉達(dá)游戲(Gaming)業(yè)務(wù)營收28.56億美元——占到公司總營收的15.8%。這個(gè)數(shù)字和3年前游戲業(yè)務(wù)超過一半的營收占比已經(jīng)完全不能比了。相對的,數(shù)據(jù)中心業(yè)務(wù)當(dāng)季營收已經(jīng)拔高到145.14億美元。
但實(shí)際就營收基數(shù)來看,游戲業(yè)務(wù)當(dāng)季仍然實(shí)現(xiàn)了81%的同比增長。28.56億美元也是英偉達(dá)歷史上游戲業(yè)務(wù)最出色的成績。拉長時(shí)間線,近4年英偉達(dá)的游戲業(yè)務(wù)營收翻了超過一番。換做往常這種高增長是可以大唱贊歌的。架不住隔壁數(shù)據(jù)中心業(yè)務(wù)連續(xù)N個(gè)季度三位數(shù)增長,光芒太過耀眼…

對于英偉達(dá)現(xiàn)在的PC端——主要是游戲業(yè)務(wù)市場來說,實(shí)現(xiàn)高增長的業(yè)務(wù)機(jī)會,大概率也是腳踩著AI的風(fēng)火輪,和數(shù)據(jù)中心業(yè)務(wù)一起一路狂飆。畢竟我們一直在說,邊緣和端側(cè)AI的市場潛在機(jī)會大于數(shù)據(jù)中心AI。于是AI PC自然也是英偉達(dá)接下來要發(fā)展的重點(diǎn)。CES期間,英偉達(dá)在媒體溝通會上就說:“今年CES,彌漫最濃重的氣氛(biggest buzz)無疑就是AI PC了,而英偉達(dá)處于這一熱點(diǎn)的中央。”
跟英偉達(dá)爭搶AI PC風(fēng)頭的,還包括了Intel、AMD這樣的老對手。雖說英偉達(dá)在AI HPC領(lǐng)域是老大,但邊緣市場、AI PC領(lǐng)域可沒人想要讓著它。所以英偉達(dá)的AI PC究竟有何不同能夠令其脫穎而出?我們嘗試在今年的CES上找找答案。
英偉達(dá)AI PC現(xiàn)在發(fā)展到…
對于芯片廠商來說,AI PC的競爭基礎(chǔ)自然是芯片。對英偉達(dá)而言,GPU對于AI的加速是由來已久的:尤其自Turing架構(gòu)引入Tensor core以后,包括DLSS特性在內(nèi)的AI加速也就有了。
2018年英偉達(dá)演示實(shí)時(shí)光追的星球大戰(zhàn)demo。據(jù)說在Turing架構(gòu)的GeForce RTX 20系顯卡問世以前,這樣一個(gè)demo需要4張面向數(shù)據(jù)中心的V100才能實(shí)現(xiàn)——V100當(dāng)時(shí)的售價(jià)是6萬美刀;而Turing架構(gòu)憑借新增的光追單元RT core、AI單元Tensor core,外加一般的CUDA core,GeForce RTX 2080一張卡就做到。
英偉達(dá)提供的數(shù)據(jù)是,從2018年到現(xiàn)在,RTX顯卡的AI性能提升了10倍。目前最新的第4代Tensor core達(dá)成了1300 TOPS的AI算力水平。

CES期間更新的GeForce RTX 40系Super顯卡(包括RTX 4080 Super,4070 Ti Super,4070 Super)雖然并非本文要談的重點(diǎn),但這次發(fā)布除了按照常規(guī)去談?dòng)螒蛐阅芴嵘ミ_(dá)還特別強(qiáng)調(diào)了這幾張卡在AI性能方面的進(jìn)步:不僅標(biāo)注Int8算力,還特別提及4080 Super在游戲AI幀生成(DLSS 3)、文生圖(Stable Diffusion)、文生視頻(Stable Video Diffusion)方面,相比于3080 Ti分別有2倍、1.7倍、1.5倍的速度提升。
不僅是增加算力單元,Super系這次統(tǒng)一提配存儲資源(包括L2 cache和顯存帶寬)是著力于AI的典型表現(xiàn)。而這些宣傳數(shù)字,以前好像只有在數(shù)據(jù)中心的通用加速卡(Hopper架構(gòu))和圖形卡(Ada Lovelace架構(gòu)的L系列)上才看得到,這會兒也能在GeForce顯卡上見到了。可見這波AI PC的熱潮是真的要來了。
單純就算力水平,外加軟件和生態(tài)可達(dá)成的有效算力,英偉達(dá)占據(jù)的AI PC生態(tài)位暫時(shí)也不是Intel和AMD可及的:畢竟4080 Super標(biāo)稱的AI算力是836 TOPS;另外兩家用于AI PC的SoC這個(gè)數(shù)字還是兩位數(shù)。而AI算力基本決定了AI PC的能力上限。Justin Walker(GeForce產(chǎn)品高級總監(jiān))在媒體會上說競爭對手應(yīng)該并不存在“直接與我們競爭的產(chǎn)品”,“沒有任何其他產(chǎn)品能夠提供這個(gè)級別的價(jià)值和性能”。

另一方面是生態(tài)和軟件相關(guān)的——這也是目前邊緣AI推理競爭的關(guān)鍵。英偉達(dá)給出的數(shù)據(jù)是,當(dāng)前RTX GPU出貨量已經(jīng)達(dá)到了至少1億片,所以AI PC應(yīng)用的硬件基礎(chǔ)是廣泛的。
英偉達(dá)通用計(jì)算加速卡與圖形顯卡的架構(gòu),在可編程和AI部分是保持了同步的。兩者的同宗同源決定了GeForce顯卡在執(zhí)行AI工作時(shí),與數(shù)據(jù)中心加速卡共享NVIDIA AI生態(tài)——所以我們多少會在某些AI研究中看到GeForce的身影,即便這可能不是英偉達(dá)的本意;現(xiàn)成的資源,加速AI應(yīng)用也是很順手。
不過大概是為了考慮更多愛好者和一般PC用戶,也是要明確加速英偉達(dá)的AI PC生態(tài)發(fā)展——尤其是生成式AI:去年10月英偉達(dá)發(fā)布TensorRT-LLM for Windows,在Windows平臺可用單卡GPU做LLM推理加速,尤其明確對GeForce RTX 40系顯卡做出支持,讓PC跑Llama2、Mistral這類模型時(shí),速度快了4-5倍。
還有就是為Stable Diffusion WebUI做了個(gè)TensorRT擴(kuò)展,文生圖、圖生圖的速度也提升了2倍。
至于非生成式AI的其他AI應(yīng)用就更不必多說了:這其中的一個(gè)典型代表是DLSS,已經(jīng)從此前的AI超分,發(fā)展到AI補(bǔ)幀,再到最新的AI光線重建。DLSS基本可以認(rèn)為是當(dāng)代游戲和專業(yè)視覺領(lǐng)域的AI殺手級應(yīng)用——所謂現(xiàn)在每8個(gè)像素,就有7個(gè)像素是AI生成的。
這次英偉達(dá)給我們現(xiàn)場展示用D5渲染器在一臺GeForce RTX 4070筆記本上渲染某個(gè)包含光追的復(fù)雜場景,開關(guān)DLSS 3.5的流暢度差異,還是給我們留下了相當(dāng)深刻的印象。

D5渲染器中的DLSS 3.5選單,包含超分、光線重建、幀生成幾個(gè)選項(xiàng)
這次CES期間,英偉達(dá)針對生成式AI端側(cè)生態(tài)的更新依然主要是兩個(gè)方向:LLM和Stable Diffusion。Chat with RTX,基于RGA(retrieval-augmented generation)直接讓LLM大語言模型與用戶選擇的文檔或視頻進(jìn)行連接;也就是能夠基于用戶提供的數(shù)據(jù),和LLM做更精準(zhǔn)的個(gè)性化對話。
其次是針對Stable Diffusion XL和SDXL Turbo的TensorRT加速(同樣是A1111的WebUI版Stable Diffusion),據(jù)說更新過后,這兩個(gè)模型的速度快了60%。
聽說英偉達(dá)有AI生態(tài)優(yōu)勢?什么優(yōu)勢?
就生態(tài)角度來看,英偉達(dá)和Intel、AMD的起點(diǎn)還是很不一樣。不是說GeForce顯卡的算力更高,而是NVIDIA AI全棧生態(tài)對于其他所有現(xiàn)存生態(tài)的碾壓。畢竟這是個(gè)耕耘了十多年的生態(tài)——即便除了DLSS, DLAA(Deep Learning Anti-Aliasing)之類的應(yīng)用以外,此前的NVIDIA AI生態(tài)耕耘不是特別著力在PC平臺的,各種庫、中間件基礎(chǔ)也足夠?yàn)锳I PC的生態(tài)發(fā)展打底了——TensorRT-LLM for Windows不就是基于發(fā)展有些年頭的TensorRT么?
以往幾年的好些文章我們都談過NVIDIA AI在做的各種五花八門的AI應(yīng)用和工具,什么預(yù)訓(xùn)練模型、遷移學(xué)習(xí)、聯(lián)邦學(xué)習(xí)、合成數(shù)據(jù)生成、部署工具、推理引擎等等;而且是跨汽車、機(jī)器人、醫(yī)療、行業(yè)邊緣等不同領(lǐng)域。下面這張圖中與平臺層NVIDIA AI連線的系統(tǒng)軟件,及上層的應(yīng)用框架都屬于其中組成部分——這還只是個(gè)大框架。

我們在2021年GTC上見到的Toy Jensen——光這個(gè)老黃卡通形象,其中就包含了Riva, Audio2Face, Animation Graph, MDL等在內(nèi)的各種技術(shù),大部分是AI相關(guān)的。應(yīng)該說在整個(gè)電子產(chǎn)業(yè)內(nèi),有資格說一句具備“端到端”AI能力的企業(yè),就只有英偉達(dá)這一家。當(dāng)然這里的絕大部分都還是主要和訓(xùn)練相關(guān)的。
不過AI PC對英偉達(dá)而言也稱得上手拿把掐。比如AI PC常被提到的視頻會議背景虛化、眼神注視、畫質(zhì)增強(qiáng)之類的特性(Maxine框架的組成部分),在英偉達(dá)這兒都只能說是小巧。從圖形的角度來看,PC上的DLSS本身已經(jīng)被說得夠多了;而單是前年亮相專門為游戲mod制作者們準(zhǔn)備的RTX Remix,在AI能力上基本就是競爭者難以復(fù)制的。不光是給老游戲加上光追和DLSS,還在于對老游戲中的貼圖做推理,基于AI轉(zhuǎn)為高清精美紋理。
CES期間,英偉達(dá)也宣布了RTX Remix今年1月就要開放beta版了。Mod制作者基于生成式AI就能對老游戲的低分辨率紋理做簡單替換,而且這種AI紋理是“4k物理級精準(zhǔn)”的,木頭門、蠟燭、大理石表面的桌子、油漆桶這些要素都能基于人工智能“YY”出來。


Orbifold Studios用RTX Remix做的《半條命2》MOD游戲畫面前后對比
RTX Remix反映的其實(shí)不只是英偉達(dá)想在mod領(lǐng)域一展拳腳,更多的是基于USD標(biāo)準(zhǔn)為Omniverse和元宇宙添磚加瓦,同時(shí)用到了AI技術(shù)。這就是另外的話題了——但RTX Remix看似這么個(gè)“小工具”的推出,就絕對不是其他市場參與者能隨隨便便做得出來的。
只不過上面這些更多體現(xiàn)的,可能主要還是英偉達(dá)在數(shù)據(jù)中心的AI生態(tài)能力。這些對AI PC而言有價(jià)值嗎?
云邊協(xié)同,是個(gè)思路
對于英偉達(dá)而言,可能更加符合直覺、能夠給予AI PC發(fā)展助力的,就是利用其數(shù)據(jù)中心市場的優(yōu)勢。這其實(shí)還關(guān)聯(lián)了另一個(gè)問題:如果說Co-pilot, Midjourney這些云上工具這么好用,我們?yōu)槭裁催€要選擇本地的Llama 2和Stable Diffusion呢?尤其在前兩者基本還都是靠英偉達(dá)GPU作支撐的情況下。
當(dāng)然AI不只是生成式AI,比如DLSS——那必須用本地資源,這是游戲的實(shí)時(shí)交互需求決定的。對于生成式AI而言,本地算力優(yōu)勢的常規(guī)回答是:安全、隱私、不需要聯(lián)網(wǎng)、低延遲。
可能很多個(gè)人用戶對數(shù)據(jù)安全不以為意。最近Trail of Bits才剛剛披露了蘋果、AMD、高通等多品牌GPU的LeftoverLocals漏洞——借助GPU本地內(nèi)存泄露,攻擊者可以跨進(jìn)程或者container邊緣,監(jiān)聽LLM大預(yù)言模型給到其他用戶的響應(yīng)。換句話說你在云上與LLM的對話,別人是能看見的。這對企業(yè)和個(gè)人而言都是不可接受的。(英偉達(dá)倒是確認(rèn)了,他們的設(shè)備目前沒有受到該漏洞的影響)
除此之外,還有兩個(gè)原因。其一是AI模型的個(gè)性化需求:從今年CES展來看,這個(gè)個(gè)性化就不光是用Stable Diffusion畫小姐姐了,還在于未來AI PC作為“私人助理”這個(gè)角色存在時(shí),為PC用戶提供更為個(gè)人化的定制服務(wù)——這是個(gè)現(xiàn)在看來還是有點(diǎn)兒前瞻的發(fā)展方向。
至少到現(xiàn)在為止,我們認(rèn)為有能力更快在PC上做到“個(gè)人AI模型”的就是英偉達(dá)了。比如這次更新的Chat with RTX,不就屬于個(gè)性化模型的雛形嗎?

其二是本地與云AI的結(jié)合,用行業(yè)的流行詞叫“云邊協(xié)同”。也就是說云和端是各司其職、各展所長的,那么Co-pilot與Llama 2也就沒有沖突了;英偉達(dá)也能利用好其數(shù)據(jù)中心的市場與技術(shù)優(yōu)勢。
這類云邊協(xié)同的例子現(xiàn)階段就有。比如說視頻會議時(shí)本地做基于AI的背景虛化、眼神注視,而云上Co-pilot還是能夠用來總結(jié)會議內(nèi)容;再比如Photoshop現(xiàn)在用Firefly實(shí)現(xiàn)圖片的選取自動(dòng)填充(Generative Fill)是基于云的,本地仍然可以做圖片AI降噪、消除畫面中多余對象之類的處理。
英偉達(dá)在這次CES上發(fā)布了更有云邊協(xié)同必要性的“混合AI”應(yīng)用NVIDIA ACE(Avatar Cloud Engine)。ACE最早是在2022年發(fā)布的,去年Computex上英偉達(dá)又發(fā)布了NVIDIA ACE游戲開發(fā)版——這個(gè)技術(shù)平臺能讓游戲里的NPC具備與玩家進(jìn)行生成式AI對話的能力。

所謂的基于“混合AI”,是ACE的實(shí)現(xiàn)需要本地AI算力與云上AI算力共同完成。我們在CES現(xiàn)場看到了英偉達(dá)演示這項(xiàng)技術(shù)。首先玩家與NPC說話——這個(gè)過程需要基于語音轉(zhuǎn)文本的自動(dòng)語音識別模型(英偉達(dá)的Riva),推理過程基于PC端的GeForce顯卡;
隨后文字信息發(fā)往云上的推理服務(wù)器,由服務(wù)器基于LLM大語言模型進(jìn)行推理,得到NPC的回復(fù)內(nèi)容;第三步同樣是在云上,將這些文字回復(fù)轉(zhuǎn)為語音;語音信息返回到本地PC,本地PC再基于英偉達(dá)的Audio2Face,將聲音和NPC的唇形、表情做匹配;最終通過游戲引擎渲染呈現(xiàn)出畫面。
實(shí)際上,英偉達(dá)的演示不止玩家可與游戲NPC進(jìn)行對話,NPC與NPC之間也能進(jìn)行基于這套流程的對話,每次的對話內(nèi)容都還不一樣。而且玩家與NPC對話,能讓NPC做出一些動(dòng)作反映:比如現(xiàn)場英偉達(dá)就給我們展示了,基于對話內(nèi)容,讓拉面店老板招待飲料、不同口味的拉面,換個(gè)符合氣氛的燈光等;甚至可以針對桌子上的某個(gè)東西問他,這是什么,NPC也能娓娓道來地述說這東西的來由,以及有什么特殊意義。
而且話題是完全自由、沒有限定的,想聊什么都可以,NPC也基于自己的人物設(shè)定來做出回應(yīng)。這不就是多年前人們追求的NPC完美智能化嗎?也才真正有了NPC是鮮活個(gè)體的游戲體驗(yàn)。有沒有元宇宙的既視感了?

面向開發(fā)者合作伙伴,英偉達(dá)這次主要是發(fā)布了Ace Production Microservices(ACE產(chǎn)品微服務(wù))。開發(fā)者可以使用上述英偉達(dá)的Audio2Face和Riva兩個(gè)模型——將模型融入到游戲中。其他部分構(gòu)成,英偉達(dá)選擇了與Convai合作——這是能夠讓開發(fā)者更簡單地集成基于生成式AI游戲角色的平臺。
Convai把Ace Production Microservices融入到了其框架流程中。在Convai的ACE實(shí)現(xiàn)流程里,云上LLM+RAG做出NPC響應(yīng)的部分,以及文字轉(zhuǎn)語音的部分都可由Convai解決;另外Convai向游戲開發(fā)者提供角色API,可給出包括角色背景故事、人格、動(dòng)作、場景感知、長期記憶之類的構(gòu)成,最終基于Convai的虛幻引擎插件來輸出游戲中的AI NPC。

英偉達(dá)現(xiàn)場工作人員告訴我們,雖然目前還沒有基于ACE的成品游戲問世,但這項(xiàng)服務(wù)已經(jīng)和包括米哈游、網(wǎng)易游戲、騰訊、育碧、掌趣、Inworld等在內(nèi)的開發(fā)者達(dá)成合作,準(zhǔn)備將ACE技術(shù)用到游戲和應(yīng)用中。當(dāng)然他們也特別強(qiáng)調(diào)了NPC可以講不同國家的語言,包括中文——料想這一點(diǎn)應(yīng)當(dāng)主要與服務(wù)中的模型相關(guān)。
這應(yīng)該是GeForce高級副總裁Jeff Fisher在CES的Special Address上說“生成式AI提供遠(yuǎn)多于互聯(lián)網(wǎng)的機(jī)會,它將改變我們與游戲的交互方式”這句話的原因。其實(shí)仔細(xì)想想,元宇宙本身就是游戲的終極形態(tài),而填充元宇宙內(nèi)容的方法就是以ACE為代表的生成式AI。
AI PC,基礎(chǔ) vs 高階能力
以上只談到了英偉達(dá)在CES上的一部分內(nèi)容發(fā)布。除此之外,相關(guān)于GeForce的發(fā)布我們還看到了:
(1)iStock的生成式AI發(fā)布,基于英偉達(dá)Picasso平臺——基于GettyImage的圖片庫,進(jìn)行有版權(quán)保護(hù)的文生圖,以及圖片擴(kuò)寫、圖片中的對象替換、畫面場景不同層級剝離;
(2)與Twitch, OBS合作,發(fā)布Twitch Enhanced Broadcasting,在采用RTX顯卡的設(shè)備上進(jìn)行游戲直播,支持5條并發(fā)流,且在不同的直播視頻流觸達(dá)的設(shè)備上,可以不同的分辨率和幀率顯示;且當(dāng)前Twitch正嘗試基于RTX顯卡的4K AV1格式流播;
(3)AI加強(qiáng)的RTX Video HDR,可理解為基于AI把SDR視頻動(dòng)態(tài)范圍擴(kuò)展到HDR;
(4)GeForce NOW云游戲加入《使命與召喚:現(xiàn)代戰(zhàn)爭3》《暗黑破壞神IV》《守望先鋒2》《星穹鐵道》《Pax Dei》等游戲;同時(shí)2月開始為玩家開啟Day Pass(一日票)這一試玩性質(zhì)的選擇。
不過這些應(yīng)當(dāng)暫時(shí)和國內(nèi)的用戶關(guān)系都不大,就不做詳述了,我們也在活動(dòng)現(xiàn)場表達(dá)了對于英偉達(dá)與國內(nèi)同類開發(fā)者合作的期望。另外,還有來自O(shè)EM廠商的一波采用GeForce RTX 40系顯卡的AI PC筆記本上市,包括Dell XPS 14, 三星Galaxy Book4 Ultra, 聯(lián)想Yoga Pro 9i, ROG幻16等…“AI算力覆蓋從130 TOPS到635 TOPS”…看看,現(xiàn)在上個(gè)獨(dú)顯筆記本都要強(qiáng)調(diào)AI算力了…

最后想談個(gè)簡單的話題。很多年前GPU還主要用作圖形渲染時(shí),Intel推廣自家核顯是不排斥英偉達(dá)和AMD獨(dú)顯的。當(dāng)時(shí)核顯與獨(dú)顯的關(guān)系更像是核顯提供入門級的圖形渲染能力,獨(dú)顯則補(bǔ)充供給圖形計(jì)算的高階需求——包括3A游戲和專業(yè)視覺應(yīng)用。
那么為什么到了AI時(shí)代,幾方似乎就不在一個(gè)頻道上了呢?我們猜測,一方面當(dāng)代芯片廠商普遍在推行XPU策略、構(gòu)建自有生態(tài)護(hù)城河——AMD, Intel, 蘋果, 高通, Arm都是這個(gè)思路;
其次是微軟作為操作系統(tǒng)供應(yīng)商,在圖形加速卡發(fā)展前期是充當(dāng)了標(biāo)準(zhǔn)制定者的角色的,DirectX成為Windows平臺事實(shí)上的圖形標(biāo)準(zhǔn);而現(xiàn)在,當(dāng)GPU用于AI計(jì)算時(shí),微軟這一角色存在著大量不確定性——具體的原因又可以專門寫篇文章了,受限于篇幅不做贅述;
這就導(dǎo)致了至少到目前為止,芯片企業(yè)普遍在推自家的API與開發(fā)生態(tài)——而且似乎不同芯片企業(yè)的這一態(tài)度還比較堅(jiān)定;在這個(gè)階段,Intel, AMD與英偉達(dá)暫時(shí)形成了完全的競爭關(guān)系。
未來AI PC生態(tài)會向哪個(gè)方向走未為可知。不過我們認(rèn)為,起碼現(xiàn)階段Intel與AMD的AI PC提供的主要還是PC平臺的AI與生成式AI基礎(chǔ)能力。如前文所述,不僅是這兩家提供的端側(cè)AI算力有限,而且在于開發(fā)生態(tài)發(fā)展相對早期。
實(shí)際上英偉達(dá)現(xiàn)如今的AI PC生態(tài)開發(fā)也只能說是早期。但由于起點(diǎn)高,英偉達(dá)AI PC更有機(jī)會成為高階AI應(yīng)用的源頭。不過這仍取決于將來誰更快搶占了AI PC的生態(tài)制高點(diǎn):在這一局里,英偉達(dá)顯然是具備了先發(fā)優(yōu)勢與AI技術(shù)儲備的。尤其在AI有革新游戲行業(yè)潛力的當(dāng)下,英偉達(dá)大概也更有主場優(yōu)勢,DLSS, RTX Remix, ACE都是個(gè)中寫照。