本周在加利福尼亞州帕洛阿爾托(Palo Alto)舉行的 Hot Chips 大會上,NVIDIA 專家詳細介紹了 NVIDIA NVLink 和Spectrum-X 以太網技術、Blackwell 以及 CUDA 如何為全球數百萬的 AI 工作流加速推理。

AI 邏輯推理和網絡成為 Hot Chips 大會的首要焦點。
Hot Chips 是一個面向行業和學術界的關于處理器及系統架構的重要論壇,在太平洋時間 8 月 24 - 26 日于斯坦福大學舉辦,旨在展示創新成果,推動 AI 工廠發展,助力萬億美元的數據中心計算市場。
大會期間,NVIDIA 與谷歌(Google)和微軟(Microsoft)等行業領導者在 8 月 24 日(星期日)一起舉辦了一場“授課式”會議——探討如何為數據中心設計以機柜為單位的新架構。
此外,NVIDIA 專家還在四場會議和一場課程中詳細介紹了:
NVIDIA 網絡(包括 NVIDIA ConnectX-8 SuperNIC)支持機整柜和數據中心規模的 AI 邏輯推理。(由NVIDIA 負責網卡和 SoC 的首席架構師 Idan Burstein 主講)
由 NVIDIA Blackwell 架構所支持的神經渲染的進步及推理能力的巨大飛躍——從而提供更高級別的圖形和仿真功能。(由 NVIDIA 系統架構高級總監 Marc Blackstein 主講)
基于硅光技術的 NVIDIA CPO 交換機——采用光速光纖取代銅纜,可更快地傳送信息,并且功耗更低,助力打造高效、高性能的十億瓦級 AI 工廠。本次演講還將重點介紹 NVIDIA Spectrum-XGS 以太網,這是一種新的跨地域擴展技術,可將多個分布式數據中心組合為 AI 超級工廠。(由 NVIDIA 網絡高級副總裁 Gilad Shainer 主講)
NVIDIA GB10 超級芯片成為 NVIDIA DGX Spark 臺式超級計算機的引擎。(由 NVIDIA 高級杰出工程師 Andi Skende 主講)
這些都是 NVIDIA 的最新技術如何通過加速推理來推動各個領域和各種規模的 AI 創新的一部分。
NVIDIA 網絡促進了大規模的 AI 創新
AI 邏輯推理指的是 AI 系統可以通過多個 AI 推理步驟來分析和解決復雜問題——這需要機柜級規模的性能,以便高效地提供最佳的用戶體驗。
如今,為 AI 工作負載提供動力的數據中心里,網絡如同中樞神經系統一樣——將所有組件(服務器、存儲設備和其他硬件)統一連接成一個強大的計算單元。
Burstein 在 Hot Chips 大會上的報告將會深入探討 NVIDIA 網絡技術(特別是 NVIDIA ConnectX-8 SuperNIC)如何實現高速、低延遲的多 GPU 通信,并在大規模場景下提供領先的 AI 邏輯推理性能。

NVIDIA ConnectX-8 SuperNIC
作為 NVIDIA 網絡平臺的一部分,NVIDIA NVLink、NVLink Switch 和 NVLink Fusion 提供了縱向擴展(scale-up)連接——能夠在服務器內部及跨服務器連接 GPU 和計算元件,實現超低延遲、高帶寬的數據交換。
NVIDIA Spectrum-X 以太網提供了橫向擴展(scale-out) 來連接整個集群,能夠快速將海量數據集導入到 AI 模型中,并編排數據中心內的 GPU 到 GPU 的通信。Spectrum-XGS 跨區域擴展(scale-across)技術將 Spectrum-X 以太網的卓越性能和擴展能力擴展到多個分布式數據中心,組成十億瓦級的智能 AI 超級工廠。

NVIDIA Spectrum-XGS 以太網連接多個分布式 AI 數據中心
作為 Spectrum-X Ethernet 的核心,CPO 交換機推升了大規模 AI 基礎設施的性能和效率極限。Gilad Shainer 將在其演講中詳細介紹這一內容。
NVIDIA Blackwell NVL72——單機柜百億億級(Exascale)計算機——配備了 36 個 NVIDIA 超級芯片,其中每組芯片包含 2 個 NVIDIA GPU 和 1 個 NVIDIA CPU,通過目前最大的 NVLink 域實現互連。NVLink 交換機為 AI 和高性能計算工作負載提供每秒 130 TB/s的低延遲 GPU 通信。

NVIDIA 單機柜系統
NVIDIA Blackwell 架構,在推理性能方面實現了巨大的躍進。
NVIDIA GeForce RTX 5090 D v2 GPU(同樣由 Blackwell 提供支持)——通過 NVIDIA DLSS 4 技術將當今游戲中的 AI 性能翻倍。
它還能夠為游戲添加神經網絡渲染功能,提供至高可達 10 倍的性能提升、10 倍的存儲空間擴展,并將設計周期縮短 10 倍,有助于增強計算機圖形和仿真中的逼真度。這不但在低功耗的情況下提供了流暢、靈敏的視覺體驗,而且大大提升了游戲角色和特效的擬真度。
NVIDIA CUDA 是全球應用最廣泛的計算基礎設施,讓用戶能在任何地方利用 NVIDIA Blackwell 部署與運行AI模型。
全球已有數億臺的 GPU 運行 CUDA,從 NVIDIA Blackwell 架構規模的系統到搭載 GeForce RTX 和 NVIDIA RTX PRO 的 PC 和工作站,包括由 NVIDIA GB10 提供支持的 NVIDIA DGX Spark(在 Skende 的會議中討論過的)也即將發布。
從算法到 AI 超級計算機
對大語言模型(LLM)的全面優化

NVIDIA DGX Spark
DGX Spark 用小巧的機身提供了強大的性能和功能,使開發者、研究人員、數據科學家和學生能夠在桌面上突破生成式 AI 的界限,加速各行業的工作負載。
作為 NVIDIA Blackwell 平臺的一部分,DGX Spark 支持 NVFP4,這是一種低精度數值格式,用于實現高效的代理式 AI 推理,特別是針對大語言模型(LLM)。
通過開源協作推動推理創新
NVIDIA 通過加速各種開放源代碼庫和框架,來加速和優化 LLM 和分布式推理的 AI 工作負載。這些平臺包括NVIDIA TensorRT-LLM、NVIDIA Dynamo、TileIR、Cutlass、NVIDIA 集合通信庫和 NIXL——它們都已被集成到數百萬個工作流中。
為了支持開發者們能夠使用自己的框架,NVIDIA 已與頂級開放框架供應商合作,為 FlashInfer、PyTorch、SGLang、vLLM 等提供模型優化。
此外,NVIDIA NIM 微服務也可用于 OpenAI 的 gpt-oss 和 Llama 4 等熱門開放模型,使開發者能夠輕松地在其喜歡的基礎設施上,像運行自托管模型一樣靈活安全地操作托管應用程序界面。
參與 NVIDIA 在 Hot Chips 大會上的活動,以了解推理和加速計算的最新進展。
點擊“閱讀原文”或掃描下方海報二維碼,觀看 NVIDIA AI 研究負責人 Sanja Fidler、Aaron Lefohn 和 Ming-Yu Liu 的特別演講中文字幕版,了解他們如何為計算機圖形和物理 AI 的下一步發展布局。
