今天的大模型,早就不是“一張顯卡跑天下”的時代了。
當模型參數從幾十億、幾百億,卷到千億、萬億級別時,真正的問題已經不再是:
“單塊 GPU 有多強?”
而是:
“幾百張、幾千張 GPU,能不能像一臺機器一樣協同工作?”
這才是 AI 基礎設施的核心戰場。
你可以把 GPU 想象成工人。一個工人再強,也搬不動一座山。真正的難點,是讓幾百個工人站在同一個工地上,不搶路、不撞車、不等人、不空轉。
英偉達的 SuperPOD,本質上就是為這個問題設計的。
它不是簡單地把 GPU 堆在機房里,而是通過 NVLink、NVSwitch、InfiniBand、RDMA 等一整套互聯技術,把很多 GPU 編織成一個巨大的計算網絡。
這篇文章,我們沿著英偉達三代架構往上看:
第一代:H100,如何把 256 張 GPU 連起來。
第二代:GH200,如何把 CPU 和 GPU 更緊地綁在一起。
第三代:GB200 NVL72,如何把一個機柜變成一臺“超級 GPU”。
看懂這條線,你就能理解:為什么 AI 算力競爭,已經從“芯片戰爭”升級成了“系統戰爭”。
一、H100 SuperPOD:先把 256 張 GPU 變成一個團隊
先從 H100 說起。
H100 是英偉達 Hopper 架構時代的代表產品,也是這一輪大模型訓練浪潮里的核心硬件之一。
但 H100 真正厲害的地方,不只是單卡算力,而是它可以被組織起來。
在 DGX H100 系統里,一臺服務器內部通常有 8 張 H100 GPU。
這 8 張 GPU 之間,并不是靠普通 PCIe 慢悠悠地交換數據,而是通過 NVLink 和 NVSwitch 進行高速互聯。

可以這樣理解:
NVLink 是 GPU 之間的高速公路。
NVSwitch 是高速公路上的立交橋。

有了它,8 張 GPU 之間可以高帶寬、低延遲地互相通信。對于大模型訓練來說,這件事極其重要。
因為訓練一個大模型時,參數、梯度、激活值并不會老老實實待在一張卡里。它們會在 GPU 之間頻繁流動。通信速度慢,GPU 就會干等。GPU 一干等,昂貴的算力就變成了機房里的暖氣片。
這也是為什么,在 AI 超算里,“通信能力”幾乎和“計算能力”同樣重要。
到了 DGX H100 SuperPOD,英偉達進一步把這種互聯從“服務器內部”擴展到了“服務器之間”。
一臺 DGX H100 是 8 張 GPU。
32 臺 DGX H100,就是 256 張 GPU。
這 256 張 GPU 通過 NVLink Switch System 連接起來,就形成了一個 H100 SuperPOD。

這里的關鍵變化是:過去 NVLink 主要解決單機內部 GPU 互聯,而 H100 SuperPOD 開始把 NVLink 的能力推向跨節點連接。
也就是說,英偉達不再滿足于讓一臺服務器內部的 8 張 GPU 高速通信,而是希望 32 臺服務器里的 256 張 GPU,也能盡可能像一個整體一樣協同工作。
這就是 SuperPOD 的第一層邏輯:
不是賣 GPU,而是賣“GPU 集群的組織方式”。
不過,H100 SuperPOD 也不是完美無缺。
它的瓶頸在于:單臺 DGX H100 內部的 GPU 總帶寬很高,但跨節點連接資源仍然有限。
也就是說,服務器內部像城市內環,車道寬、紅綠燈少;服務器之間像跨城高速,雖然很快,但車道數沒那么奢侈。
所以 H100 這一代的 SuperPOD,已經完成了從“單機 GPU”到“256 GPU 集群”的飛躍,但它仍然帶著一個問題:
當 GPU 數量繼續增加,網絡還能不能撐住?
這就引出了 GH200。
二、GH200 SuperPOD:CPU 和 GPU 不再是鄰居,而是室友
到了 GH200,英偉達做了一個很重要的改變:
把 Grace CPU 和 Hopper GPU 放在一起,做成 Grace Hopper Superchip。
簡單說,GH200 不是單純的一張 GPU,而是一個 CPU + GPU 的超級芯片組合。
過去,CPU 和 GPU 更像住在同一個小區的鄰居。它們可以互相訪問,但中間要經過 PCIe 等通道。數據搬來搬去,總有開銷。
而 GH200 的思路是:
別當鄰居了,直接住一屋。
Grace CPU 和 Hopper GPU 之間通過 NVLink-C2C 高速互聯,CPU 和 GPU 的關系變得更緊密。

這對 AI 和 HPC 工作負載有很大意義。
很多任務不是純計算問題,而是“計算 + 內存 + 數據搬運”的綜合問題。尤其是大模型訓練、推薦系統、圖計算、科學計算里,數據規模大,訪問模式復雜。如果 CPU 和 GPU 之間的通道太窄,就會形成“算力在前面狂奔,數據在后面騎共享單車”的尷尬局面。
GH200 要解決的,就是這個問題。
在 DGX GH200 SuperPOD 中,英偉達進一步使用 NVLink Switch System,把多個 GH200 連接起來,形成更大的 GPU 域。

這和 H100 SuperPOD 的差別在于:
H100 更像是把很多 GPU 服務器連起來。
GH200 則是先把 CPU 和 GPU 深度融合,再把這些融合后的超級芯片連起來。
這一步很關鍵。
因為 AI 超算的競爭,已經不是單純比 GPU 核心數量,而是比整個系統的數據流動能力。
數據能不能快速到達 GPU?
GPU 之間能不能快速交換結果?
CPU 能不能高效參與調度和內存管理?
這些問題,決定了昂貴 GPU 的利用率。
一臺 AI 超算最怕的不是沒有 GPU,而是 GPU 在等數據。
GPU 一等,老板心碎,電表狂笑。
三、GH200 NVL32:把“節點”做大,把機柜變成計算單元
GH200 之后,還有一個很有意思的形態:GH200 NVL32。
它的思路是把 32 個 GH200 組織在一個更緊密的機柜級系統里。
如果說 DGX H100 的基本單元是一臺 8 GPU 服務器,那么 GH200 NVL32 的思路,就是把基本單元進一步放大。

過去我們討論 AI 集群,常常是:
一臺服務器有幾張卡?
一個機柜有幾臺服務器?
一個集群有多少個機柜?
但到了 GH200 NVL32 這一類設計,機柜本身開始變成一個重要的計算單元。
這背后的趨勢很清楚:
AI 系統正在從“服務器級設計”走向“機柜級設計”。
為什么?
因為大模型太大了。
如果還按照傳統服務器思路,一臺一臺服務器拼起來,通信路徑會越來越長,網絡拓撲會越來越復雜,延遲和帶寬都會成為瓶頸。
所以英偉達開始把更多 GPU 放進一個更緊密的 NVLink 域里,讓它們在物理距離和通信拓撲上更接近。
你可以把它理解成城市規劃:
早期是一個個小區,各自獨立。
后來修路,把小區連成城區。
再后來,干脆重新規劃,把住宅、地鐵、商業、學校一起設計。
H100 是把 GPU 連起來。
GH200 是把 CPU 和 GPU 融合起來。
GH200 NVL32 則是把機柜變成更大的計算單元。
這條路繼續往前走,就到了 GB200 NVL72。
四、GB200 NVL72:一個機柜,就是一臺“巨型 GPU”
GB200 是 Blackwell 時代的核心平臺。
和 GH200 不同,GB200 的結構更激進:
一個 Grace CPU 搭配兩個 Blackwell GPU。
也就是說,一個 GB200 Superchip 里面,是 1 個 CPU + 2 個 GPU 的組合。
到了 GB200 NVL72,英偉達直接把 36 個 Grace CPU 和 72 個 Blackwell GPU 放進一個液冷機柜級系統里。

這就是 NVL72 名字里的 “72”:
72 張 Blackwell GPU。
這已經不是普通服務器概念了。
這更像是一臺機柜大小的超級計算機。
更關鍵的是,英偉達希望這 72 張 GPU 通過 NVLink 和 NVLink Switch System 組成一個巨大的 NVLink 域,讓它們在軟件和通信層面更像一個整體。

這對大模型尤其重要。
因為大模型越來越大,單卡顯存不夠,多卡顯存也不一定夠。真正需要的是一個巨大的、低延遲、高帶寬的共享計算空間。
如果 72 張 GPU 能更緊密地協同,它就不再只是“72 張卡”,而更像是一塊被拆成 72 個部分的巨型 GPU。
這就是 GB200 NVL72 最有想象力的地方。
它不是在回答:
“單張 GPU 多強?”
而是在回答:
“能不能把一個機柜變成一塊超級芯片?”
這也是為什么英偉達強調 rack-scale architecture,也就是機柜級架構。
以前的服務器設計,是把芯片裝進服務器。
現在的 AI 服務器設計,是把整個機柜當成芯片來設計。
芯片、封裝、板卡、服務器、機柜、網絡、液冷、電源、軟件調度,全部一起協同。
這已經不是單點創新了,而是系統工程。
五、從 72 到 576:GB200 SuperPOD 的真正野心
如果說 GB200 NVL72 是一個機柜里的 72 GPU 系統,那么 GB200 SuperPOD 要做的事情,就是把多個 NVL72 進一步連接起來。
按照公開資料,一個 GB200 SuperPOD 可以擴展到 576 張 Blackwell GPU。

576 是什么概念?
它不是把 576 張卡簡單塞進機房。
它的難點在于:
這些 GPU 之間如何通信?
數據如何同步?
訓練任務如何切分?
某個 GPU 或鏈路異常時,系統如何保持穩定?
網絡如何避免擁塞?
散熱和供電如何支撐?
到了這個規模,AI 超算已經像一座小型城市。
GPU 是大樓。
NVLink 是地鐵。
NVSwitch 是換乘站。
InfiniBand / RDMA 是城際高鐵。
液冷系統是地下水網。
調度軟件是城市大腦。
任何一個環節跟不上,整座城市都會堵車。
所以 GB200 SuperPOD 的意義,不只是 GPU 數量變多,而是英偉達把系統邊界繼續往外推了一層:
從單卡,到服務器。
從服務器,到機柜。
從機柜,到 SuperPOD。
這就是 AI 超算的演化方向。