

進入AI大模型時代,單個GPU訓練AI模型早已成為歷史。如何讓成百上千個GPU互連,組成宛若一個GPU的超級計算系統,成為業界熱點!
下載鏈接:
《高性能計算GPU合集》
1、GPU高性能計算概述 2、GPU深度學習基礎介紹 3、OpenACC基本介紹 4、CUDACC++編程介紹 5、CUDAFortr基本介紹
2024中國半導體深度分析與展望報告
面向異構硬件架構軟件支撐和優化技術
AI大模型賦能手機終端,擁抱AI手機新機遇
全球AI算力行業首次覆蓋:從云到端,云端協同,AI開啟科技行業超級成長周期
2024年中國大模型行業應用研究:大模型引領智能時代,助力各行業全面升級
《半導體行業系列專題合集》
1、半導體行業系列專題:刻蝕—半導體制造核心設備,國產化典范
2、半導體行業系列專題:碳化硅—襯底產能持續擴充,加速國產化機會 3、半導體行業系列專題:直寫光刻篇,行業技術升級加速應用滲透 4、半導體行業系列專題:先進封裝—先進封裝大有可為,上下游產業鏈受益
“人工智能+”進入爆發臨界,開啟繁榮生態前景
鯤鵬處理器軟件性能調優(精編版)
《算力網絡:光網絡技術合集(1)》
1、面向算力網絡的新型全光網技術發展及關鍵器件探討 2、面向算力網絡的光網絡智能化架構與技術白皮書 3、2023開放光網絡系統驗證測試規范 4、面向通感算一體化光網絡的光纖傳感技術白皮書
《算力網絡:光網絡技術合集(2)》
1、數據中心互聯開放光傳輸系統設計 2、確定性光傳輸支撐廣域長距算力互聯 3、面向時隙光交換網絡的納秒級時間同步技術 4、數據中心光互聯模塊發展趨勢及新技術研究
NVIDIA DGX SuperPOD是下一代數據中心人工智能(AI)架構。旨在提供AI模型訓練、推理、高性能計算(HPC)和混合應用中的高級計算挑戰所需的計算性能水平,以提高預測性能和解決方案的時間。
下面一起學習英偉達H100→GH200→GB200三代產品的GPU互連架構方案。
在DGX A100情況下,每個節點上8張GPU通過NVLink和NVSwitch互聯,機間(不同服務器)直接用200Gbps IB HDR網絡互聯(注:機間網絡可以用IB網絡,也可以用RoCE網絡)。
而在DGX H100的情況下,英偉達把機內的NVLink擴展到機間,增加了NVLink-network Switch,由NVSwitch負責機內的交換,NVLink-network Switch則是負責機間交換的交換機,基于NVSwitch和NVLink-network Switch可以搭建256個H100 GPU組成的SuperPod(即一個超級計算系統?),256個GPU卡Reduce帶寬仍然可以打到450 GB/s,和單機內部8個GPU卡的Reduce帶寬完全一致。

但是DGX H100的SuperPod也存在一定的問題,跨DGX H100節點的連接只有72個NVLink連接,SuperPod系統里并不是無收斂的網絡。
如下圖,在DGX H100系統里,四個NVSwitch留出了72個NVLink連接用于通過NVLink-network Switch連接到其他DGX H100系統,72個NVLink連接的總雙向帶寬是3.6TB/s,而8個H100的總雙向帶寬是7.2TB/s,因此,在SuperPod系統里在NVSwitch處存在收斂。

圖:基于H100搭建256 GPU的SuperPod

2023年,英偉達宣布生成式AI引擎DGX GH200投入量產,GH200是H200 GPU(H200與H100主要是內存大小和帶寬性能方面的區別)與Grace CPU的結合體,一個Grace CPU對應一個H200 GPU,GH200除了GPU之間采用NVLink4.0連接以外,GPU和CPU之間也采用NVLink4.0連接。

GH200通過NVLink 4.0的900GB/s超大網絡帶寬能力來提升算力,服務器內部可能采用銅線方案,但服務器之間可能采用光纖連接。對于單個256 GH200芯片的集群,計算側1個GH200對應9個800Gbps(每個800Gbps對應100GB/s,2條NVLink 4.0鏈路)光模塊。
GH200 SuperPod與DGX H100 SuperPod的區別在于在單節點內部和節點之間互聯時都是用NVLink-network Switch互聯。
DGX GH200采用二級Fat-tree結構,由8個GH200和3個一級NVLink-network Switch(每個NVSwitch Tray包含2個NVSwitch芯片,有128個Port)組成單機,32個單機經由36個二級NVLink-network Switch全互聯,形成了256個GH200的SuperPod(注意是36個二級NVLink-network Switch,這樣才能保證無收斂)。
圖:基于GH200搭建256 GPU的SuperPod

GH200 NVL32為機架級集群,單個GH200 NVL32擁有32個GH200 GPU和9個NVSwitch Tray(18個NVSwitch3.0芯片),如果組成256個GPU的GH200 NVL32超級節點,則需要再配置一級機間的36個NVLink-network Switch即可。

和GH200不同,一個GB200由1個Grace CPU和2個Blackwell GPU組成(注:單個GPU算力不完全等價B200)。GB200 Compute Tray是基于英偉達MGX設計的,一個Compute Tray包含2個GB200,也就是2個Grace CPU、4個GPU。
一個GB200 NVL72節點包含18個GB200 Compute Tray,即36個Grace CPU,72個GPU,此外還包含9個NVLink-network Switch Tray(每個Blackwell GPU有18個NVLink,而每個第4代NVLink-network Switch Tray包含144個NVLink Port,所以需要72*18/144=9個NVLink-network Switch Tray實現全互聯)。
圖:GB200 NVL72內部拓撲架構

在英偉達的官方宣傳中,8個GB200 NVL72組成一個SuperPod,從而組成一個由576個GPU組成的超級節點。
但是,我們通過分析可以看出GB200 NVL72機柜中的9個NVLink-network Switch Tray已經全部用于連接72個GB200了,已經沒有額外的NVLink接口用于擴展構成更大規模的兩層交換集群了,576個GPU的SuperPod從英偉達官方的圖片來看,更多的是通過Scale-Out RDMA網絡互聯的,而并不是通過Scale-Up的NVLink網絡互聯的。如果需要通過NVLink互聯來支持576個GPU的SuperPod,則需要每72個GB200配置18個NVSwitch,這樣單機柜就放不下了。
另外,英偉達官方說NVL72有單機柜版本,也有雙機柜的版本,并且雙機柜每個Compute Tray只有一個GB200子系統,這樣有可能是通過雙機柜的版本來實現通過NVLink互聯來支持576個GPU的SuperPod,這樣這個雙機柜版本的每個雙機柜有72個GB200和18個NVLink-network Switch Tray,從而可以滿足兩層集群的部署需要。如下圖所示:
圖:基于GB200搭建576GPU的SuperPod

和上一代256個H200全互聯類似結構類似,只是第一級及第二級所有的設備臺數有所不同,需要兩級NVLink-network Switch互聯:
第一級的一半Port連接576個Blackwell GPU,所以需要576*18/(144/2) =144個NVLink-network Switch,每個NVL72有18個NVLink-network Switch Tray。第二級Port全部與第一級的NVLink-network Switch Port連接,所以需要144*72/144=72 個NVSwitch。
文章來源:可鑒智庫
計算機行業深度:從技術路徑,縱觀國產大模型逆襲之路
本號資料全部上傳至知識星球,更多內容請登錄智能計算芯知識(知識星球)星球下載全部資料。

免責申明:本號聚焦相關技術分享,內容觀點不代表本號立場,可追溯內容均注明來源,發布文章若存在版權等問題,請留言聯系刪除,謝謝。
溫馨提示:
請搜索“AI_Architect”或“掃碼”關注公眾號實時掌握深度技術分享,點擊“閱讀原文”獲取更多原創技術干貨。

