
Broadcom的Hasan Siraj在討論AI的網絡需求時,強調了以太網在擴展AI集群中的核心作用,并指出其在故障恢復和成本效率方面相較于InfiniBand的優勢。
網絡是擴展大型AI集群的關鍵要素,而以太網是合適的技術選擇。
在訓練推薦模型時,Meta發現網絡所花費的時間占比在18%到57%之間,這直接影響了集群的投資回報率(ROI)。
AI網絡的獨特之處在于其對極高帶寬、RDMA流量(大量數據傳輸)、間歇性數據激增的需求,以及落后數據對作業完成時間的顯著影響,加之訓練作業通常運行時間較長。

來源:Bradcom
他突出了公司端點調度解決方案(Tomahawk 5)和交換機調度(Jericho3-AI)。Jericho3-AI在單一域中,對32,000個加速器每個以800Gbps的速度,提供了10%的作業完成時間性能提升。? ??

來源:Broadcom
Broadcom的THOR2 AI優化網卡是一款支持大規模RDMA的400G高性能網卡,具有最長的100G Serdes覆蓋范圍,功耗僅為80W(比其他DPU低75%)。THOR2的功耗模型包括板卡、芯片組或IP。
以太網提供了比InfiniBand快30倍的故障恢復能力。一個4K集群每月會有15次故障(2%的年故障率)。
降低AI互連成本:如果不使用銅纜,可以使用線性可插拔光學器件(功耗降低33%),共封裝光學器件提供了更低的功耗和成本,預計不久的將來大規模制造將推動其采用。
最大的集群——亞馬遜擁有超過6萬片的GPU,甲骨文擁有超過3萬片,Meta擁有超過2萬片等——都使用以太網。? ??
Broadcom正在討論的系統涉及數十萬GPU或1M+的分布式超級計算機中的加速器。
Ultra Ethernet Consortium:與經典RDMA相比,Ultra Ethernet將提供亂序放置、選擇性確認和重傳、數據包級多路徑、無需配置的擁塞控制。
以太網普遍部署,擁有開放標準,為AIfabrics提供了最高的RDMA性能,成本低于InfiniBand,提供了前后端的部署一致性,高可用性,并得到了大型生態系統的支持。
內容來源:AI Hardware Summit 2024 ? ?
高端微信群介紹 | |
創業投資群 | AI、IOT、芯片創始人、投資人、分析師、券商 |
閃存群 | 覆蓋5000多位全球華人閃存、存儲芯片精英 |
云計算群 | 全閃存、軟件定義存儲SDS、超融合等公有云和私有云討論 |
AI芯片群 | 討論AI芯片和GPU、FPGA、CPU異構計算 |
5G群 | 物聯網、5G芯片討論 |
第三代半導體群 | 氮化鎵、碳化硅等化合物半導體討論 |
存儲芯片群 | DRAM、NAND、3D XPoint等各類存儲介質和主控討論 |
汽車電子群 | MCU、電源、傳感器等汽車電子討論 |
光電器件群 | 光通信、激光器、ToF、AR、VCSEL等光電器件討論 |
渠道群 | 存儲和芯片產品報價、行情、渠道、供應鏈 |

< 長按識別二維碼添加好友?>
加入上述群聊

帶你走進萬物存儲、萬物智能、
萬物互聯信息革命新時代
