ChatGPT等人工智能應用席卷而來,智能算力已成為當今數字社會發展的核心基礎設施。作為算力的主要載體,數據中心業務正面向生成式AI大模型轉變。大模型參數規模越大,數據集越多,其能力越強,這就帶來了巨量的運算。客戶常常投資千卡~十萬卡的大規模集群來分布式運算提高效率。但現實卻不盡如人意,花大價錢擴容的GPU集群,模型的訓練速度卻并沒有多大提高,這是為什么呢?實際上,算力提升了,連接算力的網絡性能不行,集群的運行效率一樣大打折扣。網絡就像服務器之間的高速公路,只有以最優的通信效率,保障訓練任務在多個GPU之間的高速分布式運轉,才能真正發揮算力集群的最大能力。
顯而易見,大規模智算GPU卡間通信的帶寬越大、數據傳輸越均衡流暢,GPU運算等待時間就越短,大模型訓練效率就越高。這就要求數據中心網絡具備大規模組網、穩定均衡無中斷的數據轉發以及全自動化的智能運維能力。
GPU算力集群的規模和組網所用的交換機端口速率、端口數量、組網架構息息相關。把網絡看成數據高速公路,端口數量好比車道數量,端口速率好比車道速度,組網架構好比公路布局。車道數量、車道速度以及公路布局共同決定了數據交通網的整體運輸能力。
400GE/800GE數據高速公路網
當前智算中心主流組網方案為兩層/三層CLOS架構,網絡設備能力決定了整個智算中心集群可連接的GPU規模。單端口速率相同的情況下,交換機設備的端口密度越高就好比車道越多的高速公路,可以連接的智算集群規模就越大。以中興通訊星云智算數據中心交換機為例,框式交換機ZXR10 9900X支持576個400GE端口,采用了業界領先的112G SerDes技術和正交架構,盒式交換機ZXR10 5960M支持128個400GE端口,盒式端口密度業界最大,框盒產品靈活搭配,可組建百卡~十萬卡任意規模智算中心集群建設需求。

兩層盒式交換機8K塊GPU(400GE網卡)組網

兩層框盒交換機36K塊GPU(400GE網卡)組網

三層盒式交換機512K塊GPU(400GE網卡)組網
CLOS架構因其靈活性和可擴展性廣泛應用于智算集群互聯。但另一方面,以海量并發大象流為特點的訓練業務容易在多層鏈路之間發生負載不均和擁塞問題。這就像節假日突然爆發的車流,一不小心就堵在了高速公路的某個路口,而其他路段卻車流稀少。怎樣才能減輕某些路段的運送壓力,平衡整個公路的車流,使大家能夠快速到達目的地呢?

大家肯定想到了通過導航指引,讓車流均衡分布在各個路段,這樣就可以最大化的跑滿高速公路,速度最快了。智算中心也是一樣,交換網絡好比高速公路,網絡控制平臺好比導航系統,服務器網卡好比駕駛員,業務流量就是高速公路上行駛的車流。
星云智算網絡中的IGLB(Intelligent Global Load Balancing)全局負載均衡技術,網絡控制器作為業務流量的導航系統,可以根據AI調度平臺了解業務流量狀態,從整網視角,選出當前業務的最優轉發路徑,使整個網絡的流量負載均衡,傳輸效率最佳。某萬卡智算集群實測顯示,部署IGLB全局負載均衡后,網絡吞吐效率大幅提升,從傳統60%提至98%以上。
全局路徑導航圖
如果網絡中某些鏈路已經擁堵或故障了,有沒有辦法可以協調業務呢?別擔心,星云智算網絡中的ENCC(End-to-Network Congestion Control)和ARN(Adaptive Route Notification)技術可以來幫忙。ENCC是一種端網協同技術,當網絡某點擁塞時,節點通告網卡降低發包速率或變更轉發路徑。ARN則是在網絡中進行故障路由通告,本地節點實時將故障信息通告給上游,上游節點在流量轉發時直接切換到備用路徑,確保訓練業務不中斷。這就像高速公路上的監測點,實時上報道路車流情況,駕駛員獲知前方路況后,可以通過降低車速或變換道路來避免擁堵。在中興通訊的星云大模型智算訓練集群中,ENCC和ARN可以實現流量擁塞和備用路徑的快速調整,調優時間從ms級降至5μs以內,GPU通信效率提升15%以上。

有了上述一系列的流控協同調優技術,再也不用擔心智算訓練大象流在網絡中發生擁塞,堵在路上耽誤GPU訓練了。
大家一定發現了,訓練任務跑在智算中心網絡這條高速公路上,想要更快、更順暢,一個智能自動化的交通指揮系統是萬萬離不開的。數據中心網絡的運維就像是高速公路運管,復雜又繁瑣。以一個8000卡的智算集群為例,涉及服務器1024臺,網絡設備192臺,光模塊超3.2萬個,光纖超1.6萬根,在工程開通階段所涉及的算網配置總量已達數十萬條,更不用說訓練過程中對業務的實時監控調優。如果沒有一個聰明智能的AI大腦,僅靠人力,這可搞不定。
中興通訊集成ZENIC ONE控制器的AI Booster平臺,從網絡規劃到運營維護,都能一鍵搞定,它還能預測和修復故障,讓運維變得輕松又高效。

在網絡規劃階段,ZENIC ONE自動收集網絡、服務器等設備的狀態和鏈路拓撲信息,用戶僅需輸入一些訓練任務的需求參數,ZENIC ONE就可以與集合通信庫實現聯動,給出從服務器到網絡的全局最優業務部署推薦,并輸出各方案的仿真驗證結果。
? ? ? ? ? ? ? ? ? ?
工程部署階段,ZENIC ONE還能夠將生成的配置文件一鍵自動部署到網絡,完成網絡設備、服務器、網卡端到端配置,并自動監測鏈路連接狀態。運維人員再也不用現場手工進行配置,萬卡級智算中心天級開通不是夢。?
到了任務運行階段,ZENIC ONE還能實時監控整網設備、鏈路、資源的使用情況,快速定界定位擁塞或故障,利用IGLB、ENCC、ARN等技術及時完成業務路徑的調優切換。對關鍵器件的主要參數也可以進行監控,當發現器件性能趨于劣化時,能夠提前預警,最大化的降低訓練任務中斷的發生率。以最常見的光模塊故障為例,ZENIC ONE 可以對多項關鍵參數進行監控分析,構建出精準的風險特征信息模型,提前對故障隱患光模塊主動識別。在某大模型智算集群中,該系統已成功識別并預警了多個高風險光模塊,預警準確率>99%。中興星云智算網絡,基于國產超大容量數據中心交換機和ZENIC ONE智能運維平臺,助力用戶構建千卡~十萬卡超大算力集群;基于智算流特征的主動式算網全域調優,確保訓練數據穩定均衡無中斷高速轉發;全域智能自動化管控工具,使能全新AI數智化運維,大幅提升運維效率。

中興星云智算網絡,就像給數據中心的“高速公路”裝上了渦輪增壓,讓數據傳輸更快、更穩、更智能。