

當前,超萬卡集群的建設仍處于起步階段,主要依賴英偉達GPU及配套設備實現。英偉達作為全球領先的GPU供應商,其產品在大模型訓練上有較大優勢。得益于政策加持和應用驅動,國產AI芯片在這兩年取得長足進步,但在整體性能和生態構建方面仍存在一定差距。構建一個基于國產生態體系、技術領先的超萬卡集群仍面臨諸多挑戰。
隨著大模型從千億參數的自然語言模型向萬億參數的多模態模型升級演進,超萬卡集群亟需全面提升底層計算能力。具體而言,包括增強單芯片能力、提升超節點計算能力、基于DPU實現多計算能力融合以及追求極致算力能效比,具體參閱文章“超萬卡訓練集群互聯關鍵技術”。
1、超萬卡集群核心設計原則
在大算力結合大數據生成大模型的發展路徑下,超萬卡集群的搭建不是簡簡單單的算力堆疊,要讓數萬張GPU卡像一臺“超級計算機”一樣高效運轉,超萬卡集群的總體設計應遵循以下五大原則:
●堅持打造極致集群算力:基于Scale-up互聯打造單節點算力峰值,基于Scale-out互聯將單集群規模推高至萬卡以上,兩者疊加構建超萬卡集群的大算力基座;
●堅持構建協同調優系統:依托超大規模的算力集群,通過DP/PP/TP/EP等各種分布式并行訓練策略,持續提升有效算力,實現極致的計算通信比,最大化模型開發效率;
●堅持實現長穩可靠訓練:具備自動檢測和修復軟硬件故障的能力,面向千萬器件滿負荷運行系統,持續提升MTBF和降低MTTR并實現自動斷點續訓能力,支持千億稠密、萬億稀疏大模型百天長穩訓練,保證系統穩定性和魯棒性;
●堅持提供靈活算力供給:支持集群算力調度,提供靈活彈性的算力供給和隔離手段,實現訓練和推理資源的按需調配,保持單集群大作業和多租戶多任務并行訓練性能持平;
●堅持推進綠色低碳發展:持續推進全套液冷解決方案在超萬卡集群的應用,追求極致綠色算力能效比(FLOPs/W)和極低液冷PUE至1.10以下。
2、超萬卡集群整體架構設計
超萬卡集群的總體架構由四層一域構成(如圖1),四層分別是機房配套、基礎設施、智算平臺和應用使能,一域是智算運營和運維域。

●機房配套層:匹配超萬卡集群高密集約的建設模式,機房配套設施需重點考慮高效供電、制冷設計、樓板承重和走線架設計等。
●基礎設施層:算、網、存三大硬件資源有機配合,達成集群算力最優。面向算力,CPU、GPU、DPU三大芯片協同,最大化發揮集群計算能力;面向網絡,參數面、數據面、業務面、管理面獨立組網,參數面/數據面采用大帶寬RoCE交換和二層無阻塞CLOS組網滿足大象流,支持參數面負載均衡和多租安全隔離;面向存儲,引入融合存儲和分級存儲支持無阻塞數據并發訪問。
●智算平臺層:采用K8s,對上提供以裸金屬和容器為主的集群資源。在對集群資源進行納管的基礎上,進一步實現大規模集群的自動化精準故障管理,以達成高效訓練、長穩運行的目標。面向未來,考慮集群中引入異廠家GPU芯片,為避免智算碎片化問題,引入算力原生,實現應用跨架構遷移和異構混訓等平臺能力。
●應用使能層:包括模型訓練框架和開發工具集兩個模塊,一方面基于現有開源框架能力,進行分布式訓練調優,面向未來開展自動分布式訓練框架設計,積累經驗,實現對通信和計算重疊的優化、算子融合以及網絡性能的高效調優;另一方面,研發沉淀數據服務、模型部署開發等工具集,逐步實現由人工處理到基于工具對外提供自動化模型研發能力的轉變。
●智算運營和運維域:支持超萬卡集群高效集合通信和調度。支持按租戶靈活資源發放和任務調度,支持多任務并行訓練。
《70+篇半導體行業“研究框架”合集》
本號資料全部上傳至知識星球,更多內容請登錄智能計算芯知識(知識星球)星球下載全部資料。

免責申明:本號聚焦相關技術分享,內容觀點不代表本號立場,可追溯內容均注明來源,發布文章若存在版權等問題,請留言聯系刪除,謝謝。
溫馨提示:
請搜索“AI_Architect”或“掃碼”關注公眾號實時掌握深度技術分享,點擊“閱讀原文”獲取更多原創技術干貨。

