芝能智芯出品
在 Hot Chips 2024 上,微軟發布了其最新的定制 AI 加速器——MAIA 100,這一消息引起了業界的廣泛關注。
作為微軟 Azure 平臺的核心硬件之一,MAIA 100 展現了微軟在 AI 領域的雄心壯志,也體現了其在硬件定制化和性能優化方面的深厚積累。
MAIA 100 是微軟專為 Azure 平臺設計的定制 AI 加速器,專門用于運行 OpenAI 模型。
微軟在硬件設計上選擇了臺積電的 CoWoS-S 制程工藝,并采用了5nm技術節點。

Microsoft MAIA 100?
的技術規格和設計理念

MAIA 100反映了微軟在性能與功耗之間的平衡考量。
MAIA 100 配備了 64GB 的 HBM2E 存儲,這一容量足以應對大型模型的內存需求,同時避免了與 NVIDIA 和 AMD 在高端 HBM 供應鏈上的競爭。
MAIA 100 擁有一個 500MB 的大 L1/L2 緩存,這在 AI 加速器中并不常見,希望通過更大的緩存來加速數據訪問,提升計算效率。


在網絡連接方面,MAIA 100 提供了 12x 400GbE 的網絡帶寬,支持高性能計算所需的大規模數據傳輸。
這使得它非常適合超大規模的數據中心應用,尤其是在需要大量數據傳輸的深度學習任務中,這款加速器的 TDP 高達 700W,而在實際生產中每個加速器消耗約 500W,這也顯示出其在性能和功耗上的權衡。

MAIA 100 的架構設計突出了其高性能和多功能特性。每個 SoC 中包含 16 個集群,每個集群內有四個圖塊,這樣的設計能夠實現高效的并行計算能力。
此外,它還包含了圖像解碼器和機密計算功能,進一步增強了其多任務處理能力。
MAIA 100 的數據類型支持非常廣泛,可以處理 9 位和 6 位的計算。這種多樣化的數據支持,使得它可以靈活應對不同的 AI 計算任務,從而提升整體的計算效率。對于高性能計算,特別是在處理圖像和自然語言處理等任務時,這種靈活性尤為重要。



基于以太網的互連技術

在互連技術方面,微軟選擇了基于以太網的解決方案,并開發了定制的 RoCE 類協議。
這一選擇與傳統的 InfiniBand 不同,表明了微軟在互連技術上的創新性思維。基于以太網的互連技術不僅能夠降低成本,還能利用現有的網絡基礎設施,進一步推動 Azure 平臺的普及和應用。
微軟作為超級以太網聯盟 (UEC) 的主要推動者,選擇基于以太網的互連也是一個合理的戰略選擇。
通過推動基于以太網的互連標準,微軟可以在數據中心市場中占據更大的主動權和話語權。

MAIA 100 不僅在硬件上具有創新性,其軟件生態也是其一大亮點。
微軟為 MAIA 100 提供了專門的 Maia SDK 和異步編程模型,支持通過 Triton 或 Maia API 進行編程。這種設計為開發者提供了更多的靈活性,既可以使用高層次的編程模型,也可以通過低層次的 API 進行更精細的性能優化。
Maia 100 對 PyTorch 模型具有開箱即用的支持,開發者只需將后端從 CUDA 切換到 Maia 即可,這大大降低了遷移成本和學習曲線。
同時,Maia-SDK 中提供的工具鏈(如 maia-smi)也借鑒了 NVIDIA 和 AMD 的經驗,進一步簡化了開發和調試過程。

作為 Azure 平臺的定制 AI 加速器,MAIA 100 的推出表明微軟正在尋求更多的硬件自主權和市場競爭力。
在 AI 計算加速領域,NVIDIA 和 AMD 一直占據主導地位,但微軟通過定制化的硬件解決方案,可以更好地優化其云平臺的性能和成本結構,特別是在大模型和高性能計算領域。
MAIA 100 的 HBM 容量相對較小,但其高效的緩存和互連設計,以及針對特定任務的優化,使得它在特定場景下具有明顯的優勢。
在當前能源緊張的全球環境下,微軟的策略顯然是通過提供成本更低的 GPU 來贏得更多市場份額。


小結
Microsoft MAIA 100 代表了微軟在 AI 領域的又一次大膽嘗試。通過在硬件和軟件上的創新,微軟不僅希望在性能上挑戰現有的市場領導者,還希望在整體成本和能源效率上實現突破。?