芝能智芯出品AWS 通過推出自主研發的 Trainium2 處理器和基于其的 ExaFLOPS 超級計算機,開辟了一條與眾不同的 AI 路徑。
Trainium2 提供高達 1.3 FP8 PetaFLOPS 的性能,支持大規模生成式 AI 模型訓練和推理。基于 Trainium2 的超大規模集群,AWS 邁向 130 FP8 ExaFLOPS 的計算能力,直接挑戰 Nvidia GPU 的主導地位。與此同時,AWS 宣布即將推出性能提升四倍的 Trainium3 芯片。
這一趨勢表明,自研 AI 加速器正逐漸成為云計算巨頭優化成本和性能的核心競爭力。


●?Trainium2 作為亞馬遜的第二代 AI 加速器,展現出了獨特的架構設計與強大的性能表現。
◎?其采用多塊系統級封裝,包含兩個計算塊、使用四個堆棧的 96GB HBM3 內存以及兩個靜態芯片組以確保封裝一致性。
◎?在計算核心方面,由少量大型 NeuronCore 組成,這種設計與傳統 GPU 使用大量較小張量核心形成鮮明對比,大型核心在處理生成式 AI 工作負載時能夠有效減少控制開銷。

●?每個 NeuronCore 內部集成了張量引擎、矢量引擎、標量引擎和 GPSIMD 引擎,各司其職協同工作。
◎?張量引擎作為核心計算單元,以 128×128 脈動陣列的形式,從 SRAM 緩沖區收集輸入并輸出結果到部分和 SRAM 緩沖區,承擔了現代 LLM 工作負載中 80%以上的功率和 FLOPS 消耗。
◎?矢量引擎專注于加速矢量運算,如在注意層中計算 softmax 或在層/批處理規范化層中計算移動平均值和方差時發揮重要作用;
◎?標量引擎則用于執行元素級操作等簡單映射操作;
◎?而 GPSIMD 引擎具備圖靈完備性,可運行任意 C++代碼,方便開發人員快速實現自定義操作。
Trainium2 還創新性地配備了專用的集體通信核心,專門用于與其他芯片通信,實現了計算通信重疊且避免了資源爭用。
這一設計相較于 Nvidia 和 AMD GPU 在通信與計算資源共享同一核心的模式具有顯著優勢,大大降低了用戶在平衡通信與計算操作時的復雜性。

Trainium2 由 Annapurna Labs 設計,專為支持大規模生成式 AI 模型(如大型語言模型 LLM 和基礎模型 FM)設計。
●?具備以下特點:
◎?計算能力:每顆芯片提供 1.3 FP8 PetaFLOPS 性能,支持 BF16 和 FP8 精度。
◎?存儲性能:搭載 96GB HBM3,提供高達 46 TB/s 的帶寬。
◎?擴展性:通過 NeuronLink 網絡實現多芯片互連,支持多達 64 芯片的服務器配置,并擴展到超大規模集群。
●?ExaFLOPS 級超級計算機的構建與意義

ExaFLOPS(百億億次浮點運算每秒)代表了當前 AI 超級計算的頂級性能。AWS 基于數十萬個 Trainium2 構建的 Rainier 項目,將實現 130 FP8 ExaFLOPS,這一性能級別相當于約 32,768 塊 Nvidia H100 GPU 的總和。
通過將大量 Trainium2 處理器進行組合,如在 EC2 Trn2 UltraServer 中采用 64 個互連的 Trainium2 芯片,實現了高達 83.2 FP8 PetaFLOPS 的性能以及 6 TB 的 HBM3 內存,峰值帶寬達到 185 TB/s,并借助 12.8 Tb/s Elastic Fabric Adapter (EFA) 網絡進行互連,代號為“Rainier 項目”的 EC2 UltraCluster 更是由數十萬個 Trainium2 處理器驅動,預計可提供約 130 FP8 ExaFLOPS 的超強性能。

如此強大的計算能力為大規模 AI 模型的訓練和推理提供了堅實的基礎。在當今 AI 領域,隨著模型參數數量呈指數級增長,如 GPT-4 等模型已經擁有數萬億參數,對計算資源的需求也隨之急劇攀升。
ExaFLOPS 級超級計算機的出現,使得研究人員能夠在更短的時間內訓練出更加復雜、精準的 AI 模型,加速了 AI 技術在自然語言處理、計算機視覺、推薦系統等眾多領域的創新與應用進程,推動了整個 AI 行業從理論研究向實際大規模應用的跨越。
●?行業趨勢驅動因素

基礎模型和大型語言模型的快速發展使得模型參數數量不斷逼近數萬億級別。這種復雜度的提升對計算資源提出了前所未有的挑戰,傳統的計算架構難以滿足大規模模型訓練和推理所需的海量計算需求。
例如,在訓練 GPT-4 這樣的超大型模型時,需要耗費巨大的計算資源和漫長的時間,促使企業尋求更強大、更高效的計算解決方案,這成為了 AWS 研發 Trainium2 處理器并構建 ExaFLOPS 級超級計算機的主要驅動力之一。
在大規模 AI 計算場景中,成本和能源效率成為了關鍵因素。AWS 通過自研 Trainium2 處理器,旨在實現更高的性價比和能源效率。
Trainium2 在設計上針對 AI 工作負載進行了優化,例如采用相對較低的算術強度設計,以適應由于 ML 研究進展導致模型算術強度增長較慢的趨勢,如混合專家模型(MoE)中分組 GEMM 對內存帶寬需求較大的情況,通過優化芯片架構和系統集成,AWS 期望在提供強大計算能力的同時,降低訓練和部署 AI 模型的總體成本,提高能源利用效率,以滿足企業在大規模 AI 應用中的經濟和環保需求。

在全球科技競爭日益激烈的背景下,企業對于關鍵技術的自主可控性愈發重視。
AWS 作為全球領先的云計算服務提供商,通過自主研發 Trainium2 處理器,減少了對外部供應商(如 Nvidia)的依賴,實現了在 AI 芯片領域的自主可控,有助于保障其云計算服務的穩定性和安全性。
還能夠根據自身對市場需求的理解和技術發展趨勢的判斷,靈活地進行芯片技術的迭代和創新,形成獨特的技術差異化優勢。
Trainium2 的擴展網絡 NeuronLink 采用與 Nvidia NVLink 不同的拓撲結構,更接近于 TPU 類拓撲,通過點對點連接實現了特定的擴展功能,為用戶提供了另一種選擇,滿足了不同用戶在 AI 計算架構上的多樣化需求。
AWS 的這一舉措將對 AI 基礎設施市場格局產生深遠的影響,在芯片層面,Trainium2 處理器的出現打破了 Nvidia 在高性能 AI 芯片領域的長期主導地位,為市場引入了新的競爭力量。
隨著 AWS 不斷優化和推廣 Trainium2 及其后續產品,其他云計算服務提供商和企業可能會重新審視其芯片采購策略,考慮采用更多樣化的芯片解決方案,以避免過度依賴單一供應商。
這將促使芯片市場競爭更加激烈,推動各芯片制造商加大研發投入,加速技術創新,從而降低芯片成本,提高性能和能效。

在超級計算機領域,AWS 基于 Trainium2 構建的 ExaFLOPS 級超級計算機為企業和研究機構提供了一種全新的、可替代傳統 GPU 集群的高性能計算選擇。
這種大規模、低成本、高效率的超級計算機將吸引更多用戶將其 AI 工作負載遷移到 AWS 平臺,改變當前 AI 超級計算機市場的份額分布。
對于那些正在計劃構建或擴展其 AI 基礎設施的企業來說,AWS 的方案可能會成為一個極具吸引力的選項,從而影響整個 AI 基礎設施建設的市場走向,推動行業朝著多元化、高性能、低成本的方向發展。

為了鞏固其在 AI 領域的競爭優勢,AWS 將繼續沿著自主創新的道路前行,在芯片技術研發上,AWS 已經推出了 Trainium3 處理器,該處理器采用臺積電 3nm 級制程工藝制造,預計 2025 年面向客戶上市。Trainium3 的性能將是 Trainium2 的四倍,這將進一步提升 AWS 在 AI 芯片性能方面的競爭力。
AWS 可能會繼續加大在芯片研發上的投入,探索新的架構設計、制程工藝優化以及與其他技術(如量子計算、光子計算等新興技術)的融合可能性,以保持其在 AI 芯片技術前沿的地位。
AWS 將充分利用其全球領先的云計算服務平臺優勢,將 Trainium 系列處理器與其他 AWS 服務(如 Amazon S3 存儲服務、Amazon EC2 彈性計算服務等)進行深度整合,為用戶提供一站式的 AI 解決方案。
例如,通過優化 Trainium 與 Amazon S3 之間的數據傳輸通道,實現更快的數據加載和存儲,提高整個 AI 工作流程的效率。
此外,AWS 還將加強與合作伙伴的合作關系,包括 AI 軟件開發商、系統集成商、企業客戶等,共同探索 Trainium 系列處理器在不同行業和應用場景中的最佳實踐,拓展其市場應用范圍。
例如,與 AI 軟件開發商合作優化深度學習框架對 Trainium 處理器的支持,與企業客戶合作開發特定行業的 AI 應用解決方案,如醫療保健領域的疾病診斷輔助系統、金融領域的風險預測模型等,從而進一步擴大 Trainium 系列處理器在全球市場的影響力和占有率。
AWS 利用 Trainium2 處理器構建 ExaFLOPS 級超級計算機無疑是 AI 領域的一項重大戰略布局,其對技術創新、行業趨勢以及市場格局的影響深遠而持久。
AWS 在滿足 AI 計算需求日益增長的背景下,對成本、能效和自主可控性的深度考量與戰略追求,推動了 AI 基礎設施朝著多元化、高性能、低成本的方向發展。?