
本文由半導體產業縱橫編譯自nextplatform
?
AMD 已經完成了對賽靈思的收購,由于過去一年半時間里 AMD 的股價上漲,最終成本接近 490 億美元,而不是在 2020 年 10 月宣布該交易時預計的 350 億美元。
現在外界很自然地想知道 CPU 和GPU 設計師將如何使用他們所獲得的東西。不僅是作為 Xilinx 器件核心的 FPGA 可編程邏輯,還包括在所有 FPGA 混合中變得普遍的模塊,例如 DSP 引擎、AI 加速器、內存控制器、I/O 控制器和其他類型的互連 SerDes。
?
AMD 需要很長時間才能建立一支工程師團隊,才能擁有賽靈思在可編程邏輯方面以及在其航空航天、國防、電信/通信、工業和廣播/媒體業務領域所獲得的專業知識。再加上 Vitis 軟件堆棧,這就是為什么賽靈思的價值超過了一家在其他領域擁有收入和利潤流且與 AMD 核心業務幾乎沒有重疊的公司的價值。這為AMD打開了一個更廣泛的潛在市場,Lisa Su 預計AMD 潛在市場達到1350 億美元,遠超于六個月前預測的 790 億美元規模。
?
AMD 以及數據中心的任何主要芯片設計師都不清楚他們從第三方獲得了多少 IP 塊的許可。這可能會比我們許多人意識到的成本更高,假設賽靈思實際上創建了自己的內存控制器、I/O 控制器、網絡控制器和更通用的 SerDes 以及片上互連,那么 AMD 可能隨著時間的推移轉移到賽靈思 IP 塊,從而能夠節省一些成本。賽靈思 IP 塊會比 AMD 的更好還是完全從 AMD 堆棧中消失,未來將有各種可能性來改進 AMD 在 CPU 和 GPU 插槽中的內容以及它如何從中創建自己的新 IP。
?
例如,想象一下基于 Xilinx SerDes 的數據中心級 Infinity Fabric 交換結構以及由 AMD 和 Xilinx 融合團隊共同創建的數據包處理引擎?想象一下類似于IBM 為其 Power10 處理器創建的內存區域網絡,但跨機架、 Epyc CPU 和 Instinct CPU 加速器的運行。
?
看看 Versal 系列的“Everest”一代中的 Xilinx FPGA 混合器件:
?

那些用于機器學習推理的 AI 矩陣引擎和用于各種信號處理的 DSP 引擎是過去在可編程邏輯中實現的模塊,賽靈思在其 Versal 系列中一直將其稱為自適應引擎。
?
AMD 的工程師在考慮如何構建計算引擎、系統和集群,可以使用這些模塊中的每一個,包括 Arm 內核。AMD 設計的每個計算設備,無論是單片芯片還是封裝中的小芯片集合,都可以在 AMD 認為合適的時候添加一些可編程邏輯。
?
那么除了在很大程度上保持業務不變之外,AMD 將如何與賽靈思合作呢?它還沒有說,除了說 AMD 在交易失敗之前已經授權了一些 Xilinx IP,并且無論該 IP 是什么,都將在之前的某個時候出現在 AMD 芯片中明年年底。
?
首先,我們認為整個 CPU 和整個 FPGA 的單芯片混合實現是不太可能的,但有可能會發生共同封裝的 CPU-FPGA 混合。
?
這是英特爾早在 2014 年就與 FPGA 制造商 Altera 合作的東西,甚至在它收購該公司之前,然后英特爾在 2018 年宣布將“Skylake”至強 SP 處理器與 Arria 10 FPGA 混合在一個封裝中。我們認為這些并沒有在數據中心起飛,原因與為什么我們在數據中心的單個封裝中看不到 CPU-GPU 混合體的原因相同。除非是非常特殊的情況,例如帶有集成顯卡的 PC 芯片被重新用作媒體處理服務器引擎,就像 AMD 和英特爾過去在其嵌入式產品線中所做的那樣。
在 CPU-GPU 復合體中,英特爾將 125 w的20核 Xeon SP-6138P 與額定70 w的Arria 10 GX FPGA 1150放在同一封裝中。它們通過 UltraPath 互連 (UPI) 鏈接進行連接,這些鏈接用于與 CPU 進行共享內存 NUMA 配置,這意味著英特爾將 UPI 控制器移植到 Arria 10 上。(這個UPI控制器似乎不太可能在可編程控制器中實現邏輯,但UPI協議可能是在硬編碼 SerDes 之上實現的,該 SerDes 適合UPI的時序,可編程邏輯填補了空白。)Arria 10 GX 沒有在 FPGA 復合體上激活 Arm 內核。
?
AMD 十多年來一直在考慮這種混合CPU-GPU計算方法及其異構系統架構,甚至在一些服務器部件中實現了它們,并且顯然已經為PC和大批量定制游戲機芯片做到了這一點。在一定程度上,Infinity Fabric互連是HSA的一種實現。
?
AMD可以將整個CPU和整個 FPGA 集成在一起——由用于 CPU 計算的 frankensocket、用于 FPGA 可編程邏輯的小芯片以及它們兩者的共享內存和 I/O 集線器組成。這很有趣,因為它可以提供連貫的共享插槽內跨 CPU 和 FPGA 容量的內存。使用 Infinity Fabric 鏈接,它也可以跨套接字完成。正如我們所建議的,使用 Infinity Fabric交換,它可以跨機架甚至跨行完成。
?
其中一個問題是鎖定任何套接字中的配置。CPU與FPGA可編程邏輯的比例會因應用、行業和客戶用例而異。如果將 GPU 加入其中,就有許多不同的變量需要排序,實際上,每個芯片都會及時成為特定客戶的定制部件。可以為超大規模企業和云建設者這樣做,因為市場規模值得,但如果 AMD 想把它賣給其他服務提供商和大型企業,它就必須挑選一些 SKU,而且它所做的任何事情都可能不是最理想的。
?
Nvidia的聯合創始人兼首席執行官黃仁勛表示除了可能用于模擬自己的芯片,FPGA對于Nvidia沒有任何用處. 但英特爾收購了 Altera 而現在 AMD 又收購了賽靈思,至少表明,FPGA 在現成 CPU 上運行的編程語言和用于實現某些功能或軟件堆棧的定制 ASIC 之間的邊界仍然具有吸引力。我們認為,一個平衡的系統將包括所有三個計算引擎,需要用于快速串行處理和大內存占用的 CPU,用于快速并行處理和高內存帶寬的 GPU,以及用于加速硬編碼算法的 FPGA,這些算法在 X86 或 Arm 處理器上的軟件實現中可用,但在由于這些算法變化太大,或者因為無法支付功耗或成本溢價,因此無法保證定制 ASIC 的數量。
?
將FPGA可編程邏輯嵌入到每個CPU插槽甚至每個GPU插槽中作為這些設備的暫存器是有意義的嘗試,這樣它們就可以在FPGA中完成(或部分完成)的哈希算法,加密算法,安全協議或虛擬開關元素,而不是CPU或GPU芯片上的邏輯塊中,或添加到 CPU 或 GPU 插槽的單獨小芯片中,或者在 CPU 上運行的更高級別軟件中。多年來,IBM已經將這種暫存器(請注意,不是用FPGA邏輯實現的)添加到其System z和Power處理器中,允許它們實現新的指令,或者創建復合指令,這些指令是在芯片顯卡很久之后動態添加到架構中的。這不會是芯片/插座空間的重要組成部分。
?
很快就會有使用Xen X86內核交付的Versall FPGA混合體,Vitis堆棧將被調整,以便能夠將代碼編譯到這些內核以及Versall計算綜合體的其他元素。我們認為AMD不太可能將X86或Arm內核拉到其GPU上,但我們確實認為該公司可以創建一系列SmartNIC和DPU,這些SmartNIC和DPU混合了FPGA和X86內核-如果它具有架構意義,甚至可能是GPU 雛形。AMD是SmartNIC的新手,但賽靈思不是,特別是在2019年4月收購Solarflare之后。
?
我們希望看到 AMD 這樣創建一個高性能的 Zen4 內核,去掉所有矢量引擎的部分,并在芯片上放置更多內核或在芯片上放置更多更快的內核。我們選擇后者是因為在這個 CPU 上,我們想要驚人的串行性能。我們想要這個東西上的 HBM3 內存,我們認為實現 256 GB 的容量,應該是可能的。
?
利用這些計算引擎模塊,客戶可以在系統板上、機架內和跨行配置他們需要的比率。也許有一個客戶需要為每個 CPU 配備四個 GPU,為每個具有單個 Infinity Fabric 交換機的復雜系統配備兩個 DPU。
*聲明:本文系原作者創作。文章內容系其個人觀點,我方轉載僅為分享與討論,不代表我方贊成或認同,如有異議,請聯系后臺。






