作者:Synopsys 高級主任產品營銷經理 Priyank Shukla
通過 PCI Express (PCIe) 和以太網連接的分散計算資源網絡可創(chuàng)建超大規(guī)模數(shù)據中心基礎設施,從而提供超聚合計算平臺。如圖 1 所示,網絡主要依賴于兩個接口:PCIe/Compute Express Link (CXL) 用于芯片到芯片或機架內連接,以太網用于機架外連接。PCIe 網絡接口卡 (NIC) 將 PCIe 轉換為以太網,并允許通過多層網絡交換機實現(xiàn)以太網結構。本文解釋了下一代高性能計算 (HPC) 設計中對 224Gbps 電氣接口的要求,包括信道、信號調制和 SerDes 技術。

圖 1:HPC 作為通過 PCIe 和以太網鏈接的計算資源網絡
1
如圖 2 所示,四通道 PCIe 的吞吐量與每通道以太網數(shù)據速率最高值匹配:PCIe 2.0 帶寬 10Gbps,PCIe 3.0 帶寬 25Gbps,PCIe 4.0 帶寬 50Gbps,PCIe 5.0 帶寬 100Gbps。在過去的十多年中,這種奇偶校驗允許 x16 PCIe NIC 與 40G/100G/200G 和 400G 以太網端口連接,無需額外的變速器,從而降低了系統(tǒng)總功率并最大限度地減少了延遲。

圖 2:x16 PCIe 吞吐量相當于 x4 以太網端口帶寬
PCIe 6.0 以 64Gbps 的速度運行,為高于 100Gbps 的每通道電氣以太網接口鋪平了道路,使 x16 PCIe 6.0 能夠高效地支持 800G 以太網端口。
此外,數(shù)據中心光學器件正在不斷發(fā)展,以支持更高的網絡帶寬。表 1 總結了 100G/200G λ 光學器件的預計可用性。帶有 100G λ 光收發(fā)器的 800G-DR8/FR8 模塊已開始在 HPC 數(shù)據中心部署。使用四通道 800G 光學模塊和 102.4T 交換機將網絡帶寬翻倍,這將取決于 200G λ 光學器件和相應的 200Gbps 電氣接口。

表 1:采用 100G/200G λ 光學器件
最后,對于現(xiàn)代高基數(shù)交換機,HPC 機架的交換帶寬受到最高密度以太網端口的限制。當前的 400G/800G 以太網端口使用 100Gbps 電氣/光學收發(fā)器的四/八通道。表 2 突出顯示了以太網端口帶寬時間線,顯示需要 200Gbps SerDes 才能推出帶有 800G 以太網端口的 102.4T 交換機。

表格 2:工業(yè)以太網交換機/SerDes/端口時間表
根據這些趨勢,IEEE 802.3、OTN ITU-T G 和 OIF-CEI 已經啟動了標準化工作,目標是每通道電信號傳輸速率高于 112Gbps。
2
OIF-CEI 旨在標準化一個可與以太網、光纖通道和 Interlaken 等多種協(xié)議配合使用的電氣接口。以太網數(shù)據速率是媒體訪問控制 (MAC) 層的凈數(shù)字吞吐量,以太網建議采用端到端正向糾錯 (FEC) 和編碼方案,從而使產生的原始 SerDes 電氣或線路速率高于每通道以太網吞吐量。例如,使用 Reed Solomon (514-544) 和 256/257 編碼的四通道 400G 以太網需要 106.25Gbps 的有效線路速率。然后問題就變成了,當數(shù)據速率翻倍后,為什么線路速率不只是翻倍到 212.5Gbps?我們?yōu)槭裁匆務?224Gbps?
一些關于行業(yè)論壇的早期討論表明,800G 以太網/1.6T 以太網可能會與串聯(lián)或端到端 FEC 配合使用。此外,還要考慮各種 FEC 因素,例如 800G 一致性鏈路的 staircase/zipper 代碼,所有這些都會增加不同的開銷。此外,光纖通道和 InfiniBand 也將會產生不同的開銷。因此,OIF 已開始起草下一代 CEI-224G 電氣接口。
3
高階調制可增加每個符號位數(shù)或每個單位間隔 (UI) 位數(shù),并在信道帶寬和信號振幅之間提供權衡。標準通常探索更高階數(shù)的調制方案以及更高的數(shù)據速率。2012 年,PAM-4/6/8 被考慮用于 100Gbps 線路速率,最終 PAM-4 成為 56Gbps 和 112Gbps SerDes 的調制選擇。從整體電氣光學電氣 (E-O-E) 系統(tǒng)視圖,可以很明顯地看出,如果光收發(fā)器和電氣 SerDes 的調制方案和數(shù)據速率不同,任何 E-O-E 轉換都需要變速器并增加額外的功耗和延遲開銷。因此,電調制方案的選擇與 200G λ 中采用的相同調制方案密切相關。200G λ 光收發(fā)器的初步工作顯示 PAM-4 或 PAM-6 調制方案似乎是合理的。
PAM-4 調制提供與前幾代產品的向后兼容性,與更高調制方案相比,可提供更好的信噪比 (SNR),并允許產生延遲的更低 FEC 開銷架構。然而,由于模擬帶寬限制和通過創(chuàng)新 DSP 方案實現(xiàn)高級均衡,實現(xiàn)則需要更好的模擬前端 (AFE)。
PAM-6 調制可編碼每個符號 2.5 位,與 PAM-4 相比,其使用 DSQ-32 實現(xiàn)的 SNR 損耗增加了約 3.2dB。它提供了一種實現(xiàn) SerDes 的方法,其 AFE 帶寬比 PAM-4 SerDes 低,但 SNR 更高。PAM-6 調制方案增加了更高的 FEC 開銷,從而增加了面積、功耗并降低了編碼效率。
4
高速電氣 SerDes 應用不斷發(fā)展。OIF 于 2016 年 8 月啟動首個 112G-VSR 項目,并于 2017/18 年增加了多芯片模塊 (MCM)、超短距離 (XSR)、中等距離 (MR) 和長距離 (LR)。2021 年,OIF 啟動了兩個 112G 線性和 112G 超短距離 (XSR)+ 的新項目。OIF 目前正在制定 CEI-224G 標準,以識別和定義典型系統(tǒng)中的下一代電氣接口,用于通過背板/中間板或銅電纜在兩個 PCBA 之間(甚至在兩個機箱之間)的印刷電路板組件 (PCBA) 內的晶粒到晶粒、晶粒到 OE(光學引擎)、芯片到模塊和芯片到芯片。
在類似線路中,IEEE 標準委員會最近批準了 IEEE P802.3df 項目授權請求 (PAR),以定義 200Gbps、400Gbps、800Gbps 和 1.6Tbps 電氣接口的媒體訪問控制參數(shù)、物理層和管理參數(shù)。工作組將為附件單元接口 (AUI) 和電氣物理介質依賴 (PMD) 的 1/2/4/8 通道變體制定每通道 200Gbps 的電信號標準。

圖 3:224Gbps 電氣 SerDes 的早期用例
圖 3 顯示了 224Gbps 電氣 SerDes 的早期用例,業(yè)界認為 102.4T 交換機和 800G/1.6T 相干光學模塊將采用該案例,這些模塊需要 224Gbps XSR/XSR+/VSR/LR SerDes。
5
224Gbps 數(shù)據速率將單位間隔 (UI) 設計減少到邏輯延遲的序列。即使采用 PAM-6 調制,224Gbps 數(shù)據速率的 UI 也將約為 11ps。從 HPC 數(shù)據中心通道的演變角度考慮封裝和 PCB 材料的改進/變化,很明顯,224Gbps 收發(fā)器將需要靈活的高帶寬 AFE,以擴展可用晶體管帶寬的邊界。

圖 4:端到端 224Gbps 電氣鏈路,突出顯示接收器 DSP
如圖 4 所示,224Gbps 接收器必須具有自適應和差異化 DSP,才能在傳統(tǒng) VSR/MR/LR 通道中工作。使用 224Gbps 接口時,作為某些信道選項的最大似然序列檢測器 (MLSD) 顯而易見,但是,提高信道的比特誤碼率 (BER) 并不是一個魔法棒。圖 5 顯示了端到端 224G 發(fā)射器到接收器的仿真結果,與 BER 相比,實際 HPC 通道的鏈路損耗各不相同。

圖 5:224Gbps 時的 BER 與信道損耗
圖 5 中的紅點和藍點表示具有或不具有 MLSD 的 BER。BER 跨信道損耗的分布和發(fā)散需要先進的 DSP 算法,該算法可在圖中以綠點表示的信道損耗之間提供一致的 BER。
6
需要 224G SerDes 來繼續(xù) HPC 數(shù)據中心的數(shù)據處理步伐。以太網已成為現(xiàn)代 HPC 數(shù)據中心服務器間通信的事實標準。因此,組織正在定義和開發(fā)包括 224Gbps 在內的下一代電氣接口。Synopsys 提供完整的 200G/400G 和 800G 以太網控制器和 PHY IP 解決方案,包括物理編碼子層 (PCS)、物理介質依賴 (PMD)、物理介質附件 (PMA)?和自動協(xié)商功能。雖然 800G 以太網和 1.6T 以太網的定義仍在進行,但 Synopsys 的 DesignWare 以太網 IP 解決方案正在利用 224G SerDes 實現(xiàn)每端口帶寬 800G/1.6T 的早期采用。


