當普通消費者暢游在智能世界,享受數(shù)字世界帶來的巨大紅利時,大概不會考慮其背后與之相關(guān)的數(shù)據(jù)量、復雜性以及超大規(guī)模數(shù)據(jù)中心內(nèi)部涉及的所有的搜索、采集、傳輸、處理與分析過程。但對于相關(guān)行業(yè)的從業(yè)人員來說,如何在日益超連接、數(shù)據(jù)密集、人工智能驅(qū)動的世界中,找到高帶寬和低延遲的通信基礎(chǔ)設施解決方案,無時不刻不在困擾著他們。
帶寬也“內(nèi)卷”
近年來,云計算和邊緣計算已經(jīng)變得越來越普遍,人工智能(AI)迅速成為帶寬增長的最大驅(qū)動力。為了應對這些趨勢,數(shù)據(jù)中心已經(jīng)從處理可管理數(shù)據(jù)量的基本服務器,轉(zhuǎn)變?yōu)樘幚肀任覀兿胂笾卸嗟枚鄶?shù)據(jù)的復雜多機架系統(tǒng)。根據(jù)IDC的預測,到2025年,全球?qū)碛卸噙_175澤字節(jié)的數(shù)據(jù),分布在云和數(shù)據(jù)中心之間。
這大大加速了相關(guān)行業(yè)升級提速的日程表。以數(shù)據(jù)傳輸為例,光通信行業(yè)市場調(diào)研機構(gòu)Lightcounting曾在2021年時預測,800G光模塊將從2025年底開始主導市場。但就目前的情況來看,這一節(jié)奏明顯提前。從2023年下半年開始,不少云服務廠商就已經(jīng)開始集中測試和采購800G光模塊。
在交換機芯片和交換機整機方面,產(chǎn)業(yè)也是快速跟進。2022年8月,博通正式發(fā)布自己的Tomahawk 51.2 Tbps交換機芯片;在2022年OCP全球峰會上,思科發(fā)布了兩款新的800G交換機系列——Nexus 9232E和8111交換機,以及帶有100G和400G接口的800G光模塊。這意味著,過去12年里,交換機的交換能力已經(jīng)從640G發(fā)展到102.4T。
理論上來說,800G帶寬已經(jīng)不算低了。但人們對帶寬的追求是無止境的,尤其是2023年ChatGPT的爆發(fā),更是在很大程度上加劇了人們對帶寬現(xiàn)狀的“焦慮”,處理大型語言模型(LLM)上的非結(jié)構(gòu)化工作負載成為了當務之急。眾所周知,LLM隨著ChatGPT等語言模型的出現(xiàn)而爆發(fā),這些模型通常擁有數(shù)萬億個參數(shù),并且參數(shù)量每隔幾個月就會增加一倍。而大部分數(shù)據(jù)都保存在內(nèi)存中,必須一起處理,因此系統(tǒng)需要許多處理器通過低延遲網(wǎng)絡連接在一起。
相關(guān)資料顯示,對頭部企業(yè)來說,從GPT-1到GPT-3,模型的參數(shù)量從1.1億個增長到了1750億個,GPT4更是達到了萬億的參數(shù)規(guī)模。如果以英偉達A100顯卡的處理能力計算,早期的大模型大概需要1萬塊英偉達GPU來處理訓練數(shù)據(jù),GPT-3.5大模型就需要2萬塊甚至更多GPU才能完成。
于是,為了處理這樣的工作負載,整個集群將作為一個單一的計算以太網(wǎng)為這些龐大的系統(tǒng)提供一種理想的連接協(xié)議。
數(shù)據(jù)中心的演變
以太網(wǎng)協(xié)議五十多年來一直是互聯(lián)網(wǎng)的數(shù)據(jù)連接骨干,是“箱體”間(box-to-box)連接的主要接口類型,具有速率協(xié)商和支持不同類型介質(zhì)(如光纖、銅纜和PCB背板)等優(yōu)點,這對數(shù)據(jù)中心SoC開發(fā)者而言頗具吸引力。隨著標準的演變,網(wǎng)絡提速的下一個前沿趨勢將是前文提及的1.6T以太網(wǎng),畢竟在人工智能、自動駕駛、高性能計算(HPC)和云計算等快速增長的應用中,網(wǎng)速必須足夠快,才能確保數(shù)據(jù)在計算、網(wǎng)絡和存儲組件之間快速傳輸。
目前超大規(guī)模數(shù)據(jù)中心企業(yè)擁有管理ZB級(甚至更多)信息的能力,但我們所面臨的現(xiàn)實是,隨著摩爾定律的放緩和半導體逐漸趨近物理極限,算力與I/O帶寬之間的差距不斷拉開。簡單而言,就是盡管I/O速度不斷提高,但仍然無法跟上算力增長的步伐。開發(fā)者可以想出很多辦法增加算力資源,包括添加更多晶體管、CPU并行化和多線程技術(shù)等等,但在同步提高I/O性能方面,辦法似乎并不是太多,導致面對當今數(shù)據(jù)的體量和復雜程度時,I/O逐漸成為發(fā)展瓶頸。
未來,數(shù)據(jù)中心會朝著分布式架構(gòu)發(fā)展,存儲、計算和網(wǎng)絡等同質(zhì)資源會保留單獨的“箱體”中,彼此間通過電/光互連實現(xiàn)連接。超大規(guī)模數(shù)據(jù)中心也會轉(zhuǎn)向更快、更扁平、更具可擴展性的網(wǎng)絡架構(gòu)。更扁平的架構(gòu)不僅降低了延遲,也推動了對更高帶寬和更長距離高效連接的需求。以太網(wǎng)高速接口的出現(xiàn)正是為了滿足連接方面的需求,也因此長期以來一直被視為互聯(lián)網(wǎng)數(shù)據(jù)連接的支柱。
如何構(gòu)建1.6T以太網(wǎng)的數(shù)據(jù)連接基礎(chǔ)?

圖1.完整的1.6T以太網(wǎng)子系統(tǒng)和延時路徑
支持1.6T以太網(wǎng)的數(shù)據(jù)連接基礎(chǔ)設施架構(gòu)由控制器和物理層(PHY)兩部分組成。其中,控制器在硅芯片中實現(xiàn)基本以太網(wǎng)協(xié)議功能,由介質(zhì)訪問控制層(Media Access Control , MAC)、物理編碼子層(Physical Coding Sublayer, PCS)和物理介質(zhì)連接層(Physical Medium Attachment, PMA)組成。一旦集成,這些要素必須提供最佳的性能和延遲;由PMA和物理媒體相關(guān)層(Physical Medium Dependent, PMD)組成的PHY負責傳輸和接收數(shù)據(jù),高性能和低延遲也是其必要條件。
考慮到前向糾錯(Forward Error Correction, FEC)是PCS的基本功能(旨在保護通過每條物理鏈路傳輸?shù)母咚傩盘柈a(chǎn)生降級),因此有一點是需要引起注意的:如果這些子層來自不同的供應商,那么彼此間的互操作性可能會面臨挑戰(zhàn)。
對以每秒1.6太比特的速度運行時的PHY和管理參數(shù)進行描述和定義,是IEEE 802.3dj工作組的職責。為此,該小組規(guī)定了MAC層的最大誤碼率(BER)為10-13,當被用于112G和224G SerDes的芯片到模塊(C2M)和芯片到芯片(C2C)應用時,用戶可選擇16和8通道連接單元接口(AUI)。對于PHY來說,規(guī)范規(guī)定當通過八對銅線進行傳輸時,雙芯同軸電纜每個方向的光纜長度至少為1米,超過8對光纖時可達500米,如果再超過8對光纖時長度可達2公里。
經(jīng)過硅驗證的以太網(wǎng)PHY和延遲優(yōu)化的以太網(wǎng)控制器IP,是支持這些設計所需的傳輸速度和延遲數(shù)據(jù),同時減輕互操作性問題的關(guān)鍵所在。尤其是224G SerDes技術(shù)的出現(xiàn)以及MAC和PCS IP的進步,為1.6T以太網(wǎng)的發(fā)展奠定了基礎(chǔ)。
除數(shù)據(jù)井噴所引起的帶寬需求外,服務器前面板密度的增加也推動了對224G連接的需求。在數(shù)據(jù)中心內(nèi),前面板可插拔模塊的密度已接近極限,只剩下有限的空間供可插拔光學模塊使用。所以,SerDes接口就需要不斷提高運轉(zhuǎn)速度來順應其要求。
224G以太網(wǎng)還擁有其他諸多優(yōu)勢。它可以幫助高密度數(shù)據(jù)中心減少所需的線纜和交換機數(shù)量,達到更高的網(wǎng)絡效率。此外,它還可向后兼容其他以太網(wǎng)標準,同時簡化與現(xiàn)有網(wǎng)絡的集成。
總體來說,隨著行業(yè)標準的不斷發(fā)展,1.6T以太網(wǎng)完整解決方案正日趨完善,生態(tài)系統(tǒng)互操作性也在多個渠道、配置和供應商層面得到妥善解決,這讓設計人員對未來無縫生態(tài)系統(tǒng)的整合充滿了信心。
來自新思的解決方案
新思科技為1.6T以太網(wǎng)應用提供了一套完整的解決方案,已經(jīng)被多家客戶采用,這其中有不少設計還是從零開始。事實證明,與現(xiàn)有方案相比,新思的方案能夠?qū)⒒ミB功耗降低多達50%。同時,憑借在優(yōu)化子系統(tǒng)方面的專業(yè)知識,以及在400G和800G IP開發(fā)方面擁有的經(jīng)驗和行業(yè)領(lǐng)先地位,新思科技1.6T以太網(wǎng)完整解決方案還能使設計人員減少周轉(zhuǎn)時間、功耗和延遲。

圖2:過去兩年中,新思科技224G以太網(wǎng)PHY IP已在六個開放平臺和多個芯片中展示了出色的行業(yè)互操作性
具體而言,新思科技224G以太網(wǎng)PHY IP提供了出色的信號完整性和抖動性能,具有零后FEC BER和額外的信道損耗裕度。它支持4級脈沖幅度調(diào)制(PAM-4)和非歸零(NRZ)信令,可提供高達1.6T的以太網(wǎng)帶寬。新的多速率以太網(wǎng)MAC和PCS控制器采用專利的Reed Solomon前向糾錯(FEC)架構(gòu),與前幾代相比,延遲減少了40%。由于可配置的以太網(wǎng)PHY和控制器IP經(jīng)過測試且具備可互操作,工程師可以將時間更多集中在打造差異化設計上。
新思科技還同時提供業(yè)界首個1.6T以太網(wǎng)驗證IP(VIP),可實現(xiàn)早期的RTL驗證、SoC啟動和系統(tǒng)級驗證,為設計人員提供了設計驗證的快速通道。利用自身積累的技術(shù)專長、積極參與標準委員會工作、以及與關(guān)鍵生態(tài)系統(tǒng)和芯片伙伴展開合作,新思科技將在汽車、AI, IoT and HPC以及所有支持1G到1.6T以太網(wǎng)的應用中提供所需的全套IP產(chǎn)品組合支持。
為了更好的幫助開發(fā)者在規(guī)劃224G以太網(wǎng)設計時占得先機,從而更順利地交付高性能數(shù)據(jù)中心應用。在DesignCon 2023大會上,新思科技演示了一種224G收發(fā)器PHY,具有完全開放的3nm 224G PAM-4-TX眼圖;而在OFC 2023大會上,新思科技演示了其出色的環(huán)回性能,且BER小于7e-8。
結(jié)語
人工智能生成內(nèi)容(AIGC)產(chǎn)業(yè)的爆發(fā)進一步帶動了1.6T以太網(wǎng)的需求。通過引入全新的MAC和PCS控制器,1.6T以太網(wǎng)找到了當前最經(jīng)濟理想的實現(xiàn)方案。不過,在從方案到實際落地的過程中,設計人員依然面臨著性能、功耗、面積和信號完整性等多方面的挑戰(zhàn),需要生態(tài)合作伙伴集思廣益,攜手共進。