
在當(dāng)前人工智能技術(shù)飛速發(fā)展的背景下,其在包括自然語(yǔ)言處理、計(jì)算機(jī)視覺(jué)、自動(dòng)駕駛系統(tǒng)、虛擬助手服務(wù)、推薦算法以及醫(yī)療診斷在內(nèi)的眾多前沿應(yīng)用中發(fā)揮著至關(guān)重要的作用。隨著AI應(yīng)用的不斷深化與升級(jí),數(shù)據(jù)中心基礎(chǔ)設(shè)施必須應(yīng)對(duì)日益嚴(yán)苛的要求,特別是對(duì)于低延遲、高吞吐量網(wǎng)絡(luò)的需求愈發(fā)迫切,以確保能夠高效處理復(fù)雜且數(shù)據(jù)密集型的工作負(fù)載。相關(guān)閱讀:
InfiniBand,撼動(dòng)不了以太網(wǎng)?
英偉達(dá)Quantum-2 Infiniband平臺(tái)技術(shù)A&Q
一顆Jericho3-AI芯片,用來(lái)替代InfiniBand?
RoCE技術(shù)在HPC中的應(yīng)用分析
《RDMA技術(shù)參考文獻(xiàn)匯總》1、總線級(jí)數(shù)據(jù)中心網(wǎng)絡(luò)技術(shù)白皮書.pdf?2、RDMA提高數(shù)據(jù)傳輸效率.pdf?3、配置 InfiniBand 和 RDMA 網(wǎng)絡(luò).pdf?5、面向AI智能無(wú)損數(shù)據(jù)中心網(wǎng)絡(luò).pdf6、面向分布式 AI智能網(wǎng)卡低延遲Fabric技術(shù).pdf7、NVMe存儲(chǔ)SPDK 加速前后端 IO.pdf8、基于RDMA多播機(jī)制的分布式持久性內(nèi)存文件系統(tǒng).pdf9、云環(huán)境下分布式存儲(chǔ)性能優(yōu)化實(shí)踐.pdf1、智能網(wǎng)卡低延遲Fabric技術(shù).pdf?3、RDMA在數(shù)據(jù)中心中的應(yīng)用研究.pdf?4、RDMA系統(tǒng)的挑戰(zhàn).pdf?5、RDMA網(wǎng)絡(luò)人工智能訓(xùn)練重要硬件8、RDMA在數(shù)據(jù)中心中的應(yīng)用研究InfiniBand網(wǎng)絡(luò)簡(jiǎn)介
在AI數(shù)據(jù)中心中,InfiniBand網(wǎng)絡(luò)憑借其卓越的性能和可靠性備受矚目。該網(wǎng)絡(luò)通過(guò)專門設(shè)計(jì)的InfiniBand適配器或交換機(jī)實(shí)現(xiàn)高效的數(shù)據(jù)傳輸,并由多個(gè)核心組件構(gòu)成:子網(wǎng)管理器(SM)、InfiniBand網(wǎng)卡、InfiniBand交換設(shè)備以及專用的InfiniBand線纜與光模塊。全球知名芯片制造商N(yùn)VIDIA,在推動(dòng)高性能計(jì)算和AI領(lǐng)域發(fā)展的同時(shí),也成為了提供一系列InfiniBand網(wǎng)卡解決方案的主要力量。其中包括正在快速演進(jìn)的200Gbps HDR技術(shù)及已大規(guī)模商業(yè)部署的400Gbps NDR網(wǎng)卡產(chǎn)品。此處展示的圖表即為目前廣泛應(yīng)用的InfiniBand網(wǎng)絡(luò)接口卡類型。.值得一提的是,InfiniBand交換機(jī)不運(yùn)行傳統(tǒng)路由協(xié)議,而是采用集中式管理機(jī)制,由子網(wǎng)管理器負(fù)責(zé)整個(gè)網(wǎng)絡(luò)轉(zhuǎn)發(fā)表的計(jì)算與分發(fā)工作,同時(shí)承擔(dān)著配置InfiniBand子網(wǎng)內(nèi)部特性的重要任務(wù),例如分區(qū)策略和服務(wù)質(zhì)量(QoS)。構(gòu)建InfiniBand網(wǎng)絡(luò)時(shí),必須使用專為InfiniBand設(shè)計(jì)的電纜和光模塊來(lái)確保交換機(jī)之間以及交換機(jī)與網(wǎng)卡之間的無(wú)縫連接。InfiniBand網(wǎng)絡(luò)解決方案特性
本征無(wú)損傳輸機(jī)制
InfiniBand網(wǎng)絡(luò)創(chuàng)新性地采用了基于信用的信號(hào)控制策略,從底層設(shè)計(jì)上有效防止了緩沖區(qū)溢出和數(shù)據(jù)包丟失的問(wèn)題。在數(shù)據(jù)發(fā)送前,發(fā)送端會(huì)確保接收端擁有充足的信用額度來(lái)處理相應(yīng)數(shù)量的數(shù)據(jù)包。每條鏈路在InfiniBand架構(gòu)中均預(yù)設(shè)了緩沖區(qū),數(shù)據(jù)傳輸量嚴(yán)格受限于接收端當(dāng)前可用的緩沖區(qū)容量。一旦接收端完成轉(zhuǎn)發(fā)任務(wù),即釋放緩沖區(qū),并實(shí)時(shí)更新并反饋當(dāng)前剩余的緩沖區(qū)大小。這種鏈路級(jí)別的流量控制技術(shù)確保了發(fā)送端不會(huì)向網(wǎng)絡(luò)中過(guò)度填充數(shù)據(jù),從而有效地避免了因緩沖區(qū)滿載而導(dǎo)致的數(shù)據(jù)包丟失。網(wǎng)卡擴(kuò)展及自適應(yīng)路由能力
InfiniBand網(wǎng)絡(luò)還采用了先進(jìn)的自適應(yīng)路由技術(shù),支持針對(duì)每個(gè)數(shù)據(jù)包進(jìn)行動(dòng)態(tài)路徑選擇,這使得在網(wǎng)絡(luò)大規(guī)模部署時(shí)能充分利用資源,實(shí)現(xiàn)最優(yōu)性能表現(xiàn)。例如,在百度AI云、微軟Azure等大型云計(jì)算環(huán)境中,采用InfiniBand互聯(lián)的GPU集群得到了廣泛應(yīng)用。市場(chǎng)主要供應(yīng)商及其產(chǎn)品優(yōu)勢(shì)
目前市場(chǎng)上有多家主流供應(yīng)商提供具備競(jìng)爭(zhēng)力的InfiniBand網(wǎng)絡(luò)解決方案及相關(guān)硬件設(shè)備,其中NVIDIA憑借超過(guò)70%的市場(chǎng)份額成為市場(chǎng)領(lǐng)導(dǎo)者。此外,其他重要的行業(yè)參與者包括:這些頂級(jí)供應(yīng)商的產(chǎn)品與解決方案均根據(jù)不同的用戶需求進(jìn)行了精細(xì)化定制,并能夠滿足各種規(guī)模和應(yīng)用場(chǎng)景下對(duì)InfiniBand網(wǎng)絡(luò)的部署要求。RoCE v2網(wǎng)絡(luò)技術(shù)概述
不同于依賴于集中式管理架構(gòu)(如子網(wǎng)管理器SM)的InfiniBand網(wǎng)絡(luò),RoCE v2網(wǎng)絡(luò)采用全分布式架構(gòu)設(shè)計(jì),并由具備RoCEv2功能的NIC(網(wǎng)絡(luò)接口卡)和交換機(jī)共同構(gòu)建,通常以兩層架構(gòu)部署在數(shù)據(jù)中心環(huán)境中。多家主流制造商已提供支持RoCE技術(shù)的網(wǎng)絡(luò)適配器產(chǎn)品,其中NVIDIA、Intel和Broadcom是主要供應(yīng)商。作為數(shù)據(jù)中心服務(wù)器網(wǎng)絡(luò)適配器的主要形態(tài),PCIe卡廣泛應(yīng)用其中。RDMA卡普遍配置有50Gbps起步的端口PHY速率,目前市面上可購(gòu)買到的商用單端口網(wǎng)絡(luò)適配器最高速度已達(dá)400Gbps級(jí)別。當(dāng)前大部分?jǐn)?shù)據(jù)中心交換機(jī)均已集成RDMA流控技術(shù),在與RoCE網(wǎng)絡(luò)適配器協(xié)同工作時(shí),能夠?qū)崿F(xiàn)從發(fā)送端到接收端的高效RDMA通信。全球頂尖的數(shù)據(jù)中心交換機(jī)廠商,如Cisco、Hewlett Packard Enterprise(HPE)以及Arista等,均提供了高性能且穩(wěn)定的數(shù)據(jù)中心解決方案,以滿足大規(guī)模數(shù)據(jù)中心對(duì)帶寬和性能的需求。這些公司在網(wǎng)絡(luò)技術(shù)創(chuàng)新、性能優(yōu)化及擴(kuò)展性方面積累了深厚的專業(yè)經(jīng)驗(yàn),并在全球范圍內(nèi)贏得了廣泛的市場(chǎng)認(rèn)可和應(yīng)用實(shí)踐。高性能交換機(jī)的核心競(jìng)爭(zhēng)力在于其采用的轉(zhuǎn)發(fā)芯片。在當(dāng)前市場(chǎng)中,Broadcom公司的Tomahawk系列芯片被廣泛應(yīng)用于商業(yè)交換機(jī)的轉(zhuǎn)發(fā)層面。其中,Tomahawk3系列芯片在現(xiàn)役交換機(jī)市場(chǎng)上占據(jù)主導(dǎo)地位,而隨著技術(shù)迭代升級(jí),越來(lái)越多的新型交換機(jī)開(kāi)始支持更先進(jìn)的Tomahawk4系列芯片。RoCE v2基于以太網(wǎng)協(xié)議運(yùn)行,因此可以充分利用傳統(tǒng)的以太網(wǎng)光纖和光模塊資源進(jìn)行部署。ROCE v2網(wǎng)絡(luò)技術(shù)特性解析
相比于InfiniBand,RoCE v2網(wǎng)絡(luò)解決方案在靈活性和成本效益上展現(xiàn)出更多優(yōu)勢(shì)。該技術(shù)不僅能夠構(gòu)建高性能的RDMA(遠(yuǎn)程直接內(nèi)存訪問(wèn))網(wǎng)絡(luò)環(huán)境,同時(shí)還能無(wú)縫融入傳統(tǒng)以太網(wǎng)架構(gòu)中。然而,在實(shí)際部署過(guò)程中,需要對(duì)交換機(jī)進(jìn)行諸如Headroom預(yù)留、PFC(優(yōu)先級(jí)流量控制)以及ECN(顯式擁塞通知)等參數(shù)的精細(xì)配置,這可能會(huì)增加一定的實(shí)施復(fù)雜度。尤其是在大規(guī)模部署場(chǎng)景下,尤其是當(dāng)涉及大量網(wǎng)絡(luò)接口卡時(shí),相較于InfiniBand網(wǎng)絡(luò),RoCE v2網(wǎng)絡(luò)的整體吞吐性能可能略遜一籌。當(dāng)前市場(chǎng)上,多家主流交換機(jī)供應(yīng)商均支持RoCE協(xié)議,并提供了相應(yīng)的解決方案。其中,NVIDIA推出的ConnectX系列網(wǎng)絡(luò)適配器在與RoCE v2兼容性方面表現(xiàn)卓越,已在市場(chǎng)占有率上占據(jù)了顯著地位。這意味著選擇RoCE v2方案的企業(yè)能夠在保持較高性價(jià)比的同時(shí),享受到來(lái)自全球領(lǐng)先廠商的技術(shù)支持和服務(wù)保障。InfiniBand vs. RoCE v2
從技術(shù)層面剖析,InfiniBand通過(guò)整合多種創(chuàng)新技術(shù)手段,有效提升了網(wǎng)絡(luò)數(shù)據(jù)轉(zhuǎn)發(fā)效率、縮短了故障恢復(fù)時(shí)間、增強(qiáng)了網(wǎng)絡(luò)擴(kuò)展性,并簡(jiǎn)化了運(yùn)維管理的復(fù)雜度。在實(shí)際應(yīng)用中,RoCE v2作為一項(xiàng)高效解決方案,在滿足大多數(shù)智能計(jì)算場(chǎng)景需求的同時(shí),InfiniBand則憑借其在特定領(lǐng)域的卓越性能表現(xiàn)而備受矚目。業(yè)務(wù)性能:InfiniBand因其較低的端到端延遲特性,在應(yīng)用層面上能提供更優(yōu)的業(yè)務(wù)性能體驗(yàn)。盡管如此,RoCE v2同樣能夠在大部分智能計(jì)算場(chǎng)景下達(dá)到用戶所需的業(yè)務(wù)處理效能標(biāo)準(zhǔn)。業(yè)務(wù)規(guī)模:InfiniBand具備強(qiáng)大的擴(kuò)展能力,能夠支持?jǐn)?shù)萬(wàn)個(gè)GPU卡構(gòu)建集群,且在大規(guī)模部署下仍可保持性能穩(wěn)定無(wú)損,已在業(yè)界擁有大量成功商業(yè)應(yīng)用案例。而RoCE v2網(wǎng)絡(luò)也不甘示弱,它能夠支撐數(shù)千張卡構(gòu)成的集群,并且整體網(wǎng)絡(luò)性能并無(wú)顯著下滑。業(yè)務(wù)運(yùn)維:InfiniBand相較于RoCE v2更加成熟,提供了諸如多租戶隔離及運(yùn)維診斷等高級(jí)功能,為數(shù)據(jù)中心的運(yùn)維管理帶來(lái)了更高的便捷性和可控性。成本考量:InfiniBand的成本相對(duì)較高,主要原因在于其交換機(jī)設(shè)備的價(jià)格高于以太網(wǎng)交換機(jī)。關(guān)于供應(yīng)商:NVIDIA作為InfiniBand的主要供應(yīng)商,持續(xù)為市場(chǎng)提供優(yōu)質(zhì)的產(chǎn)品與服務(wù);而在RoCE v2領(lǐng)域,則有多家供應(yīng)商共同參與并提供支持,為用戶提供了更多元化的選擇空間。總結(jié)
近年來(lái),數(shù)據(jù)中心網(wǎng)絡(luò)技術(shù)發(fā)展的一個(gè)重要方向是簡(jiǎn)化網(wǎng)絡(luò)架構(gòu)設(shè)計(jì)、加快部署進(jìn)程以及優(yōu)化運(yùn)維管理。通過(guò)采用如無(wú)編號(hào)BGP等創(chuàng)新技術(shù)方案,能夠有效減少對(duì)復(fù)雜IP地址規(guī)劃的依賴性,從而避免配置錯(cuò)誤的發(fā)生,提升整體工作效率。與此同時(shí),諸如WJH這類實(shí)時(shí)故障檢測(cè)工具為網(wǎng)絡(luò)運(yùn)維帶來(lái)了深度洞察力,極大地助力于快速定位和解決網(wǎng)絡(luò)問(wèn)題。隨著數(shù)據(jù)中心基礎(chǔ)設(shè)施向分布式和多數(shù)據(jù)中心互聯(lián)模式演進(jìn),對(duì)于更高速率及更高品質(zhì)網(wǎng)絡(luò)連接的需求日益增長(zhǎng)。為了滿足不斷提升的整體服務(wù)質(zhì)量要求,市場(chǎng)呼喚更為高效且可靠的網(wǎng)絡(luò)解決方案。文章來(lái)源:https://community.fs.com/cn/article/infiniband-vs-roce-how-to-choose-a-network-for-ai-data-center.html機(jī)器人專題研究:產(chǎn)業(yè)發(fā)展概覽(2024)國(guó)產(chǎn)AI算力行業(yè)報(bào)告:浪潮洶涌,勢(shì)不可擋(2024)AI系列之HBM:AI硬件核心,需求爆發(fā)增長(zhǎng)2024中國(guó)“百模大戰(zhàn)”競(jìng)爭(zhēng)格局分析報(bào)告(2024)2024年中國(guó)虛擬現(xiàn)實(shí)(VR)行業(yè)研究報(bào)告AI算力研究:英偉達(dá)B200再創(chuàng)算力奇跡,液冷、光模塊持續(xù)革新
英偉達(dá)官宣新一代Blackwell架構(gòu),華為算力GPU需求破百萬(wàn)片《人工智能技術(shù)行業(yè)應(yīng)用圖譜合集》GPU深度報(bào)告:英偉達(dá)GB200 NVL72全互聯(lián)技術(shù),銅纜方案或?qū)⒊蔀槲磥?lái)趨勢(shì)?機(jī)器人專題研究:產(chǎn)業(yè)發(fā)展概覽(2024)工業(yè)大模型應(yīng)用報(bào)告v2.6(2024)復(fù)盤與展望:國(guó)產(chǎn)大模型的進(jìn)擊(2024)英偉達(dá)發(fā)布新一代GPU架構(gòu),NVLink連接技術(shù)迭代升級(jí)
大模型語(yǔ)言模型:從理論到實(shí)踐
技術(shù)展望2024:AI拐點(diǎn),重塑人類潛力
網(wǎng)絡(luò)大模型十大問(wèn)題白皮書(2024)大視研究:中國(guó)人工智能(AI)2024各行業(yè)應(yīng)用研究報(bào)告英偉達(dá)GTC專題:新一代GPU、具身智能和AI應(yīng)用
2024年策略:AI鼎新,與時(shí)偕行
光模塊專題:AI驅(qū)動(dòng)網(wǎng)絡(luò)變革,光摩爾定律加速《半導(dǎo)體行業(yè)深度報(bào)告合集(2024)》
《AI應(yīng)用專題系列合集》
《70+篇半導(dǎo)體行業(yè)“研究框架”合集》
500+份重磅ChatGPT專業(yè)報(bào)告
本號(hào)資料全部上傳至知識(shí)星球,更多內(nèi)容請(qǐng)登錄智能計(jì)算芯知識(shí)(知識(shí)星球)星球下載全部資料。

免責(zé)申明:本號(hào)聚焦相關(guān)技術(shù)分享,內(nèi)容觀點(diǎn)不代表本號(hào)立場(chǎng),可追溯內(nèi)容均注明來(lái)源,發(fā)布文章若存在版權(quán)等問(wèn)題,請(qǐng)留言聯(lián)系刪除,謝謝。
溫馨提示:
請(qǐng)搜索“AI_Architect”或“掃碼”關(guān)注公眾號(hào)實(shí)時(shí)掌握深度技術(shù)分享,點(diǎn)擊“閱讀原文”獲取更多原創(chuàng)技術(shù)干貨。

