

將圓周率 (π) 計(jì)算至小數(shù)點(diǎn)后 314 萬(wàn)億位
究竟需要什么?
StorageReview 成功將圓周率 (π) 計(jì)算至小數(shù)點(diǎn)后 314 萬(wàn)億位,刷新世界紀(jì)錄,但其目標(biāo)絕非僅僅為了開(kāi)創(chuàng)記錄。這是一項(xiàng)有意設(shè)計(jì)的極端工作負(fù)載,旨在對(duì)現(xiàn)代服務(wù)器的存儲(chǔ)系統(tǒng)進(jìn)行極限壓力測(cè)試,并回答一個(gè)很現(xiàn)實(shí)的問(wèn)題:?jiǎn)蝹€(gè)系統(tǒng)是否能持續(xù)數(shù)月不間斷進(jìn)行 PB 字節(jié)級(jí)別的 I/O 操作?
在一臺(tái) Dell? PowerEdge? R7725 服務(wù)器上連續(xù)計(jì)算了 110 多天后,該實(shí)驗(yàn)為上述問(wèn)題給出了肯定的答案——前提是存儲(chǔ)架構(gòu)必須能夠提供持續(xù)的性能和一致性,而不僅僅是短時(shí)間的峰值性能。
測(cè)試概覽
I/O 馬拉松:持續(xù)三個(gè)多月的高強(qiáng)度混合讀/寫壓力
單臺(tái)服務(wù)器配備超過(guò) 2.1 PB 的可用閃存容量
適用于長(zhǎng)時(shí)間運(yùn)行的高性能計(jì)算 (HPC) 和 AI 作業(yè)的關(guān)鍵要點(diǎn):只有一致性才能確保長(zhǎng)期運(yùn)行后得出結(jié)果
為了構(gòu)建所需的存儲(chǔ)架構(gòu),StorageReview 搭建了一套包含 40 塊美光 6550 ION SSD 的存儲(chǔ)系統(tǒng),每一塊 SSD 均為 E3.S 外形規(guī)格,可用容量為 60TB。理解該大規(guī)模存儲(chǔ)系統(tǒng)(無(wú)論是 SSD 數(shù)量還是總?cè)萘浚┍澈蟮摹霸颉?,?duì)于理解該紀(jì)錄在現(xiàn)實(shí)當(dāng)中的意義至關(guān)重要。
為何該任務(wù)需要超過(guò) 2 PB 的閃存容量?
要計(jì)算位數(shù)如此之長(zhǎng)的圓周率,重點(diǎn)不在于存儲(chǔ)最終結(jié)果。與計(jì)算過(guò)程所需的中間數(shù)據(jù)相比,最終結(jié)果本身所需的存儲(chǔ)空間相當(dāng)小。
由于最后得出的圓周率高達(dá) 314 萬(wàn)億位,該測(cè)試所用的應(yīng)用程序 y-cruncher 需要巨大的暫存空間,以便:
存放用于 FFT 密集型數(shù)學(xué)運(yùn)算的大型臨時(shí)數(shù)組
頻繁進(jìn)行全面狀態(tài)檢查,以確保持續(xù)數(shù)周的工作不會(huì)前功盡棄
存放驗(yàn)證數(shù)據(jù),確保在長(zhǎng)達(dá)數(shù)月的運(yùn)行過(guò)程中數(shù)據(jù)準(zhǔn)確一致
存放計(jì)算過(guò)程中使用的多精度中間值
為滿足這些要求,StorageReview 在系統(tǒng)中配置了超過(guò) 2.1 PB 的可用閃存容量。
40 塊美光 SSD 中的 34 塊被分配給 y-cruncher,作為暫存空間,形成高帶寬工作層
剩余的 6 塊 SSD 配置為 RAID10 系統(tǒng),用于存儲(chǔ)最終計(jì)算結(jié)果
峰值時(shí),該工作負(fù)載需要多達(dá) 1.43 PiB 的存儲(chǔ)空間,單個(gè)檢查點(diǎn)占用的存儲(chǔ)空間高達(dá)數(shù)百 TB。該容量并非過(guò)度配置;而是為了安全、高效地完成計(jì)算所必需的容量。
圓周率計(jì)算的特點(diǎn):持續(xù)的 I/O 操作
該測(cè)試并非一次旨在展示峰值性能的短時(shí)間基準(zhǔn)測(cè)試。圓周率計(jì)算任務(wù)對(duì)存儲(chǔ)系統(tǒng)持續(xù)施加壓力,長(zhǎng)達(dá)三個(gè)多月,期間完全沒(méi)有停機(jī)或恢復(fù)的機(jī)會(huì)。
該工作負(fù)載呈現(xiàn)出先進(jìn)高性能計(jì)算和 AI 環(huán)境所共有的特征:
持續(xù)高帶寬讀寫操作
長(zhǎng)時(shí)間持續(xù)高強(qiáng)度寫入操作
要求性能可預(yù)測(cè),對(duì)突然出現(xiàn)的大量延遲容忍度極低
操作風(fēng)險(xiǎn)——存儲(chǔ)故障可能導(dǎo)致數(shù)周的工作成果付諸東流
在整個(gè)運(yùn)行期間,該系統(tǒng)始終保持在線狀態(tài),從未因任何故障而需要恢復(fù)運(yùn)行。
這一點(diǎn)至關(guān)重要,因?yàn)樵S多生產(chǎn)工作負(fù)載的失敗并非源于峰值性能不足,而是源于系統(tǒng)隨時(shí)間推移而產(chǎn)生的不穩(wěn)定或不一致。長(zhǎng)時(shí)間運(yùn)行的作業(yè)會(huì)放大存儲(chǔ)堆棧中的微小問(wèn)題。
單服務(wù)器架構(gòu)中的高密度 NVMe?
長(zhǎng)期以來(lái),具有上述特征的工作負(fù)載通常會(huì)促使團(tuán)隊(duì)采用分布式存儲(chǔ)系統(tǒng)或多節(jié)點(diǎn)集群,以獲得足夠的容量和聚合 I/O。
然而,StorageReview 僅使用單臺(tái)服務(wù)器機(jī)箱就完成了全部計(jì)算。
通過(guò)在一臺(tái) Dell? PowerEdge? R7725 服務(wù)器中部署 40 塊大容量 NVMe SSD,該系統(tǒng)實(shí)現(xiàn)了:
無(wú)需外部存儲(chǔ)陣列即可擁有 PB 級(jí)容量
總帶寬足以支撐長(zhǎng)達(dá)數(shù)月的計(jì)算
一種簡(jiǎn)化的運(yùn)行模型,組件和故障域更少

這里的關(guān)鍵不在于每個(gè)工作負(fù)載都需要在一臺(tái)服務(wù)器上配備數(shù)十個(gè)硬盤。相反,該測(cè)試凸顯了現(xiàn)代高密度 NVMe 存儲(chǔ)如何改變?nèi)藗冊(cè)谙到y(tǒng)架構(gòu)上的權(quán)衡取舍。某些情況下,過(guò)去需要采用橫向擴(kuò)展方案來(lái)處理的工作負(fù)載,現(xiàn)在可以通過(guò)縱向擴(kuò)展方案來(lái)解決。
與現(xiàn)代 HPC 和 AI 工作負(fù)載的相關(guān)性
盡管該工作負(fù)載較為特殊,但在運(yùn)行過(guò)程中觀察到的存儲(chǔ)行為與某些實(shí)際生產(chǎn)環(huán)境中的需求高度吻合,這些環(huán)境包括:
大規(guī)模 AI 訓(xùn)練:經(jīng)常需要生成 TB 級(jí)別的檢查點(diǎn)數(shù)據(jù),且存儲(chǔ)性能會(huì)直接影響訓(xùn)練時(shí)間
推理管道和特征存儲(chǔ)庫(kù):可預(yù)測(cè)的延遲比峰值吞吐量更為重要
科學(xué)模擬與建模:任務(wù)可能運(yùn)行數(shù)周或數(shù)月,重啟成本高昂
高級(jí)分析管道:大型工作數(shù)據(jù)集必須靠近計(jì)算所在位置
在上述每種情況下,存儲(chǔ)的一致性以及隨時(shí)間推移的耐久性都會(huì)直接影響任務(wù)的完成、系統(tǒng)利用率以及操作風(fēng)險(xiǎn)。
該記錄中的關(guān)鍵技術(shù)要點(diǎn)
該測(cè)試的目的不僅僅是為了創(chuàng)造一個(gè)數(shù)學(xué)上的里程碑。它展示了當(dāng)今以存儲(chǔ)為中心的計(jì)算所涉及的若干現(xiàn)實(shí)情況:
PB 級(jí)暫存工作負(fù)載可完全在 NVMe 上運(yùn)行
大容量 SSD 能承受極端 I/O 壓力,不會(huì)出現(xiàn)性能驟降
如今的單節(jié)點(diǎn)架構(gòu)能夠處理以往僅能由集群處理的工作負(fù)載
性能的一致性和耐久性與原始帶寬同樣重要
這些結(jié)論表明,存儲(chǔ)系統(tǒng)日益重要,決定著先進(jìn)計(jì)算工作負(fù)載的可行性和效率。
對(duì)數(shù)據(jù)中心戰(zhàn)略與基礎(chǔ)設(shè)施規(guī)劃的影響
該測(cè)試不僅達(dá)成了一個(gè)技術(shù)里程碑,更凸顯了存儲(chǔ)技術(shù)如何日益深刻地影響著現(xiàn)代數(shù)據(jù)中心的運(yùn)營(yíng)成效和架構(gòu)選擇。
對(duì)企業(yè)和 IT 部門領(lǐng)導(dǎo)者而言,最重要的關(guān)注點(diǎn)并非峰值吞吐量,而是大規(guī)模運(yùn)行時(shí)可預(yù)測(cè)的性能。長(zhǎng)期運(yùn)行的工作負(fù)載,無(wú)論是 AI 訓(xùn)練、大規(guī)模分析還是科學(xué)計(jì)算,都會(huì)放大效率低下問(wèn)題和故障所造成的后果。當(dāng)存儲(chǔ)成為瓶頸時(shí),昂貴的計(jì)算資源便會(huì)閑置,成本隨之攀升,并導(dǎo)致交付延宕。
該測(cè)試表明,大容量 NVMe 能夠在較長(zhǎng)時(shí)間內(nèi)持續(xù)為計(jì)算提供數(shù)據(jù),可消除存儲(chǔ)瓶頸,減少意外情況,降低運(yùn)營(yíng)風(fēng)險(xiǎn)。
規(guī)劃基礎(chǔ)設(shè)施升級(jí)時(shí)的考慮因素
當(dāng)團(tuán)隊(duì)在規(guī)劃針對(duì) AI 及其他數(shù)據(jù)密集型工作負(fù)載的升級(jí)時(shí),以下幾項(xiàng)評(píng)估標(biāo)準(zhǔn)變得越來(lái)越重要:
持續(xù)的吞吐量而非突發(fā)性能
短時(shí)間的基準(zhǔn)測(cè)試很難代表實(shí)際工作負(fù)載。在混合讀寫負(fù)載下持續(xù)數(shù)月的一致性,比在幾分鐘內(nèi)達(dá)到的峰值數(shù)據(jù)更為重要。
每臺(tái)服務(wù)器的性能密度
將 PB 級(jí)容量和 I/O 整合到單一系統(tǒng)中的能力,對(duì)功耗、空間、網(wǎng)絡(luò)以及管理開(kāi)銷都會(huì)產(chǎn)生影響。
延遲可預(yù)測(cè)性與尾部行為
平均性能并不能全面反映運(yùn)行情況。異常的延遲可能會(huì)導(dǎo)致流程停滯、檢查點(diǎn)推遲,進(jìn)而導(dǎo)致任務(wù)失敗。
在穩(wěn)定負(fù)載下的耐久性和可靠性
長(zhǎng)時(shí)間運(yùn)行的任務(wù)會(huì)暴露出在短時(shí)間測(cè)試中無(wú)法發(fā)現(xiàn)的問(wèn)題。隨著利用率趨于穩(wěn)定,存儲(chǔ)系統(tǒng)必須始終保持足夠高的性能和數(shù)據(jù)完整性。
簡(jiǎn)化運(yùn)營(yíng)
減少對(duì)外部存儲(chǔ)架構(gòu)或大型集群的依賴,可縮小故障的影響范圍,并簡(jiǎn)化部署和擴(kuò)展。
根據(jù)數(shù)據(jù)中心戰(zhàn)略選擇存儲(chǔ)方案
從該測(cè)試中,我們可以獲得的一個(gè)更廣泛的啟示是:現(xiàn)代 NVMe 存儲(chǔ)讓我們能夠重新思考如何降低復(fù)雜性。在某些場(chǎng)景下,通過(guò)在更少的節(jié)點(diǎn)上采用更高的存儲(chǔ)密度來(lái)實(shí)現(xiàn)縱向擴(kuò)展,可以消除橫向擴(kuò)展的需求。這有助于實(shí)現(xiàn):
更少的服務(wù)器和互連設(shè)備
單位工作量的功耗和散熱需求更低
簡(jiǎn)化的自動(dòng)化與生命周期管理
更快的部署和恢復(fù)時(shí)間
這并非意味著不再需要分布式架構(gòu),只是為基礎(chǔ)設(shè)施團(tuán)隊(duì)提供了更多切實(shí)可行的設(shè)計(jì)方案。
隨著 AI 和分析工作負(fù)載的規(guī)模不斷擴(kuò)大,持續(xù)時(shí)間不斷加長(zhǎng),存儲(chǔ)相關(guān)決策將產(chǎn)生越來(lái)越大的影響,受影響的方面不僅包括性能,還包括成本效益、韌性以及組織響應(yīng)速度。
總結(jié)
314 萬(wàn)億位圓周率的計(jì)算容不得絲毫差錯(cuò)。該系統(tǒng)在持續(xù)負(fù)載之下連續(xù)運(yùn)行了 110 多天,按照常理,應(yīng)該能暴露出其在性能、耐久性或可靠性方面的問(wèn)題。
然而,沒(méi)有出現(xiàn)任何問(wèn)題。
相反,測(cè)試結(jié)果表明,美光大容量 NVMe SSD 能夠提供可持續(xù)的性能、運(yùn)行穩(wěn)定性和性能密度,其表現(xiàn)足以顯著影響基礎(chǔ)設(shè)施的設(shè)計(jì)選擇。
本文探討的主題并非圓周率,而是:當(dāng)存儲(chǔ)系統(tǒng)專為支持超大規(guī)模、長(zhǎng)期運(yùn)行的數(shù)據(jù)密集型工作負(fù)載而設(shè)計(jì)時(shí),能夠?qū)崿F(xiàn)哪些可能,且不會(huì)出現(xiàn)任何問(wèn)題。
本文作者
Mike Serrano
數(shù)據(jù)中心營(yíng)銷策略和內(nèi)容負(fù)責(zé)人
Prasidha Prabhu
產(chǎn)品市場(chǎng)營(yíng)銷高級(jí)經(jīng)理



