
作者 | 黃心怡
阿里云今日宣布靈駿真武M890超節(jié)點(diǎn)實(shí)例正式上線,首批已在烏蘭察布地域開售。就在前一日,《科創(chuàng)板日報(bào)》記者獲悉,阿里云正計(jì)劃將模塊化數(shù)據(jù)中心的全球產(chǎn)能提升兩倍以上。記者從采訪中了解到,阿里自研芯片平頭哥的產(chǎn)能正在持續(xù)提升,未來在其算力體系中的占比將越來越高。
▍平頭哥AI芯片產(chǎn)能逐步提升
阿里云靈駿真武M890超節(jié)點(diǎn)是國內(nèi)首個成功運(yùn)行超2萬億參數(shù)大模型的超節(jié)點(diǎn)形態(tài)算力,Kimi K3和Qwen3.8 Max均已通過該實(shí)例對外提供服務(wù)。
據(jù)悉,靈駿真武M890超節(jié)點(diǎn)實(shí)例支持 FP8/FP4 低精度計(jì)算,通過ICN Switch 1.0 芯片Scale-up 互聯(lián)規(guī)模由16卡拉升至64卡,卡間互聯(lián)提升至800GB/s。在智能駕駛、具身智能等訓(xùn)練場景中,相比上一代真武810E,訓(xùn)練性能提升三倍。
支撐超節(jié)點(diǎn)集群的,是阿里云靈駿智算平臺。依托HPN 8.0 訓(xùn)推一體網(wǎng)絡(luò),單集群最高支持 13 萬卡異構(gòu)算力混布,并可擴(kuò)展至百萬卡級。
截至今年4月,平頭哥真武AI芯片累計(jì)出貨56萬片,阿里云全球數(shù)據(jù)中心總經(jīng)理王朝陽介紹,平頭哥的產(chǎn)能在逐漸提升。“未來非常確定性的是,國產(chǎn)自有芯片的產(chǎn)能會持續(xù)提升,占比越來越高。而產(chǎn)能提升時間大概不需要三年。”
AI時代來臨,數(shù)據(jù)中心進(jìn)入第四代——智算中心(AIDC)。數(shù)據(jù)中心的規(guī)模是過去的十倍,密度是十倍甚至幾十倍,芯片也更加多樣,需要兼容多種架構(gòu)。阿里云也推進(jìn)“一云多芯”戰(zhàn)略,對多種芯片異構(gòu)兼容。“其他的一些芯片我們也愿意去適配模型、適配應(yīng)用?!蓖醭柗Q。
據(jù)了解,基于全模塊化設(shè)計(jì)架構(gòu)CUBE 5.0,阿里云已將大型AIDC數(shù)據(jù)中心的交付工期縮短至100天。同樣的工期,國內(nèi)傳統(tǒng)交付周期為6至12個月,美國為12至18個月。在大幅縮短工期的同時,阿里云數(shù)據(jù)中心整體建設(shè)成本反而降低10%以上。
目前,CUBE 5.0架構(gòu)已在阿里云烏蘭察布、中衛(wèi)等數(shù)據(jù)中心試點(diǎn)跑通,并獲得基于EN標(biāo)準(zhǔn)的歐洲CE認(rèn)證和基于IEC標(biāo)準(zhǔn)的東南亞產(chǎn)品準(zhǔn)入。今年,阿里云正計(jì)劃將模塊化數(shù)據(jù)中心的全球產(chǎn)能提升兩倍以上。
王朝陽介紹,AI算力需求爆發(fā),數(shù)據(jù)中心交付的速度要求變高。傳統(tǒng)的工期為串行施工,每一步都依賴上一步的完工,比如先安裝供配電,再接空調(diào)。阿里云通過全模塊化的設(shè)計(jì)理念,各個環(huán)節(jié)并行生產(chǎn),工廠制造后,預(yù)調(diào)至集裝箱,再運(yùn)抵?jǐn)?shù)據(jù)中心,現(xiàn)場像搭積木一樣吊裝。
▍AI推理算力呈現(xiàn)從西往東下沉的趨勢
本次超節(jié)點(diǎn)實(shí)例首發(fā)地域?yàn)跆m察布是阿里云五大超級數(shù)據(jù)中心之一,該數(shù)據(jù)中心的綠電占比約 45%。
王朝陽表示,選擇烏蘭察布的核心因素就是電價(jià)。“這個地方的電價(jià)大概是在3毛2到3毛5之間。而華東、華南普遍六毛到九毛。一個吉瓦級的數(shù)據(jù)中心,放在烏蘭察布和放在東部,每年電費(fèi)相差50億元。

根據(jù)王朝陽對AI算力分布規(guī)律的觀察,以訓(xùn)練為中心的算力呈現(xiàn)從東往西縱深的趨勢。西部有最便宜的電,結(jié)合西部土地廣闊、氣候涼爽,天然適合高能耗、對延遲不敏感的訓(xùn)練任務(wù)。這使得千卡、萬卡集群最早出現(xiàn)在京津冀、長三角、大灣區(qū),但萬卡、十萬卡集群基本都搬到了"胡煥庸線"以西。據(jù)了解,“胡煥庸線”即“璦琿—騰沖線”,北起黑龍江黑河,南至云南騰沖,呈東北—西南走向,傾斜約45度,全長約4000公里。
而以推理為中心的算力則正好相反,呈現(xiàn)從西往東下沉的趨勢。這是由于東部地區(qū)是AI推理需求的主力爆發(fā)點(diǎn),用戶在這里,數(shù)據(jù)和業(yè)務(wù)在這里,AI推理必須靠近用戶。
王朝陽說預(yù)計(jì),未來長三角、大灣區(qū)、京津冀三大經(jīng)濟(jì)圈,將來會出現(xiàn)大量的推理型算力集群,并逐步形成產(chǎn)業(yè)群的覆蓋?!芭e個例子,新興的產(chǎn)業(yè),數(shù)字化基礎(chǔ)非常好的產(chǎn)業(yè)一定會成為Token使用聚集區(qū)域?!?/span>
▍未來單機(jī)柜平均功率或?qū)⑼黄?000千瓦
隨著數(shù)據(jù)中心進(jìn)入智算中心(AIDC)時代。數(shù)據(jù)中心的規(guī)模是過去的十倍,密度是十倍甚至幾十倍,芯片也更加多樣,需要兼容多種架構(gòu)。這都必須要有大量的電力供應(yīng)。
王朝陽表示,這使得數(shù)據(jù)中心選址需要選擇能源富集的地方,才能發(fā)展大規(guī)模的算力。其次,功率密度越來越大,特別是AIDC時代單機(jī)柜功率密度已經(jīng)達(dá)到了100千瓦,未來兩年之內(nèi)還會出現(xiàn)1000千瓦的機(jī)柜。
與此同時,供給端的瓶頸正在從芯片向更上游蔓延。王朝陽舉例:“最早是GPU產(chǎn)能不足,存儲是一個瓶頸,后來電力供給又成為瓶頸,再后來光纖也出現(xiàn)瓶頸。中國一年生產(chǎn)6億公里光纖,但仍然會出現(xiàn)瓶頸——因?yàn)橐粋€十萬卡集群就需要幾十萬公里光纖。而各個光模塊也會出現(xiàn)瓶頸。”
談及產(chǎn)能瓶頸,王朝陽表示,此前做過評估,在目前全中國產(chǎn)能約8吉瓦的情況下,可以比較好地覆蓋當(dāng)下芯片的產(chǎn)能需求?!翱赡軙霈F(xiàn)局部的問題、短期的問題,但整體上沒有大問題?!?/span>
王朝陽還提到高壓直流技術(shù)的重要性?!跋乱淮鷶?shù)據(jù)中心如果采用240伏交流電,已無法承載當(dāng)前密度,電纜在物理空間上超出物理極限。所以必須把電壓升至400伏,甚至800伏、1500伏。隨著密度繼續(xù)升高,電壓還在往上走?!?/span>
此外,風(fēng)冷和液冷兼容幾乎是AIDC的標(biāo)配,如何實(shí)現(xiàn)更高配比、更好效果是持續(xù)優(yōu)化的方向。
在算電協(xié)同方面,王朝陽認(rèn)為,GPU時代功耗呈現(xiàn)垂直增長,這意味著需要用全新的技術(shù)來解決,目前中美在算電協(xié)同方面都進(jìn)行了大量的嘗試,但是仍然處在非常初級的階段。相信隨著算力中心的發(fā)展,會對當(dāng)前的框架,包括電網(wǎng)的穩(wěn)定性,包括發(fā)電企業(yè)等造成沖擊,從而產(chǎn)生新的業(yè)態(tài)。

