當(dāng)前數(shù)字經(jīng)濟(jì)的版圖在2026年加速擴(kuò)張,算力早已不再是冰冷的晶體管堆疊,而是驅(qū)動(dòng)時(shí)代前行的“新石油”。然而,對(duì)于中國(guó)而言,這片富饒的“油田”卻長(zhǎng)期受“存儲(chǔ)墻”的物理枷鎖和國(guó)外架構(gòu)的生態(tài)壁壘所制約。
一家名為“東方算芯”的企業(yè)正加速崛起。它沒(méi)有選擇在別人的賽道上亦步亦趨,而是亮出了一張?jiān)醋郧迦A大學(xué)二十余年可重構(gòu)計(jì)算技術(shù)深耕積淀的“底牌”——軟件定義計(jì)算架構(gòu)與3D混合鍵合(Hybrid Bonding)近存計(jì)算。

官方資料顯示,東方算芯由可重構(gòu)計(jì)算領(lǐng)域奠基人魏少軍院士親自出任董事長(zhǎng)兼CEO,統(tǒng)籌技術(shù)路線(xiàn)與整體戰(zhàn)略布局。其他高管團(tuán)隊(duì)成員,均出自頭部芯片與產(chǎn)業(yè)集團(tuán),覆蓋研發(fā)調(diào)度、資本財(cái)務(wù)、AI架構(gòu)落地等關(guān)鍵業(yè)務(wù)板塊。一線(xiàn)研發(fā)中堅(jiān)多來(lái)自清華、上海交大、武漢大學(xué)等國(guó)內(nèi)頂尖高校,普遍擁有10至20年商用算力芯片量產(chǎn)經(jīng)驗(yàn),人才結(jié)構(gòu)清晰。
從清華實(shí)驗(yàn)室到張江,二十年磨一劍的“冷板凳”
如果將國(guó)產(chǎn)算力芯片的賽道比作一場(chǎng)馬拉松,多數(shù)選手仍在追趕前方“通用GPU”的背影。而東方算芯,選擇的是改變跑道本身。
2024年落地上海張江的東方算芯,并非一家橫空出世的初創(chuàng)公司,其核心基因源自董事長(zhǎng)魏少軍院士團(tuán)隊(duì)二十余年的持續(xù)技術(shù)攻關(guān)。作為國(guó)內(nèi)可重構(gòu)計(jì)算、軟件定義芯片領(lǐng)域的奠基性團(tuán)隊(duì)之一,他們完成了從基礎(chǔ)理論創(chuàng)新、關(guān)鍵技術(shù)突破到規(guī)?;a(chǎn)業(yè)應(yīng)用的全鏈路研發(fā)閉環(huán)。
自2006年起,這支團(tuán)隊(duì)依托國(guó)家自然科學(xué)基金重點(diǎn)項(xiàng)目、863計(jì)劃、核高基專(zhuān)項(xiàng)等一系列國(guó)家級(jí)重大科研載體,系統(tǒng)開(kāi)展可重構(gòu)處理器基礎(chǔ)研究。在全球芯片產(chǎn)業(yè)長(zhǎng)期固化為CPU、ASIC、FPGA三類(lèi)主流形態(tài)的背景下,團(tuán)隊(duì)前瞻性地提出“軟件定義硬件”的創(chuàng)新范式,嘗試通過(guò)硬件電路動(dòng)態(tài)可重構(gòu)設(shè)計(jì),突破傳統(tǒng)計(jì)算架構(gòu)的剛性桎梏。
這之后,便是一場(chǎng)漫長(zhǎng)而孤獨(dú)的攀登。
2014至2016年,團(tuán)隊(duì)完成第一代可重構(gòu)處理器系統(tǒng)級(jí)技術(shù)驗(yàn)證,先后斬獲國(guó)家技術(shù)發(fā)明獎(jiǎng)二等獎(jiǎng)、中國(guó)專(zhuān)利金獎(jiǎng);2017至2020年,面向人工智能、高端信息安全等關(guān)鍵領(lǐng)域的可重構(gòu)芯片實(shí)現(xiàn)批量量產(chǎn),累計(jì)收獲4項(xiàng)中國(guó)電子學(xué)會(huì)技術(shù)發(fā)明一等獎(jiǎng),相關(guān)成果入選2018年世界互聯(lián)網(wǎng)大會(huì)全球領(lǐng)先科技成果。
隨著AI大模型時(shí)代的曙光初現(xiàn),2021年成為企業(yè)技術(shù)路線(xiàn)定型的關(guān)鍵拐點(diǎn)。團(tuán)隊(duì)創(chuàng)新性地將可重構(gòu)計(jì)算架構(gòu)與3D混合鍵合近存計(jì)算技術(shù)融合,完成異質(zhì)集成研發(fā)與驗(yàn)證。實(shí)測(cè)數(shù)據(jù)顯示,自研芯片能效可達(dá)A100的3倍,驗(yàn)證了國(guó)產(chǎn)原創(chuàng)算力架構(gòu)的性能優(yōu)勢(shì)與工程可行性。
2023年,全國(guó)產(chǎn)高性能智算服務(wù)器機(jī)柜實(shí)現(xiàn)工程化落地,達(dá)成37.5TOPS算力、276Tbps超高帶寬的性能指標(biāo),標(biāo)志著“芯片設(shè)計(jì)—整機(jī)集成—系統(tǒng)交付”的產(chǎn)業(yè)化閉環(huán)基本打通。
2024年5月,上海東方算芯科技有限公司正式成立,標(biāo)志著深耕二十年的高校前沿技術(shù)成果,完成向市場(chǎng)化、產(chǎn)業(yè)化主體的系統(tǒng)性轉(zhuǎn)化。目前,公司已在北京、西安、南京、蘇州、成都設(shè)立五大分支機(jī)構(gòu),累計(jì)持有國(guó)內(nèi)發(fā)明專(zhuān)利百余項(xiàng),在ISSCC、ISCA等國(guó)際頂會(huì)頂刊發(fā)表論文超百篇,構(gòu)建起覆蓋芯片架構(gòu)、工藝封裝、算法適配的自主知識(shí)產(chǎn)權(quán)體系。
雙劍合璧:擊碎“存儲(chǔ)墻”的物理枷鎖
構(gòu)建自主體系并非終點(diǎn),而是為了攻克更深層的物理極限。當(dāng)前AI產(chǎn)業(yè)的爆發(fā)式增長(zhǎng),正受到傳統(tǒng)馮·諾依曼(von Neumann)架構(gòu)的掣肘。
在這一經(jīng)典架構(gòu)中,計(jì)算和存儲(chǔ)功能不但分離,且更側(cè)重于計(jì)算。數(shù)據(jù)如同一位在“倉(cāng)庫(kù)”與“工廠(chǎng)”之間疲于奔命的搬運(yùn)工,頻繁遷移帶來(lái)了巨大的功耗損耗。處理器和存儲(chǔ)器長(zhǎng)期以來(lái)所采用的不同工藝路線(xiàn),也是造成“存儲(chǔ)墻”和“功耗墻”問(wèn)題的重要原因之一。
這一原生架構(gòu)缺陷,在6nm、7nm成熟制程下已接近性能平衡的天花板,難以適配新一代AI終端的迭代需求,需要進(jìn)行“結(jié)構(gòu)性手術(shù)”。東方算芯給出的方案,是“軟件定義可重構(gòu)架構(gòu)”與“3D混合鍵合近存計(jì)算”的深度融合。
軟件定義計(jì)算架構(gòu):重構(gòu)底層計(jì)算范式
當(dāng)前,商用主流GPU與ASIC芯片均遵循“硬件定義算力”的傳統(tǒng)范式,其核心計(jì)算單元與數(shù)據(jù)通路在流片量產(chǎn)之際便已固化。隨著多模態(tài)AI、行業(yè)專(zhuān)屬大模型、工業(yè)超算等新興場(chǎng)景的爆發(fā),細(xì)分算力需求呈現(xiàn)高度碎片化特征,固定架構(gòu)的適配短板被急劇放大。
為彌補(bǔ)場(chǎng)景缺口,行業(yè)不得不被動(dòng)陷入“堆疊芯片規(guī)模”的內(nèi)卷,導(dǎo)致硬件實(shí)際利用率長(zhǎng)期徘徊在40%以下。算力冗余與高昂的綜合運(yùn)營(yíng)成本,成為制約AI產(chǎn)業(yè)規(guī)模化落地的核心痛點(diǎn)。
面對(duì)這一行業(yè)級(jí)難題,東方算芯以軟件定義芯片架構(gòu)為核心,確立了“算法驅(qū)動(dòng)軟件、軟件定義硬件”的柔性計(jì)算新范式。該架構(gòu)的核心壁壘在于硬件電路的動(dòng)態(tài)可編程能力——無(wú)需經(jīng)歷耗資巨大的硬件迭代與重新流片,系統(tǒng)即可通過(guò)高層級(jí)軟件指令,在納秒級(jí)時(shí)間內(nèi)動(dòng)態(tài)配置底層邏輯單元、互連通路與運(yùn)算陣列,完成電路拓?fù)涞膶?shí)時(shí)重構(gòu)。
相較于通用GPU架構(gòu),軟件定義芯片技術(shù)在算力全生命周期中實(shí)現(xiàn)了降本增效。在研發(fā)端,硬件的動(dòng)態(tài)重構(gòu)特性削減了細(xì)分場(chǎng)景定制化芯片的重復(fù)流片成本;應(yīng)用端,硬件資源可隨算法迭代持續(xù)升級(jí),延長(zhǎng)了底層設(shè)備的生命周期,緩解了算力硬件因技術(shù)迭代而快速貶值的行業(yè)頑疾。
性能端,系統(tǒng)能夠動(dòng)態(tài)重構(gòu)多精度融合計(jì)算陣列,根據(jù)模型特性自動(dòng)選擇最優(yōu)數(shù)據(jù)通路;同時(shí)以Tensor Tile為基本調(diào)度單元,構(gòu)建全異步、無(wú)阻塞的數(shù)據(jù)流執(zhí)行引擎,提升計(jì)算資源利用率。這一機(jī)制從物理底層緩解了通用芯片的算力浪費(fèi)問(wèn)題,在降低對(duì)先進(jìn)芯片制造工藝依賴(lài)的同時(shí),目前已在成熟工藝節(jié)點(diǎn)下實(shí)現(xiàn)了520 TFLOPS@BF16
這種設(shè)計(jì)打破了通用與專(zhuān)用的界限,使單顆芯片能夠柔性適配多模態(tài)AI訓(xùn)練推理、科學(xué)超算、高清媒體編解碼及高端信息安全加密等多元負(fù)載,兼具了FPGA的可編程靈活性與ASIC的高算力、低功耗優(yōu)勢(shì)。
支撐這一架構(gòu)落地的,是東方算芯極具工程化實(shí)力的核心研發(fā)團(tuán)隊(duì)。團(tuán)隊(duì)在芯片架構(gòu)定義、AI算子庫(kù)構(gòu)建、全流程驗(yàn)證及算法協(xié)同優(yōu)化等關(guān)鍵領(lǐng)域擁有深厚底蘊(yùn)。這意味著東方算芯已具備從底層架構(gòu)定義、算法映射、前端設(shè)計(jì)到流片量產(chǎn)、工程交付的全鏈條閉環(huán)能力,為前沿理論向成熟商用產(chǎn)品的轉(zhuǎn)化提供了堅(jiān)實(shí)保障。
3D混合鍵合近存計(jì)算:構(gòu)筑全國(guó)產(chǎn)高能效算力底座
馮·諾依曼架構(gòu)中的計(jì)算核心與外置存儲(chǔ)是分離的,數(shù)據(jù)需在計(jì)算與存儲(chǔ)單元之間高頻往復(fù)搬運(yùn),產(chǎn)生巨大的傳輸延遲與無(wú)效功耗,導(dǎo)致芯片理論算力無(wú)法充分釋放。即便持續(xù)提升計(jì)算核心規(guī)模,整機(jī)算力也難以實(shí)現(xiàn)線(xiàn)性增長(zhǎng),這也是當(dāng)前主流GPU架構(gòu)難以逾越固有性能天花板的原因所在。
針對(duì)這一行業(yè)痛點(diǎn),除可重構(gòu)計(jì)算架構(gòu)外,3D混合鍵合近存計(jì)算技術(shù)也貢獻(xiàn)頗多。該技術(shù)采用3D垂直堆疊異質(zhì)集成方案,摒棄了傳統(tǒng)凸點(diǎn)封裝互連模式,通過(guò)銅-銅直接鍵合工藝,實(shí)現(xiàn)邏輯層與DRAM層的無(wú)凸點(diǎn)垂直互連。相比傳統(tǒng)2.5D HBM方案(依賴(lài)硅中介層和微凸點(diǎn)),混合鍵合將互連間距壓縮至亞微米級(jí)別,帶來(lái)數(shù)量級(jí)提升的互連密度與帶寬密度。
實(shí)測(cè)數(shù)據(jù)顯示,在大模型并行訓(xùn)練、海量數(shù)據(jù)推理、工業(yè)超算仿真等高密算力場(chǎng)景下,該架構(gòu)下的訪(fǎng)存帶寬達(dá)到6.4TB/s,Scale-up互聯(lián)帶寬為900GB/s,性能優(yōu)于傳統(tǒng)HBM方案。
更為關(guān)鍵的是,在2026年的當(dāng)下,供應(yīng)鏈安全已不再是一道選擇題,而是一道必答題。東方算芯的另一重戰(zhàn)略?xún)r(jià)值,在于其構(gòu)建了一條完全自主的供應(yīng)鏈閉環(huán)。
工藝選擇上,芯片邏輯層采用成熟國(guó)產(chǎn)工藝,存儲(chǔ)層搭載國(guó)產(chǎn)存儲(chǔ)工藝,三維混合鍵合、封裝測(cè)試、系統(tǒng)集成等核心環(huán)節(jié)均100%依托國(guó)內(nèi)先進(jìn)封裝產(chǎn)業(yè)鏈完成,有效降低了對(duì)海外先進(jìn)制程、HBM存儲(chǔ)器、核心IP及高端生產(chǎn)設(shè)備的依賴(lài)。
全棧自主:從芯片到集群的生態(tài)閉環(huán)
DF1000也是東方算芯在WAIC 2026上展示的旗艦產(chǎn)品。依托國(guó)產(chǎn)化供應(yīng)鏈,這顆軟件定義近存計(jì)算3D AI芯片通過(guò)空間并行與時(shí)分復(fù)用設(shè)計(jì)提升硬件利用率;采用3D混合鍵合技術(shù)實(shí)現(xiàn)晶圓級(jí)堆疊,有效提升訪(fǎng)存帶寬,降低供應(yīng)鏈依賴(lài);配套自主編程框架與軟件生態(tài),具備計(jì)算效率高、通用性強(qiáng)、訪(fǎng)存帶寬大、能效表現(xiàn)優(yōu)的特點(diǎn),為AI產(chǎn)業(yè)提供穩(wěn)定的國(guó)產(chǎn)算力底座。

但若將東方算芯的版圖僅定格在單一AI芯片上,無(wú)疑低估了其真正的產(chǎn)業(yè)雄心。
當(dāng)多數(shù)玩家仍在芯片級(jí)的紅海中博弈時(shí),東方算芯已跳出單點(diǎn)技術(shù)的局限,以軟硬件一體化的交付能力,打通了從底層芯片、板卡、服務(wù)器機(jī)柜到大規(guī)模智算集群的全鏈路。這套“全棧生態(tài)矩陣”的成型,標(biāo)志著公司完成了硬件產(chǎn)品線(xiàn)的縱向貫通,也為國(guó)產(chǎn)算力構(gòu)筑了系統(tǒng)級(jí)的競(jìng)爭(zhēng)壁壘。
例如,公司自研的高通量軟件定義AI服務(wù)器實(shí)現(xiàn)了較高的空間利用率??赏ㄟ^(guò)模塊化堆疊,快速組建512卡大規(guī)模智算集群。這一高密度設(shè)計(jì)適配通用大模型訓(xùn)練、多模態(tài)智能推理及高端超算仿真等核心場(chǎng)景,原生匹配國(guó)產(chǎn)算力基礎(chǔ)設(shè)施建設(shè)規(guī)范與信創(chuàng)替代要求。
與之相匹配的,是東方算芯針對(duì)云端大模型訓(xùn)練與推理的規(guī)?;枨?,構(gòu)建的從芯片級(jí)(軟件定義通信處理器),到服務(wù)器級(jí)(原生以太網(wǎng)超節(jié)點(diǎn)),再到軟件級(jí)(原生分布式編程模型與運(yùn)行時(shí))的原生分布式執(zhí)行架構(gòu)。依托這一全棧協(xié)同的底層支撐,該體系實(shí)現(xiàn)了對(duì)上層生態(tài)的對(duì)接,兼容Triton、Kubernetes、Hugging Face、vLLM、SGLang、Megatron等主流AI開(kāi)發(fā)框架與容器工具鏈。
這種生態(tài)兼容性,降低了國(guó)產(chǎn)算力芯片的適配與遷移成本。無(wú)論是AI企業(yè)、科研院所還是政企算力平臺(tái),均可獲得標(biāo)準(zhǔn)化、輕量化、開(kāi)箱即用的整體算力解決方案,推動(dòng)國(guó)產(chǎn)算力從“可用”向“好用”邁進(jìn)。
基于這種全棧生態(tài)的支撐,東方算芯的戰(zhàn)略路徑愈發(fā)清晰:短期內(nèi),公司將聚焦智算與超算芯片的工程落地與規(guī)?;茝V;中長(zhǎng)期依托架構(gòu)迭代,致力于打造具備國(guó)際競(jìng)爭(zhēng)力的高性能計(jì)算系統(tǒng)解決方案,為國(guó)民經(jīng)濟(jì)與產(chǎn)業(yè)升級(jí)提供國(guó)產(chǎn)算力支撐。
結(jié)語(yǔ)
當(dāng)前,國(guó)產(chǎn)算力賽道同質(zhì)化競(jìng)爭(zhēng)加劇,多數(shù)企業(yè)仍在海外通用GPU的既定規(guī)則下追趕。而東方算芯的探索之所以引人關(guān)注,在于其跳出“對(duì)標(biāo)”思路,依托自主可重構(gòu)近存計(jì)算架構(gòu)與國(guó)產(chǎn)化供應(yīng)鏈,蹚出了一條差異化的創(chuàng)新路徑。
在國(guó)家全域智能算力網(wǎng)絡(luò)加速建設(shè)、底層技術(shù)強(qiáng)鏈補(bǔ)鏈的時(shí)代背景下,東方算芯不僅為關(guān)鍵行業(yè)的國(guó)產(chǎn)化替代提供了算力支撐,也為國(guó)內(nèi)新型計(jì)算架構(gòu)的商業(yè)化落地,提供了一種可參考的產(chǎn)學(xué)研創(chuàng)新樣本。
未來(lái),隨著新一代訓(xùn)推一體芯片的迭代與交付網(wǎng)絡(luò)的完善,東方算芯有望在國(guó)產(chǎn)高端算力賽道中持續(xù)發(fā)揮“破局者”的作用,推動(dòng)中國(guó)高性能計(jì)算產(chǎn)業(yè)向自主化、高質(zhì)量方向發(fā)展。