

華為昇騰AI芯片遵循“一年一代、算力翻倍” 的迭代邏輯,從通用型算力底座(910C)到場景化細(xì)分(950PR/DT),再到超大規(guī)模算力躍升(960/970),形成覆蓋 “訓(xùn)練、推理” 全場景、“通用、垂直” 全需求的算力譜系,同時通過自研 HBM、雙編程模型等創(chuàng)新,支撐 PTU 計費模式落地與 AI 產(chǎn)業(yè)規(guī)模化發(fā)展。



910C 沿用 SIMD 架構(gòu),專注高效向量計算;950 及后續(xù)型號新增 SIMT 編程模型,支持 “大塊向量流水線處理 + 碎片化數(shù)據(jù)靈活調(diào)度”,內(nèi)存訪問顆粒度從 512 字節(jié)縮減至 128 字節(jié),離散內(nèi)存訪問效率提升 4 倍。
同時,提供 ASIC(昇騰 Core)和 GPGPU 雙生子型號,分別適配 CANN 生態(tài)和 CUDA 兼容生態(tài),降低客戶遷移成本。
內(nèi)存技術(shù)迭代:950 系列首次采用華為自研 HBM 方案,950PR 的 HiBL 1.0 側(cè)重成本控制,950DT 的 HiZQ 2.0 強化帶寬(4TB/s),適配訓(xùn)練場景的高訪存需求;960/970 通過容量翻倍(288GB)和帶寬飆升(最高 14.4TB/s),徹底解決萬億參數(shù)模型的內(nèi)存限制。
互聯(lián)能力升級:從910C 的 784GB/s 到 970 的 4TB/s,互聯(lián)帶寬提升5 倍,支持多芯片集群線性擴(kuò)展,950 系列超節(jié)點可超越英偉達(dá) 2027 年 NVL576 系統(tǒng)性能。
昇騰 910C:通用性強,覆蓋“訓(xùn)練 + 推理” 全場景,當(dāng)前已廣泛應(yīng)用于政務(wù)、金融等行業(yè)的 AI 基礎(chǔ)設(shè)施建設(shè)。

950PR/DT 分工:PR 聚焦推理 Prefill 階段(如視頻推薦、實時交互),DT 側(cè)重推理 Decode 階段(如對話生成)和訓(xùn)練任務(wù),通過差異化內(nèi)存配置(128GB vs 144GB)適配不同訪存需求。
960/970:瞄準(zhǔn)超大規(guī)模場景,960 支持 288GB 超大內(nèi)存,適配千億參數(shù)模型;970 以 4TB/s 互聯(lián)帶寬和 8 PFLOPS 算力,成為 MoE 等下一代 AI 架構(gòu)的核心支撐。
1.全棧優(yōu)化邏輯:從芯片(昇騰)→框架(MindSpore)→算子庫(CANN)→應(yīng)用(ModelArts),形成端到端優(yōu)化,950 系列向量算力占比提升 30%,任務(wù)調(diào)度延遲降低 50%。
2.國產(chǎn)化突破:N+2/N+3 工藝自主可控,HBM 內(nèi)存擺脫對外依賴,HiBL/HiZQ 系列自研存儲技術(shù)填補國內(nèi)空白,互聯(lián)架構(gòu)打破英偉達(dá) NVLink 壟斷。
3.成本優(yōu)勢:950PR 定價約 10 萬元 / 卡(重點客戶 8 萬元),較同性能競品低 30%;960/970 通過多 Die 封裝提升良率,進(jìn)一步降低大規(guī)模部署成本。
完整內(nèi)容請進(jìn)入“智能計算芯知識星球”或掃碼下載“華為昇騰五款旗艦芯片:演進(jìn)路徑、架構(gòu)創(chuàng)新、生態(tài)和詳細(xì)參數(shù)對比”。

免責(zé)申明:本號聚焦相關(guān)技術(shù)分享,內(nèi)容觀點不代表本號立場,可追溯內(nèi)容均注明來源,發(fā)布文章若存在版權(quán)等問題,請留言聯(lián)系刪除,謝謝。

溫馨提示:請通過“掃碼”和“閱讀原文”加入星球,獲取OpenClaw合集,以及更多(芯片、大模型、AI、超節(jié)點、具身智能、算力、HBM、CXL等等...)資料合集。

