

然而DeepSeek V4的這一決定,直接撼動了英偉達CUDA這道護城河的根基。據測試數據,DeepSeek V4在昇騰950PR上的推理速度較初期版本提升了35倍,單卡推理性能達到英偉達特供版H20芯片的2.87倍。更關鍵的是,華為CANN框架已實現超95%的CUDA代碼兼容性,輔以一鍵遷移工具,原本需要數月完成的代碼重構如今縮短到“按小時計”。過去開發者要從CUDA遷移到其他平臺,動輒重寫數萬行代碼,而今天,這道門檻正在被快速削平。
據了解,目前華為已經自主構建一套全棧的軟件體系——從對標CUDA的CANN算子庫,到自研AI框架昇思MindSpore,再到覆蓋各行業的應用工具鏈。截至2025年底,昇思MindSpore全球下載量已超1300萬次,覆蓋130多個國家和地區的2400多個城市,孵化了40多個大模型和380多個應用。開發者數量超400萬,合作伙伴超3000家,孵化行業解決方案超6700個——這不是一個停留在PPT上的生態,而是已經跑起來的真實網絡。

產業層面,大單落地正在加速。4月13日,中國移動啟動了2026至2027年人工智能超節點設備集中采購,總金額約20.6億元,指定全部采用華為CANN生態方案,這是運營商首次在集團層面啟動AI超節點集中采購。金融領域,郵儲銀行率先完成昇騰384超節點的規模化部署,將單卡吞吐性能提升10倍以上,加速“郵智”大模型應用落地。科大訊飛則宣布新一代星火大模型將全面適配昇騰910和950系列算力底座。
從電信運營商到金融機構,從互聯網巨頭到AI企業,國產AI算力正在全行業鋪開;國產AI生態正在一步步構建之中。
這意味著,華為CANN生態在易用性上確實取得了革命性進步,特別是SIMT編程模型的引入,使得大量現有CUDA Kernel代碼只需重新編譯即可運行。然而,“生態”包含工具鏈、社區、第三方庫支持等多個維度。目前其調試工具(如nsight) 和小眾算子庫的支持仍不完善。我們也必須客觀承認當前華為CANN生態與英偉達CUDA生態仍然存在顯著的差距。具體如下表:

同時,AI芯片市場份額的消長同樣印證著這種沖擊。IDC報告顯示,2025年中國AI加速卡市場中,英偉達的份額已從過去高達九成驟降至約55%,而國產陣營合計已占據約41%。在中國這個全球最大的AI應用市場,英偉達的統治力正在肉眼可見地松動。

