今年華為開發(fā)者大會HDC的亮點,絕對不只是HarmonyOS Next操作系統(tǒng)。余承東(華為常務(wù)董事、終端BG董事長、智能汽車解決方案BU董事長)在主題演講中給出了這樣一張華為的能力棧框架圖,這其中的每一個都可以說是亮點——這張圖也有利于我們理解,華為不同能力所處的層級及個中關(guān)系。

這場發(fā)布會提及的不單是盤古大模型自身,也在于華為在AI HPC領(lǐng)域內(nèi)的整體能力,包括昇騰服務(wù)器及華為云基礎(chǔ)設(shè)施。雖然華為在發(fā)布會上沒有提到英偉達,但很顯然在我們看來,其AI HPC各方面能力看齊的都是英偉達。
比如說盤古大模型對于自動駕駛的助力,用于自動駕駛AI訓(xùn)練的合成數(shù)據(jù)(synthetic data)生成能力,這也是英偉達DRIVE Sim的能力;對于工業(yè)與建筑設(shè)計的輔助,甚至直接輸出3D格式文件,略有點Omniverse用于設(shè)計的味道;用于機器人的具身智能大模型,英偉達Isaac;用于公里級別精度的氣象預(yù)報,有點兒Earth-2的樣子了;甚至藥物發(fā)現(xiàn)、鐵路檢修等等...
所以我們說在AI這個方向上,華為大概的確是有成為英偉達替代方案的決心的;且相較于其他既有AI生態(tài),華為也是國內(nèi)走得最快的市場參與者之一。
盤古5.0概覽:多模態(tài)強化是亮點
從盤古大模型的發(fā)展情況來看,這應(yīng)該是個更偏重行業(yè)應(yīng)用的基礎(chǔ)大模型。華為云CEO張平安說,盤古大模型當前已經(jīng)進入到中國30+行業(yè),400+應(yīng)用場景,包括后文會提到的汽車、醫(yī)療、交通、氣候、重工業(yè)等。
這次新發(fā)布的盤古5.0主要強調(diào)3個方面的加強:全系列、多模態(tài)、“強思維”。

全系列指的是從大規(guī)模數(shù)據(jù)中心集群,到邊緣的適配。所以盤古大模型5.0有E系列(Embedded)——面向手機、PC,參數(shù)量十億級;P系列(Professional)——參數(shù)量百億級別;U系列(Ultra)——千億級參數(shù)量,是“企業(yè)大模型的通用底座,可以處理復(fù)雜任務(wù)”;S系列(Super)——萬億參數(shù)大模型,“處理跨領(lǐng)域的復(fù)雜任務(wù)”。
而多模態(tài)當然就是指,不同類型的數(shù)據(jù)理解能力,除了文本、圖片和視頻外,還包括了可見光、紅外、雷達、點云等類型的傳感數(shù)據(jù)。還有多模態(tài)生成能力,“盤古5.0能夠生成符合物理規(guī)律的多模態(tài)內(nèi)容”,例如后文將提到的自動駕駛合成數(shù)據(jù)生成。
第三,思維升級,也就是復(fù)雜推理能力。張平安說,“我們將思維鏈和策略搜索深度結(jié)合,極大提升了盤古的復(fù)雜任務(wù)規(guī)劃能力”。

有關(guān)多模態(tài)數(shù)據(jù)的理解能力,讓我們印象最深刻的例子,是將10k像素級分辨率的《清明上河圖》輸入盤古大模型,問“趙太丞家有多少人”。這里的趙太丞家,從圖上看實際只占到清明上河圖不到1/200的比例。盤古能夠通過對于門匾的文字,及其中的人物數(shù)量,給出正確回答。
除了圖像,如前所述盤古5.0支持可見光、紅外、雷達、點云多模態(tài)輸入。所以通過衛(wèi)星遙感可見光拍攝的畫面,可分析某個區(qū)域農(nóng)作物的生長、收成情況。對紅外影像的理解,用于城市交通管理,則可識別車輛和人行軌跡。理解雷達影像,搭配可見光,就能判斷植被覆蓋,利于生態(tài)監(jiān)測。
具體到技術(shù),諾亞方舟實驗室主任姚駿提到,有關(guān)視覺的多模態(tài),不同的視覺領(lǐng)域有各自獨立的編碼方案,“會有冗余、沖突”。“我們把這些編碼器蒸餾到同一個視覺編碼器中,提升模型表征能力和精度”;

另外他還提到視覺輸入的“動態(tài)分辨率”,“提出尺度泛化的訓(xùn)練范式”,用低分辨率圖像及簡單任務(wù)去訓(xùn)練基礎(chǔ)感知能力;用中高分辨率圖像與包括圖像理解等在內(nèi)的細粒度感知任務(wù),得到細粒度的感知能力;
再擴展到更高分辨率和更多任務(wù)類型...最終“重點突破模型的高階推理能力”,作為一種階梯式數(shù)據(jù)課程學習方式,“由難到易學習多模態(tài)信息”。最終得到的結(jié)果是“超過業(yè)界同等模型的能力”,也就是更高的多模態(tài)數(shù)據(jù)處理能力。
而在“思維升級”方面,談的主要是多步推理和復(fù)雜任務(wù)處理能力——嘗試用大模型輔助寫算法的開發(fā)者應(yīng)該很清楚,大模型在復(fù)雜邏輯問題的處理能力上是比較差的。“模型也應(yīng)該像人一樣,把問題的快思考變成慢思考。”

也就是一步步分解、推導(dǎo)。“我們提出基于多步生成和策略搜索的MindStar方法”,“先把復(fù)雜推理任務(wù)分解成多個子問題,子問題會生成多個候選方案;通過搜索和過程反饋獎勵模型,選擇多步最優(yōu)回答路徑。”
姚駿說用MindStar技術(shù)的百億模型,就能達到業(yè)界千億模型的推理能力。“相當于使用慢思考帶來10倍以上的參數(shù)量加成。”“將MindStar這一強思維方式應(yīng)用到更大尺度的模型上,就能逐步在復(fù)雜推理上,更接近人、超越人。”
列舉幾個行業(yè)場景:高鐵、汽車、機器人
如文首所述,這次華為列舉盤古5.0的幾個行業(yè)應(yīng)用,主要是客運、汽車、工業(yè)與建筑設(shè)計、機器人、重工業(yè)等相關(guān)的。這里列舉幾個給我們留下了深刻印象的例子。

首先是和北京鐵道所合作,“盤古眼”(包含大量傳感器的機器人)配合盤古大模型用于高鐵巡檢。一輛動車有超過32000個故障檢測點,需要數(shù)百個工作人員才能完成日常巡檢工作。新版的盤古大模型新增了更多維度的數(shù)據(jù)理解能力,它能解決很多傳統(tǒng)機器視覺解決不了的問題,如結(jié)合三維信息發(fā)現(xiàn)螺帽是否松動、借助光譜分析識別漏油還是漏水。
北鐵所介紹說,盤古高鐵大模型對海量的高鐵行業(yè)數(shù)據(jù)進行訓(xùn)練和精調(diào)(fune-tune);結(jié)合二維圖片+三維點云+激光光譜等多模態(tài)數(shù)據(jù)的融合診斷技術(shù);以及對高鐵場景罕見故障樣本生成,通過數(shù)據(jù)反哺,“邊用邊學,故障識別準確率進一步達到99%+”。
據(jù)說將來這樣的智能化技術(shù),準備從火車、高鐵,延伸到城鐵、地鐵等更多軌道交通業(yè)務(wù)場景。

還有個例子是自動駕駛相關(guān)的,體現(xiàn)的主要是盤古5.0的多模態(tài)生成能力。我們知道在AI應(yīng)用于自動駕駛以后,汽車可以在虛擬數(shù)字世界中進行學習和測試——給汽車的自動駕駛系統(tǒng)看各種復(fù)雜場景,以便在實際操作中能夠應(yīng)對各種狀況。通常自動駕駛要做好,需要數(shù)十萬、百萬公里的高質(zhì)量視頻駕駛數(shù)據(jù)。
但高質(zhì)量自然數(shù)據(jù)往往不夠,這就需要生成所謂的“合成數(shù)據(jù)”。張平安著重展示了盤古5.0這方面的能力,“通過可控時空生成技術(shù),理解物理規(guī)律,大規(guī)模生成和實際場景一致的駕駛視頻數(shù)據(jù)。”比如車身不同位置的6個攝像頭,對應(yīng)生成同一場景內(nèi)不同視角、合乎空間和時間對應(yīng)關(guān)系的合成數(shù)據(jù)。
生成過程可以改變各種控制條件,比如增加不同方向的來車;以及讓模型生成不同天氣與時間的行車視頻。華為展示的雨天行車視頻中,車尾行車燈也是開啟的。“說明模型通過海量視頻數(shù)據(jù),學習到雨天開車是應(yīng)該要開車燈的。”這些都是自動駕駛+AI技術(shù)的必備技能。

此外,將盤古大模型用于工業(yè)設(shè)計,不僅能夠生成適配不同環(huán)境光影的3D汽車模型,還能輸出3D文件;和華南理工大學合作用于建筑設(shè)計,基于設(shè)計草圖就生成建筑環(huán)視視頻等;
以及AI原生譯制能力,可將電影原片譯制為不同語言的版本——且語音保留原角色的音色、情感和語氣;乃至在視頻會議中,結(jié)合數(shù)字人與AI譯制,直接讓視頻參與者的數(shù)字化身說不同的語言等等...
相信關(guān)注AI技術(shù)的讀者,對于這些案例都不會陌生,此處不再一一例舉。

最后再談?wù)剻C器人應(yīng)用,即“盤古具身智能大模型”。此前我們多次撰文提到過,機器人是AI走向高級階段,從數(shù)字世界走向真實世界的關(guān)鍵。盤古具身智能大模型“能夠讓機器人完成10步以上的復(fù)雜任務(wù)規(guī)劃,并在任務(wù)規(guī)劃中實現(xiàn)多場景的泛化和多任務(wù)處理”;與此同時,和隔壁的Isaac Sim一樣,讓機器人在虛擬世界進行訓(xùn)練,“生成機器人所需的多模態(tài)數(shù)據(jù),讓機器人提前訓(xùn)練和學習各種復(fù)雜場景”。
發(fā)布會現(xiàn)場演示名為“夸父”的機器人,能夠通過多模態(tài)的世界感知,進行邏輯推理和任務(wù)規(guī)劃。比如說從桌上拿對應(yīng)的東西、理解桌上的東西是什么、該怎么拿,與人進行語言和肢體交互等。“除了人形機器人,盤古具身智能大模型,還可賦能多形態(tài)的工業(yè)機器人和服務(wù)機器人。”
在AI走向物理真實世界以后,AI賦能包括零售、物流、醫(yī)療、家庭服務(wù)、工業(yè)與生產(chǎn)等在內(nèi)的千行百業(yè),也就成為驅(qū)動萬億市場價值的生意了。
光有模型還不行:算力基礎(chǔ)設(shè)施配合強化
從華為的介紹來看,盤古大模型的行業(yè)應(yīng)用進展很不錯。除了前述諸如與北鐵所的合作,還有像是已經(jīng)在寶鋼的一條熱軋生產(chǎn)線上線——用于進行工程調(diào)優(yōu)、增加年收益,目前還在探討用于高爐場景的降本增效;
與深圳市氣象局合作,打造基于盤古大模型的AI區(qū)域報模型“智霽1.0”,提供公里級的氣象預(yù)報;以及與天士力合作,讓盤古藥物分子大模型學習350萬天然產(chǎn)物分子,以期發(fā)現(xiàn)中藥有效成分、優(yōu)化方劑等等...
不過光做模型,要搞好生態(tài)還是遠遠不夠的。在模型之下的基礎(chǔ)設(shè)施部分,華為強調(diào)的是昇騰算力底座、昇騰AI云服務(wù)。這是“加速模型開發(fā),使能千模百態(tài)”的基礎(chǔ)。

當前華為在貴安、烏蘭察布和蕪湖構(gòu)建了三個大型數(shù)據(jù)中心,“構(gòu)建滿足全國AI算力的云服務(wù)”。用戶“可以獲得百卡、千卡,甚至更多的AI資源”,“在訓(xùn)練大模型的長期穩(wěn)定性和故障恢復(fù)方面有極大優(yōu)勢”。“當前適配了行業(yè)主流的100+大模型。”張平安說,合作企業(yè)已經(jīng)有了600+。
此外華為云CTO張宇昕表示,華為云也在華北、華東、華南等熱點區(qū)域部署了AI算力資源池;“還通過華為云CloudLake,和CloudPond邊緣云平臺,將AI算力推到客戶身邊。”“由此打造了云-網(wǎng)-邊-端協(xié)同的AI native算力平臺。”所謂的AI native,要求云的架構(gòu)能夠真正為AI服務(wù),讓AI更高效。

為了實現(xiàn)云的AI native,華為云打造了CloudMatrix:通過高速互聯(lián)的網(wǎng)絡(luò)協(xié)議,將CPU、NPU、內(nèi)存等資源全部互聯(lián)和池化,實現(xiàn)所謂的“矩陣算力”,是“分布式全對等架構(gòu)”,而非傳統(tǒng)的CPU為中心的主從架構(gòu)。張宇昕強調(diào)說,華為云是目前唯一采用“對等架構(gòu)超節(jié)點技術(shù)”的云廠商。
在解決方案上并沒有說得很具體,不過張宇昕表示“華為云超節(jié)點相比業(yè)界單節(jié)點算力提升50倍;大模型的E2E恢復(fù)時長低于10分鐘;萬卡集群線性度>95%”;最終實現(xiàn)了相比傳統(tǒng)集群架構(gòu),相同算力條件下“模型訓(xùn)練效率提升68%”。這些數(shù)據(jù)看起來都相當驚人。
達成這這些指標的其中一個關(guān)鍵技術(shù),是EMS(Elastic Memory Service)彈性內(nèi)存存儲,用于緩解存儲墻問題。

具體是在NPU顯存(本文的“顯存”均指AI加速卡的存儲資源)和持久化內(nèi)存之間,增加EMS彈性內(nèi)存存儲。“基于memory pooling(內(nèi)存池化)專利技術(shù),通過顯存擴展、算力卸載、以存代算,來打破內(nèi)存墻”。
有關(guān)“內(nèi)存擴展”,是指將模型參數(shù)是分層存儲在顯存和EMS中,“使用不到一半的NPU卡,就存下萬億參數(shù)的大模型,算力節(jié)省超過50%”;
“算力卸載”,則是將KV計算(應(yīng)該是指key-value數(shù)據(jù)結(jié)構(gòu)計算與caching)offload到EMS和CPU上,模型計算仍然在顯存與NPU上進行,提升單卡并發(fā)度,“AI推理性能提升100%”;“以存代算”是指將歷史KV計算結(jié)果保存在EMS中,供后續(xù)推理直接調(diào)用—— “首token的時延降到0.2秒以內(nèi)。
盤古5.0的3個技術(shù)點
盤古大模型5.0就是基于這樣的華為云AI平臺開發(fā)的,盤古5.0也因此具備了幾個關(guān)鍵的“黑科技”。除了前文已經(jīng)介紹的能力升級實現(xiàn)更多模態(tài)、更強思維以外,姚駿主要從數(shù)據(jù)、參數(shù)、算力方面,介紹了盤古5.0的3個技術(shù)點。

首先, “向科學使用數(shù)據(jù)的方向演進”。 “合成數(shù)據(jù)(synthetic data)會在更大規(guī)模的模型訓(xùn)練中占有一席之地,彌補高質(zhì)量自然數(shù)據(jù)增長不足的空缺”,從盤古3.0的3T token數(shù)據(jù)量,到盤古5.0的10T token數(shù)據(jù)量,“其中合成數(shù)據(jù)占比超過30%”。
“我們探索面向高階能力的數(shù)據(jù)合成方法。”具體是“以弱模型輔助強模型的weak2strong方法,迭代式地合成高質(zhì)量數(shù)據(jù)。”結(jié)果合成數(shù)據(jù)質(zhì)量“各個維度都略強于真實數(shù)據(jù)”。且weak2strong技術(shù)能夠加強一些特定數(shù)據(jù),“例如自然數(shù)據(jù)中偏少的長序列、復(fù)雜知識推理等數(shù)據(jù)”,以此加強模型特定的能力。
此外,在“數(shù)據(jù)課程學習”的過程中,采用“階梯式數(shù)據(jù)課程”,先讓大模型學習基礎(chǔ)課程,再逐漸加大復(fù)雜數(shù)據(jù)配比,“從易到難學習知識”,“實現(xiàn)更可控、可預(yù)期的能力提升”。

其次在于“昇騰親和”的Transformer:π架構(gòu)。這部分優(yōu)化應(yīng)該是與昇騰芯片密切相關(guān)的。姚駿表示原始的Transformer模型存在“一定的特征坍塌問題”,“通過理論分析發(fā)現(xiàn),Transformer中的自注意力模塊會激化數(shù)據(jù)中的特征消失”,業(yè)界一般的方法是增加一條殘差連接,以緩解特征坍塌問題。
π架構(gòu)“引入了非線性增廣殘差連接”,“進一步加大不同token的特征,使數(shù)據(jù)特征的多樣性在深度的Transformer中得以維持。”
與此同時,提高Transformer的FFN(Feedforward Network)模塊處理效率。“在π架構(gòu)中,我們改造了FFN中的激活函數(shù),用一種級數(shù)激活函數(shù)的方式來代替,增加了模型的非線性度。雖然增加了FFN的計算量,但也在維持精度的前提下,減小了自注意力模塊的大小,實現(xiàn)昇騰的親和。在昇騰芯片上,推理速度因此提升20-25%”。
有關(guān)π架構(gòu)的相關(guān)研究成果和內(nèi)容,已經(jīng)發(fā)表在了NeurIPS 2023頂會,有興趣的讀者可以去看一看。

第三點是在系統(tǒng)層面,針對超大規(guī)模集群訓(xùn)練的優(yōu)化。姚駿談到,千卡集群訓(xùn)練的bubble(等待時間)一般在10%左右,更大規(guī)模集群訓(xùn)練的bubble可能到30%。多卡通信過程還可能存在“大量路由沖突”,“導(dǎo)致集群整體線性利用率只有80%左右”。
華為云的解決方案是“將大塊的計算和通信,切分成小塊的副本;系統(tǒng)會自動編排多個副本間計算與通信的執(zhí)行順序”,小塊的通信更容易被隱藏在計算中。另外,“還有NP hard問題的自動尋優(yōu)優(yōu)化,正反向流水交織等等關(guān)鍵技術(shù)。”
“還優(yōu)化了大集群的調(diào)度和通信。通過rank table的編排算法,將大流量放到節(jié)點內(nèi)或者同一機柜級的路由下,減少跨路由器的通信”;也“對原端口進行了動態(tài)編排,實現(xiàn)集群通信的路徑完全零沖突”。
這些技術(shù)大概率是華為此前在通信方面的技術(shù)積累具體體現(xiàn),表現(xiàn)的也是當代HPC與AI計算,優(yōu)化性能與效率必須從系統(tǒng)層面下手的基本思路。據(jù)說藉由這些方法能夠“有效隱藏70%以上的通信,bubble從30%降到10%”;MFU(Model FLOPs Utilization)也有比較理想的表現(xiàn)。
盤古模型也在解決華為自己的問題
在張宇昕談的AI native華為云話題中,還有一部分是借助AI技術(shù)實現(xiàn)云平臺的效率提升的,包括對于CodeArts、DataArts、MetaStudio,乃至GaussDB的幫助。
比如說CodeArts作為軟件開發(fā)生產(chǎn)線,讓AI來讀代碼、寫代碼、調(diào)代碼、測代碼——在盤古5.0的加持下,CodeArts的能力“從函數(shù)級升級到項目級”。
還有針對GaussDB高斯數(shù)據(jù)庫,“我們將高斯數(shù)據(jù)庫的產(chǎn)品文檔、專家知識、運維經(jīng)驗等專業(yè)數(shù)據(jù)和大模型結(jié)合,構(gòu)建盤古數(shù)據(jù)庫大模型,實現(xiàn)GaussDB開發(fā)、測試、遷移、運維的全生命周期智能化”。
開發(fā)人員可以直接用自然語言生成SQL腳本,支持多表關(guān)聯(lián)查詢、存儲過程等復(fù)雜的SQL生成;也支持將其他數(shù)據(jù)庫SQL語句轉(zhuǎn)化為GaussDB語法……這部分不是本文要探討的重點,就不做過多贅述了。
不過這些實際上是AI for Cloud,乃至AI for華為全棧技術(shù)的體現(xiàn),很大程度上算得上是華為自己作為盤古5.0用戶的親身實踐了;也是盤古5.0在計算機科學領(lǐng)域的應(yīng)用實例。

在國內(nèi)的AI基礎(chǔ)設(shè)施提供者中,華為大概是為數(shù)不多真正在生態(tài)層面有機會與國際巨頭一戰(zhàn)的市場參與者,尤其表現(xiàn)在兩個關(guān)鍵點:盤古大模型深入到各行各業(yè)并不斷加強能力,以及昇騰服務(wù)器、華為云作為推動華為AI生態(tài)發(fā)展的基礎(chǔ)設(shè)施,從系統(tǒng)層面提供AI訓(xùn)練與推理的性能和效率優(yōu)化。據(jù)說當前華為的AI框架份額超過了20%,遷移并孵化主流大模型50+,孵化的AI場景化方案有200+。
作為我們現(xiàn)在常說第四次工業(yè)革命的轉(zhuǎn)折點,AI賽道上的盤古大模型及周邊相關(guān)層級技術(shù)與基礎(chǔ)設(shè)施的前行,在我們看來其重要性是絕對不亞于鴻蒙操作系統(tǒng)的生態(tài)發(fā)展的。在下一篇文章里,我們將談?wù)劚緦肏DC的另一個主角HarmonyOS Next,尤其是融入其中的AI技術(shù):Harmony Intelligence。