這次Intel Innovation(英特爾on技術創新大會)上,Intel發布的Meteor Lake處理器里面有一個AI推理加速單元:NPU。這東西對PC究竟有什么用?

這次Intel Innovation(英特爾on技術創新大會)上,Intel發布的Meteor Lake處理器里面有一個AI推理加速單元:NPU。這東西對PC究竟有什么用?

這篇文章,我們來聊聊Meteor Lake的NPU(Neural Processing Unit)。此系列文章另外包含Meteor Lake的關鍵技術點介紹,以及Intel 4制造工藝和Foveros封裝技術介紹

其實在代號為Meteor Lake的酷睿Ultra第1代處理器技術要點介紹里,Intel就明確突出了這代PC處理器在SoC tile部分搭載了NPU單元,用于AI本地推理加速。這算是相當符合潮流的設定吧,一方面在于主流PC處理器供應商普遍開始這么做,另一方面則是今年Intel正在宣導對于端側設備而言,AI技術的重大價值。

 

XPU的一個組成部分

其實有關Meteor Lake跑AI的消息,最初是在今年年中就做了預告的。不過當時Intel提的是CPU、GPU、VPU。而且早在Raptor Lake(13代酷睿)時期,Movidius VPU也作為獨立芯片,成為13代酷睿筆記本的可選項。

Intel Innovation(英特爾on技術創新大會)前夕的媒體分享會上,Intel提及的這枚NPU可能就是此前所說的VPU。原因很簡單。Intel在分享會上,再度提到了用Meteor Lake跑Stable Diffusion的例子,用以體現當前Intel XPU的實踐。

這個過程是這樣的:Stable Diffusion本身的網絡結構分成了幾個部分,前端是個文本編碼器——文生圖首先要輸入prompt提示詞,例如“帶著粉色蝴蝶結的可愛小貓”,則提示文字首先要通過CLIP模型轉換到“一個隱藏空間”。

第二步則有兩個Unet參與。Intel解釋說:“Unet網絡結構一個做正向提示詞,一個做負向提示詞,完成所謂擴散的步驟。這個步驟是比較重載的,在Stable Diffusion的整個處理流程中,是計算量較高的步驟。”“重復大概20步,就能得到質量還不錯的圖。”

最后一步“還是在隱藏空間,通過圖像編碼器VAE,還原到像素空間,成為輸出的圖像”。

這樣一套流程,如果都跑在CPU上,Unet+/-迭代20次,大約需要43秒,功耗40W——設定此能效值為單位1。而如果改由GPU來跑,耗時僅需14.5秒,功耗37W。

若將Unet+/-都跑在NPU上(猜測GPU可能參與了編碼器工作),則全流程需要20.7秒——雖然速度相比完全由GPU來跑稍慢,但功耗僅10W,能效達成了7.8倍。另外若考慮讓GPU跑Unet+,NPU跑Unet-,流程耗時更短,但能效會不及第三種方案。

這個例子Intel前幾個月就提過,調度工作由OpenVINO完成,實現在不同處理器上的深度學習部署。可見Meteor Lake上的NPU有可能就是此前宣傳中的VPU了。

基于Intel此前一直在宣導XPU的策略,就端側AI推理這一特性,Intel對于CPU、GPU和NPU的定位分別是下面這樣的:

在Intel看來,做AI推理這活兒,三顆U都得參與:要么分工合作,要么選出最適合自己的工作。上個月我們才剛剛報道過,就生成式AI生態構建上,Intel為讓CPU去跑生成式AI在做的各種工作。

GPU適合高并發、高吞吐需求的AI工作;順帶給一張GPU支持DP4a指令,每個周期執行64次Int8運算的介紹圖(下圖)。從Meteor Lake關鍵技術一文介紹里,應該能預設Meteor Lake核顯的AI性能——畢竟這次的矢量引擎相比上一代還是增加了不少的。

而NPU是個低功耗的AI引擎,用于持續性的AI負載,比如說視頻會議時,需求AI實現眼神矯正、畫面超分或語音降噪之類的工作,則NPU更合適;CPU的特點是響應快,則對于輕量級、低延遲需求的推理工作,就很適用。

 

有關NPU架構

這次媒體分享會上,Intel還是比較罕見地給出了NPU架構的,只是不知道具體規模如何。NPU首先位于SoC tile之上。既然SoC tile又被Intel稱作低功耗島,那么這片區塊的設計必然是沖著低功耗和高能效去的。

NPU這類加速器通常就包括MAC、精度轉換之類。其算力主體部分由兩個Neural Compute Engine(神經計算引擎)構成;這類專注于并行能力的加速器往往都能相對方便地做模塊彈性縮放。

這兩個引擎支持Int8, FP16運算,配有專門的data conversion數據轉換單元,“支持量化網絡的數據類型轉換和融合操作”“支持輸出數據的重新布局”;硬件層面“支持FP精度下的多種激活函數(avtiviation function)”,如ReLU。

MAC陣列用以支持矩陣乘法和卷積運算,“支持最佳數據重用,以降低功耗”,單個引擎算力2048 MAC/周期。每個引擎配一個DSP,用于更多精度數據的支持。

其余部分包括MMU訪問系統內存、DMA直接內存讀取、片內存儲資源(Scrachpad RAM)。針對類似Resnet50網絡達成卷積→ReLU→量化,是個AI加速的標準流程了。

就軟件堆棧部分,比較值得一提的是Intel的NPU驅動符合微軟MCDM框架(Microsoft Compute Device Manager)。則故此,從Windows的資源管理器里,就能直接看到NPU作為一個計算設備存在,包括其負載情況。

據說特別針對XPU的AI Benchmark基準測試工具已經在路上。未來的PC處理器也要開始卷AI推理能力了。

 

AI軟件堆棧與PC上的實際應用

這里再花點篇幅談談Intel于端側AI生態的軟件堆棧。在Windows上做AI應用開發,可選的API算是比較多樣,包括了微軟的WinML,以及更低層級的DirectML;也可以選擇開源的ONNX RT,還有Intel的OpenVINO。

中間層相關的庫,以及驅動程序層具體如圖。談個應用案例,Intel和微軟合作,在偏上層應用層出了個Windows Studio Effects——相當于一個虛擬攝像頭,對原始攝像頭的視頻做AI處理,可用于背景替換、模糊、人臉追蹤等。Windows Studio Effects下層本身是基于OpenVINO的。

對于應用開發者而言,只需要調用Windows Studio Effects,就能直接獲得這些效果。比如像微軟的Teams就是直接調用Windows Studio Effects,那么這些AI特效實現就能跑在NPU上。其軟件棧路徑大致如下:

其他開發者,比如Adobe傾向于選擇DirectML去做各種內容創作的AI實現。Intel說部分視頻分析類、圖像類應用開始大量基于OpenVINO去做了。上面這些,應該能夠給到各位技術愛好者,或開發者以參考;這些也是構建AI生態的重要組成部分。

更多開發生態相關的構成,此前我們談得也挺多了,這里就不再贅述了。但能看得出來,在Meteor Lake加入NPU以后,配合其他XPU,Intel是期望在端側將AI技術真正實現普及的,即便這個生態的建設工作現在還算是早期。

“我們現在有超過100多家合作伙伴在做各種各樣的終端側AI應用,豐富PC用戶的使用體驗。”就CCG業務的生態,主要還是Intel和微軟合作構建。

NPU已經支持的神經網絡和應用包含如下這些:

“我們感覺終端側AI目前的發展還是非常快的。我們借助于Meteor Lake引入XPU的能力,讓產品能夠更好地支撐起整個生態系統;讓開發者將一些AI workload在PC端引入,提升用戶體驗。”

感覺端側NPU的應用命題并不易解,連蘋果做了這么久的NPU,Mac端的AI生態也相當得不豐滿。不過Intel這次考慮構建的AI生態是走開放開源路線的,目前等待的大概是開發者真正能夠基于酷睿處理器資源所做的爆款,并令其足夠成為PC用戶的剛需了。

責編:Illumi
閱讀全文,請先
您可能感興趣
西光貳號01星成功發射,實現“天數天算”技術突破,是中國太空算力布局的重要一步。
與成立僅七年的Precision Innovations不同,Defacto Technologies成立于2003年,總部位于法國格勒諾布爾,是一家在RTL設計領域深耕二十余年的老牌EDA廠商,專注研發自動化SoC設計創建相關軟件。
美國法院批準Anthropic與作家群體達成15億美元和解協議,這起案件可以為AI時代的知識產權保護帶來哪些啟示?
從增長曲線看,數據中心目前占美國總用電量的5.9%,預計到2030年升至約12%,2035年進一步攀升至20%——不到十年時間,占比擴大逾三倍。
AMD與微軟宣布擴大戰略合作范圍,挑戰英偉達在AI基礎設施領域的統治地位。
“Frozen”(凍結)這一代號精準概括了其設計思路:將大模型的部分運算邏輯永久蝕刻在硅片硬件中。
“通用處理器”這一術語一直被廣泛用于描述可運行各類軟件工作負載的CPU。在現代基于Arm架構的系統級芯片(SoC)領域,這一稱謂仍被廣泛使用,但隨著系統復雜度不斷提升,我們有必要追問:這類器件在實際應用中,究竟有多“通用”?
隨著AI基礎設施分化為多層專用架構,CPU正成為智能體工作負載的編排層。
本屆WAIC期間,《2026全球AI商業落地價值洞察報告》重磅發布,并在大會的兩大高規格論壇上進行了重點展示。作為大會最受關注的產業研究成果之一,這份報告以“從技術爆發到價值兌現”為主線,系統梳理了全球AI產業的競爭格局與商業落地路徑。 镕銘微電子憑借在VPU賽道上的開創性地位與規模化商業落地能力,成功入選該報告的兩大核心榜單,與全球及國內頂尖科技企業同臺亮相。
NVIDIA?已驗證?ST?的?12?kW?電源傳輸概念驗證板,實際上已進入生產測試階段。
本文約8,157字,建議收藏閱讀作者 | 魯大師出品 | 汽車電子與軟件前言當前汽車智能化競爭已進入白熱化階段,高階輔助駕駛、智能座艙兩大核心領域,已然成為車企
在5G通信、新能源汽車、人工智能爆發的時代,PCB作為電子產品的 “骨架與神經系統”,正成為剛需中的剛需。2025年PCB工程師崗位需求同比暴漲 53.4%,78%的硬件崗位明確要求掌握PCB設計,懂
一覽眾咨詢公司專注于汽車產業鏈領域的產業研究、咨詢及品牌推廣。經過多年的發展,公司在汽車領域積累較深的行業經驗及客戶資源,是該領域專業權威的第三方市場研究咨詢機構。一覽眾咨詢公司主要業務包括:市場調研
點擊藍字 關注我們SUBSCRIBE to USImage Credits:Google谷歌母公司Alphabet正在自研一款全新服務器芯片,用以提升自研大模型Gemini的運行能效。科技媒
POE, PBE與α-烯烴創新論壇2026將于7月30-31日在江蘇連云港召開。來自萬華化學的領導專家將做演講,介紹“α烯烴產業布局與POE國產化”來自中石油吉林工程的領導專家將做演講,介紹“吉林工程
2026年,AI大模型正將算力需求推向指數級增長。萬卡級集群正向十萬卡邁進,而傳統銅互連在帶寬、延遲和功耗上已逼近物理極限——一臺十萬卡AI集群中,超三成電力并非用于計算,而是消耗在數據傳輸上。“光進
全球產業鏈加速重構,印刷行業步入存量競爭時代,同質化代工、柔性交付壓力持續放大,打通全域數據、落地深度數智化轉型,已成為龍頭企業搶占產業未來賽道的必由之路。 亞洲單體印刷龍頭——利奧集團旗
開關電源波形測量不能只標一個 TP 編號。測量結果由信號節點、參考節點、探頭帶寬與連接環路共同決定;高壓一次側還涉及儀器接地與額定能力。先定義參考和安全邊界,再解釋尖峰、反射與電流波形。調試電源時,最
算筆賬一批十萬的呆料壓在庫存每月倉儲費?資金成本至少5k放半年就虧3萬有料單不知道怎么推廣?芯片超人已經累計服務2.2萬用戶,打折清庫存,最快半天完成交易!找不到,賣不掉,價格還想再好點,都可以來找我
插播:2026行家說-新世代電源創新技術研討會將于8月25日在深圳舉辦,屆時智光電氣、賽米控丹佛斯、三安半導體、英諾賽科、PI、國聯萬眾、納芯微、創銳光譜等企業將發表最新技術報告,覆蓋800V數據中心