簡單談談十一代酷睿(選讀)
本文選讀部分再花點筆墨,簡單談談移動平臺十一代酷睿。十一代酷睿移動處理器的代號名為Tiger Lake。這代處理器主體上有三個關鍵詞:10nm SuperFin制造工藝、CPU采用Willow Cove架構、GPU核顯是Intel最新的Xe。其他組成部分還包括I/O支持PCIe 4.0、雷電4、LPDDR5,還有升級版的AI能力(Gaussian Neural Accelerator)等。
(1)10nm SuperFin工藝
Intel的10nm SuperFin工藝,仔細算起來應該是Intel的第三代10nm工藝了(也可能是第四代)。如果曇花一現的Cannon Lake不算的話,那么也已經是第二代。初代10nm工藝,此前我撰文詳細介紹過;新一代的10nm SuperFin應該算是Intel 10nm工藝的真正成熟版。

一個重要的依據是,十代酷睿(Ice Lake)雖然IPC有著15%-20%的提升,意即同頻性能相比再上一代酷睿(Whiskey Lake)有15%-20%的提升。但十代酷睿的頻率(主頻與睿頻)卻降了10%-20%,大約在4.2GHz左右,故IPC性能提升就被抵消了,雖然理論上會更省電。十代酷睿頻率降低,很大程度上與當時的10nm尚不成熟有關。
Tiger Lake的CPU就再次回到了5.0GHz的水平,這表明10nm SuperFin起碼應付高頻率已經沒問題了。不過其產能可能仍是問題,畢竟很快要發布的桌面版十一代酷睿Rocket Lake,仍會延續14nm工藝。有關10nm SuperFin的具體改進,我會在后續的文章中詳細介紹。本文主要來談談Willow Cove架構和Xe核顯。
(2)Willow Cove處理器核心
Willow Cove也就是目前十一代酷睿移動版處理器的CPU架構。Intel宣稱,Willow Cove比上一代(Sunny Cove,十代酷睿)的性能提升了10%-20%。事實上,Willow Cove和Sunny Cove的微架構設計基本上差不多,包括分支預測器、解碼、ROB、TLB、后端執行、load/store等。這兩者的差異,除了10nm SuperFin工藝帶來更高的頻率(以及可能同頻更省電),還包括:L2、L3 cache更大,以及CET(控制流強制技術)。
Willow Cove的最重要微架構變化,應該主要來自cache架構調整。其中Sunny Cove的L2 cache為包含式512KB 8-way,而Willow Cove的L2 cache變成了非包含式1.25MB 20-way。cache size的提升,是能夠顯著提升緩存命中率的。當然尺寸加大,也會增加訪問時延。

包含式(inclusive)的意思,就是指L1 cache中的每一行內容,在L2 cache中都有相同的一份。而非包含式就是兩級cache沒有這種關系,不過也因此實現緩存一致性原則就需要有額外的晶體管實施,也就需要額外的芯片面積,并可能帶來一定的功耗影響。
這一代CPU的L3 cache部分提升到了12MB,增大了50%;只不過關聯性從16-way 8MB變成了12-way 12MB。L2、L3 cache的這種調整應該能夠帶來IPC的小幅提升,功耗、面積的提升則可能會因10nm SuperFin的工藝改進而填平。
除了Cache變化,Willow Cove的另一個加強就是CET(Control-Flow Enforcement Technology,控制流強制技術)。這屬于處理器安全方面的調整,用于抵御返回、跳轉式的惡意攻擊,通過page追蹤實現返回地址保護;還有Indirect Branch Tracking(間接分支追蹤)來抵御錯誤的跳轉/調用目標。
CPU外圍還有一些變化,主要是存儲子系統——如前文所述開始支持LPDDR5-5400。不過現有主流實施普遍都是DDR4-3200、LPDDR4X-4266,也就是內存帶寬有提升。而且Tiger Lake整個芯片上開始采用雙向的雙ring互聯,這對內存敏感型應用場景應該也是有價值的。
(3)Xe GPU核顯
十代酷睿的Gen11核顯相比Intel此前的處理器,在性能上實則已經有個顯著飛越了。無奈市面上的競爭對手都越來越彪悍,所以十一代酷睿的Xe-LP架構核顯更上了一層樓。如果不考慮系統設計中內存帶寬的限制,Xe可以說是目前性能最強悍的核顯(可能需要排除蘋果M1)。Xe-LP同等電壓下可以達到遠高于上一代Gen11核顯的頻率,這和10nm SuperFin工藝當然也是分不開的。

有關Xe的詳情,未來我也有計劃獨立撰文。Xe是Intel 2018年宣布的一種GPU架構產品,大方向包括3種不同的微架構,Xe-LP(集成和入門級獨立GPU)、Xe-HP(狂熱愛好者、數據中心)和Xe-HPC(HPC集群)。所以移動版十一代酷睿集成的就是Xe-LP GPU。
原本十代酷睿的Gen11核顯包含了64個EU(執行單元)。每個EU有2組4-wide ALU,其中一組面向FP/INT,另一組針對FP/Extended Math型計算。Xe-LP架構中,每個EU現有10個ALU(8+2),其中8個ALU支持2xINT16和INT32數據類型運算,有個新的DP4a指令可加速INT8 inference工作。Tiger Lake的Xe-LP GPU總共有96個EU。
Xe-LP的每2個EU共享一個單線程的控制模塊,可做合作任務的分派。16個EU構成一個所謂的subslice,根據性能需求,這些subslice可按需增加。與上一代的差別在于,每個subslice都有獨立的L1數據和紋理cache,像素后端每2個subslice每周期跑8個像素。另外Xe-LP有獨立的16MB L3 cache,連接到memory fabric的接口部分帶寬翻倍。

從實際情況來看,Tiger Lake之上的Xe算力表現靠譜,不過會較大程度受制于數據傳輸帶寬。從現有十一代酷睿超級本的實際游戲體驗,與跑分的差異能夠看得出來——所以Xe應用于Tiger Lake感覺略有些匆忙。這個問題理論上會在十二代酷睿Alder Lake上得到解決(更高的內存頻率)。
有關Xe核顯另外值得一提的是,它開始正式支持AV1解碼加速,其他一些流行的codec也有編解碼帶寬的翻倍,即硬解8K 60fps支持,“12bit端到端視頻管線”。而在顯示支持部分,Tiger Lake擴展至4條4K顯示管線:Display Port 1.4、HDMI 2.0、雷電4、USB 4 Type-C四輸出同時到位。
所以前文中提到Intel嘲諷M1在顯示輸出方面的表現局限。另外顯示引擎也支持HDR10、12bit BT2020色彩、最高360Hz刷新率和自適應同步。
有關Intel的10nm SuperFin工藝,以及Xe核顯更多技術方面的內容更新,可關注我的面包板。我會將這些內容更新在面包板博客上。
責編:Luffy Liu
- 產品論合格,不說好壞。合格有標準,好壞沒有度。
- 產品論合格,不說好壞。