更多架構(gòu)變化
我們認(rèn)為,這次GPU IP改進(jìn)中的一個(gè)亮點(diǎn)應(yīng)該就是前文多次提到的固件處理器(firmware processor)了(似乎還是RISC-V架構(gòu))。即GPU內(nèi)部有個(gè)小型的微控制器,它位于全局最高層級(jí),完全可編程,以實(shí)現(xiàn)GPU整體任務(wù)執(zhí)行的靈活性。“相關(guān)數(shù)據(jù)流、執(zhí)行、優(yōu)先級(jí)等各種GPU內(nèi)部的活動(dòng),任何事件、任何決策,都通過(guò)固件處理器來(lái)控制和決定。這樣一來(lái)就大大減輕了CPU的工作,而且還更有彈性。”

一般來(lái)說(shuō),GPU的這部分工作是由CPU驅(qū)動(dòng)執(zhí)行的,而Imagination則把這個(gè)活兒攬到了自己手里。這項(xiàng)改進(jìn)似乎在Imagination的宣傳中成效還挺大。典型的就是它能夠應(yīng)用于GPU更好的DVFS調(diào)節(jié)(動(dòng)態(tài)電壓平率調(diào)整)——這項(xiàng)工作原本是由內(nèi)核GPU驅(qū)動(dòng)負(fù)責(zé)的(所以以后驅(qū)動(dòng)更新都是寫(xiě)入到這枚處理器固件中?)。Beets提到:“固件處理器能夠全面感知GPU核心中發(fā)生的一切,這對(duì)于調(diào)度機(jī)制很有幫助,它甚至可以用來(lái)幫助開(kāi)發(fā)者理解,如何獲得GPU的更多性能。”
“如果我們能夠了解GPU的工作調(diào)度、優(yōu)先級(jí),查看所有的參數(shù),那么就能夠知道何時(shí)需要更高的頻率,或者可以在某個(gè)時(shí)間點(diǎn)降低頻率。為此,我們的固件中有大量直接的GPIO信號(hào)回寫(xiě),針對(duì)功耗控制做同步。GPU直接寫(xiě)回給系統(tǒng)到底發(fā)生了什么,這比CPU快多了。這樣一來(lái)就能實(shí)現(xiàn)更出色的DVFS算法,可了解工作負(fù)載甚至預(yù)測(cè)所需的頻率。”
這枚小型處理器,還有一些特別的工作場(chǎng)景,比如說(shuō)“如果GPU執(zhí)行出現(xiàn)問(wèn)題,我們可以通過(guò)固件記錄有關(guān)GPU的信息,快速發(fā)現(xiàn)問(wèn)題在哪里。控制獲取信息,寫(xiě)回到內(nèi)存,給予我們?cè)贕PU真實(shí)應(yīng)用中debug的能力,而不是通過(guò)仿真去進(jìn)行。這是分析問(wèn)題非常出色的工具,如果應(yīng)用在汽車(chē)系統(tǒng)中,還能進(jìn)行錯(cuò)誤分析。”

除此之外,A-Series在架構(gòu)層面還有一些比較重要的變化,體現(xiàn)在紋理單元上(Texturing Unit),相關(guān)于將圖像放到屏幕上的。比如說(shuō)L0 cache的位置發(fā)生了變化,新架構(gòu)的位置是在處理與線(xiàn)性過(guò)濾階段之間。原本Rogue架構(gòu)中,包括紋理解壓(texture decompression)、gamma、YUV轉(zhuǎn)換等操作都是在L0 cache之后進(jìn)行的,這樣一來(lái)某些相同的任務(wù)會(huì)被多次重復(fù)執(zhí)行處理。而L0 cache位置調(diào)整后,可儲(chǔ)存處理階段時(shí)候的輸出,數(shù)據(jù)可復(fù)用——多項(xiàng)異性過(guò)濾的時(shí)候,texel不需要再重復(fù)采樣。
還有針對(duì)一些陳年舊算法的改進(jìn),比如說(shuō)各項(xiàng)異性過(guò)濾(anisotropic filtering)以前一直是基于DirectX的——早年Imagination有參與過(guò)桌面GPU市場(chǎng)混戰(zhàn),當(dāng)時(shí)這項(xiàng)特性自然是緊跟微軟的參考算法的。所以這次“我們徹底重構(gòu)了紋理采樣方式”,“現(xiàn)在更加不依賴(lài)于角度(more angel-independent),采樣更少但實(shí)際(各項(xiàng)異性過(guò)濾)質(zhì)量更高。”這種算法的提升,實(shí)質(zhì)也是減少帶寬、增加能效的重要方案。”
此外,Rogue架構(gòu)在合并(blending)操作上用的是shader。更早之前這種操作會(huì)有個(gè)專(zhuān)用單元去執(zhí)行,Beets說(shuō)Rogue采用軟件的方式來(lái)執(zhí)行合并操作雖然具備了很大彈性,而且節(jié)省空間,但這樣一來(lái)系統(tǒng)會(huì)復(fù)雜化。“由于合并操作(shading a blending)越來(lái)越復(fù)雜,我們還是需要額外的指令來(lái)更高效地執(zhí)行合并操作,所以A-Series又回歸了專(zhuān)用合并單元。這樣可以釋放shader周期,減少數(shù)據(jù)搬運(yùn)量。”

最后值得一提的是AI Synergy,實(shí)際也是本次Imagination技術(shù)發(fā)布的重點(diǎn),不過(guò)它的實(shí)質(zhì)是讓A-Series GPU與Imagination的神經(jīng)網(wǎng)絡(luò)專(zhuān)核NX NNA產(chǎn)品做協(xié)同的,在GPU和AI專(zhuān)核之間實(shí)現(xiàn)AI負(fù)載的共享——GPU可以負(fù)責(zé)模型更多可編程層面的工作,NNA則針對(duì)全連接層處理的固定單元做任務(wù)處理。這部分不是我們針對(duì)圖形計(jì)算要探討的重點(diǎn)。
搭建生態(tài)是當(dāng)務(wù)之急
實(shí)際上,還有一些特性是Imagination并沒(méi)有著墨于A-Series的,比如當(dāng)代GPU比較常見(jiàn)提升帶寬效率的framebuffer圖像壓縮技術(shù)。Imagination的壓縮方案名為PVRICv4,不過(guò)這套方案的最新版本實(shí)際已經(jīng)在Series 9產(chǎn)品中得以應(yīng)用。針對(duì)有損與無(wú)損壓縮有單獨(dú)的管線(xiàn)。Beets這次說(shuō)Imagination持續(xù)加強(qiáng)了其HDR壓縮率。
就這些技術(shù)來(lái)看,的確可以認(rèn)為是Imagination近15年來(lái)“最重要的發(fā)布”,它已經(jīng)充分凸顯了Imagination做策略轉(zhuǎn)變的決心,而且至少就Imagination自己的紙面數(shù)據(jù)來(lái)看,在能力上是優(yōu)于競(jìng)爭(zhēng)對(duì)手的。不過(guò)這并不能表明Imagination未來(lái)就可以在GPU市場(chǎng)上輕易獲勝。
開(kāi)發(fā)者生態(tài)此時(shí)變得極其重要,究竟有多少客戶(hù)會(huì)采用A-Series GPU IP?這和生態(tài)的成熟度、市場(chǎng)價(jià)值有很大關(guān)聯(lián)。
針對(duì)開(kāi)發(fā)者軟件部分,Imagination也下了一番功夫,包括跨操作系統(tǒng),對(duì)各種行業(yè)標(biāo)準(zhǔn)API的支持,對(duì)各種游戲引擎的完整支持。

面向開(kāi)發(fā)者的有一項(xiàng)特性值得一提,即如上圖所示,Imagination為開(kāi)發(fā)者構(gòu)建了“heatmap”:“很多開(kāi)發(fā)者都在苦苦進(jìn)行性能優(yōu)化,尤其是圖形計(jì)算方面。或許性能計(jì)數(shù)器(performance counter)會(huì)告訴你ALU限制、紋理限制,但對(duì)你的幫助其實(shí)真的不大,所以我們?cè)黾恿艘粋€(gè)新特性,生成圖形計(jì)算畫(huà)面的熱圖(heatmap),它會(huì)告訴你GPU在屏幕上的某個(gè)tile上面花了多長(zhǎng)時(shí)間做渲染。我們的工具要做到這一點(diǎn)很容易。開(kāi)發(fā)者能夠很方便地搞清楚某些tile的渲染開(kāi)銷(xiāo)很大,花了最多的shader周期、最多的帶寬等等,這樣一來(lái)就能真正幫助開(kāi)發(fā)者獲得性能上的優(yōu)化。”這其中的實(shí)現(xiàn)似乎與硬件上的固件處理器也有關(guān)系。

Evans勾勒了來(lái)年的產(chǎn)品路線(xiàn)圖,2020年是B-Series,2021年C-Series,包括2022年的D-Series,要比今年的A-Series性能提升90%。光線(xiàn)追蹤架構(gòu)也即將到來(lái),“我們也在開(kāi)發(fā)新領(lǐng)域的圖形計(jì)算方案,圍繞光線(xiàn)追蹤(ray tracing),移動(dòng)領(lǐng)域的光線(xiàn)追蹤架構(gòu),作為技術(shù)做授權(quán)方案,未來(lái)我們很快在GPU中引入光線(xiàn)追蹤。”
Imagination當(dāng)前面臨的局勢(shì)并不算很好,尤其是在主流手機(jī)SoC制造商普遍傾向于采用自研GPU IP的情況下。Furian架構(gòu)在推出后就沒(méi)有在市場(chǎng)上激起火花,這可能是A-Series在較快的時(shí)間內(nèi)出現(xiàn)的原因。至少A-Series的確比過(guò)去更理想,也是Imagination很重要的轉(zhuǎn)型之作。
我們?cè)诨顒?dòng)現(xiàn)場(chǎng)看到了Imagination的一些合作伙伴前來(lái)站臺(tái),包括全志科技、睿悅信息、紫光展銳等,看起來(lái)Imagination現(xiàn)如今的重要市場(chǎng)已經(jīng)放到了中國(guó)。尤其在獲得中資背景以后,其中的合作自然水到渠成,也是在當(dāng)前國(guó)際環(huán)境下一個(gè)雙贏的局面。即便如今的手機(jī)市場(chǎng)已經(jīng)不是當(dāng)年Imagination叱咤風(fēng)云的時(shí)代了,行業(yè)如今的發(fā)展重心本來(lái)就在偏移,面向更多應(yīng)用領(lǐng)域的GPU、AI產(chǎn)品卻也充滿(mǎn)機(jī)遇。
更多現(xiàn)場(chǎng)及展品圖集請(qǐng)點(diǎn)擊欣賞
責(zé)編:Luffy Liu