針對(duì)5G蜂窩和機(jī)器學(xué)習(xí)DNN/CNN等計(jì)算密集型應(yīng)用,賽靈思的新型矢量處理器AI引擎由VLIW SIMD高性能處理器陣列構(gòu)成,與傳統(tǒng)的可編程邏輯解決方案相比,功耗減半,芯片計(jì)算密度提升高達(dá)8 倍。

概要

本白皮書(shū)探討了將賽靈思新型AI引擎用于5G蜂窩和機(jī)器學(xué)習(xí)DNN/CNN等計(jì)算密集型應(yīng)用的架構(gòu)、應(yīng)用和優(yōu)勢(shì)。

在與過(guò)去數(shù)代技術(shù)進(jìn)行比較時(shí),5G要求將計(jì)算密度提高5倍到10倍;AI引擎已針對(duì)DSP進(jìn)行優(yōu)化,同時(shí)滿足吞吐量和計(jì)算要求,為無(wú)線連接提供高帶寬和速度提升。

機(jī)器學(xué)習(xí)在眾多產(chǎn)品中方興未艾,特別是在DNN/CNN網(wǎng)絡(luò)中。這大幅提升了對(duì)計(jì)算密度的要求。AI引擎專為線性代數(shù)優(yōu)化,提供可滿足這些需求的計(jì)算密度,并且與可編程邏輯上運(yùn)行的類似功能相比,還能降低功耗高達(dá) 50%。

AI 引擎采用眾多程序員熟悉的C/C++ 語(yǔ)言編程。AI引擎與賽靈思自適應(yīng)標(biāo)量引擎集成,旨在提供高度靈活、功能強(qiáng)大的整體解決方案。

賽靈思悠久的計(jì)算技術(shù)發(fā)展史

賽靈思產(chǎn)品用于計(jì)算密集型應(yīng)用已有數(shù)十年的歷史,最早可追溯到上世紀(jì) 90 年代早期的高性能計(jì)算 (HPC) 和數(shù)字信號(hào)處理 (DSP) 實(shí)現(xiàn)方案。賽靈思 XC4000 系列 FPGA 已經(jīng)成為了商用、航空航天與國(guó)防無(wú)線通信系統(tǒng)實(shí)施數(shù)字前端 (DFE) 解決方案的實(shí)現(xiàn)技術(shù)。這些早期用戶使用 LUT 和加法器實(shí)現(xiàn)計(jì)算單元(如乘法器),構(gòu)建 DSP 功能、FIR 濾波器和 FFT。

隨著客戶開(kāi)始選擇使用賽靈思器件來(lái)處理要求嚴(yán)格的新型計(jì)算應(yīng)用,首個(gè)“DSP 片”這樣的計(jì)算密集型專用單元,跟隨 2001 年 Virtex®-II 系列 FPGA 的問(wèn)世被開(kāi)發(fā)出來(lái)。根據(jù)摩爾定律,賽靈思已經(jīng)將 LUT 的數(shù)量從 XC4000 FPGA 中的僅 400 個(gè)提升到當(dāng)前器件中的超過(guò) 370 萬(wàn)個(gè) LUT 和超過(guò) 12,200  個(gè) DSP 片,

可用資源的增加超過(guò) 9,500 倍。在這樣的計(jì)算資源加速增長(zhǎng)的推動(dòng)下,賽靈思產(chǎn)品始終能為信號(hào)處理市場(chǎng)的最新發(fā)展提供所需的計(jì)算密度和邏輯資源。

技術(shù)進(jìn)步推高計(jì)算密度

多項(xiàng)技術(shù)的發(fā)展正在促使對(duì)更高非線性計(jì)算密度的需求。每秒千兆赫采樣率的數(shù)據(jù)轉(zhuǎn)換器能直接采樣 RF 信號(hào),簡(jiǎn)化模擬系統(tǒng),但需要相應(yīng)數(shù)量級(jí)的更高的 DSP 計(jì)算密度。直接 RF 采樣與使用多個(gè)天線相結(jié)合,例如擁有數(shù)萬(wàn)個(gè)天線的先進(jìn)雷達(dá)系統(tǒng)。

熱門(mén)的 5G 無(wú)線技術(shù)已醞釀數(shù)年。該技術(shù)有望通過(guò)將環(huán)境里的一切事物連接到一個(gè)網(wǎng)絡(luò)改變?nèi)藗兊纳睿哼@個(gè)網(wǎng)絡(luò),速度比蜂窩連接快100倍,比最快的家用寬帶服務(wù)快 10 倍,。毫米波、大規(guī)模 MIMO、全雙工、波束成型和小蜂窩只是實(shí)現(xiàn)超高速 5G 網(wǎng)絡(luò)的部分技術(shù)。速度與低時(shí)延是 5G 的兩大優(yōu)勢(shì),從自動(dòng)駕駛汽車(chē)到虛擬現(xiàn)實(shí),擁有廣闊的新應(yīng)用空間。這些技術(shù)帶來(lái)的計(jì)算密度要求和存儲(chǔ)器要求比 4G 高出整整一個(gè)數(shù)量級(jí)。

隨著 5G 技術(shù)的發(fā)展,大規(guī)模 MIMO、多天線、多頻帶等新技術(shù)所導(dǎo)致的復(fù)雜性比 4G 高百倍。不斷提高的復(fù)雜性直接推高計(jì)算密度、存儲(chǔ)器要求和 RF 數(shù)據(jù)轉(zhuǎn)換器性能。參見(jiàn)圖 1。

圖 1:5G 與 4G 復(fù)雜性比較1

1. ETRI RWS-150029,5G 視覺(jué)與實(shí)現(xiàn)技術(shù):ETRI 視角,3GPP RAN 研討會(huì),鳳凰城,2015 年 12 月:http://www.3gpp.org/ftp/tsg_ran/TSG_RAN/TSGR_70/Docs

摩爾定律的終結(jié)

1965 年,英特爾聯(lián)合創(chuàng)始人戈登摩爾預(yù)言,集成電路中的器件數(shù)量每?jī)赡陮⒎环?965 年,每芯片 50 個(gè)晶體管能提供最低的每晶體管成本。摩爾預(yù)言,到 1970 年每芯片晶體管數(shù)量將達(dá) 1,000 個(gè)且每晶體管成本將下降 90% 以上。摩爾后來(lái)把這一預(yù)言調(diào)整為數(shù)量每?jī)赡攴环_@在從 1975 年到 2012 年的時(shí)間段里基本保持正確。(1)摩爾定律認(rèn)為每個(gè)新的更小的工藝節(jié)點(diǎn)能提供更高密度、性能并降低功耗、成本。這一觀點(diǎn)被稱為“摩爾定律”,并在大約 50 年的時(shí)間里一直適用。摩爾定律原理是 IC 密度、性能和合理價(jià)格不斷發(fā)展的驅(qū)動(dòng)力,也是賽靈思不斷推出更低成本更高性能器件所一直遵循的原理,。

隨著 IC 工藝節(jié)點(diǎn)達(dá)到 28nm 及以下,摩爾定律開(kāi)始“失效”。在更小工藝節(jié)點(diǎn)上生產(chǎn)的器件不再能輕松降低功耗、成本并提高性能。在 5G 蜂窩系統(tǒng)的計(jì)算需求和可編程邏輯計(jì)算密度之間出現(xiàn)了鴻溝。第 5 代蜂窩提出的成本、功耗和性能要求超過(guò)了可編程邏輯達(dá)成系統(tǒng)級(jí)目標(biāo)的能力。

迎來(lái) AI 引擎

為滿足新一代無(wú)線通信應(yīng)用和機(jī)器學(xué)習(xí)應(yīng)用對(duì)提高計(jì)算密度、降低功耗水平的需求的迅猛增長(zhǎng),賽靈思開(kāi)始研發(fā)創(chuàng)新型架構(gòu),最終開(kāi)發(fā)出 AI 引擎。AI 引擎結(jié)合自適應(yīng)引擎(可編程邏輯)和標(biāo)量引擎(處理器子系統(tǒng)),構(gòu)成緊密集成的異構(gòu)計(jì)算平臺(tái)。AI 引擎為基于矢量的算法帶來(lái)了高達(dá)五倍的計(jì)算密度提升。自適應(yīng)引擎提供靈活的定制計(jì)算和數(shù)據(jù)傳輸。標(biāo)量引擎提供復(fù)雜的軟件支持。

圖 2:異構(gòu)計(jì)算

圖3所示的是AI 引擎接口塊構(gòu)成的2D陣列。

圖3:AI 引擎陣列

每個(gè) AI 引擎塊內(nèi)置了用于定點(diǎn)和浮點(diǎn)運(yùn)算的矢量處理器、一個(gè)標(biāo)量處理器、專用程序和數(shù)據(jù)存儲(chǔ)器、專用 AXI 數(shù)據(jù)傳輸通道以及對(duì) DMA 和鎖的支持。AI 引擎是一種單指令多數(shù)據(jù) (SIMD);并且是 超長(zhǎng)指令字 (VLIW),每時(shí)鐘周期提供多達(dá) 6 路指令并行化,包括兩個(gè)/三個(gè)標(biāo)量運(yùn)算、兩個(gè)矢量載荷和一個(gè)寫(xiě)入運(yùn)算以及一個(gè)定點(diǎn)或浮點(diǎn)矢量運(yùn)算。

專為實(shí)時(shí) DSP 和 AI/ML 計(jì)算優(yōu)化的AI 引擎陣列,通過(guò)專用數(shù)據(jù)和指令存儲(chǔ)器、DMA、鎖和軟件工具的結(jié)合提供確定性時(shí)序。專用數(shù)據(jù)存儲(chǔ)器和指令存儲(chǔ)器屬于靜態(tài)存儲(chǔ)器,能消除高速緩存缺失和相關(guān)填充產(chǎn)生的不一致。

AI引擎的目的和目標(biāo)

AI 引擎的目的和目標(biāo)由使用 DSP 和 AI/ML 的高計(jì)算強(qiáng)度應(yīng)用決定。其他的市場(chǎng)需求還包括更高的開(kāi)發(fā)者生產(chǎn)力、更高的抽象水平,這正在推動(dòng)開(kāi)發(fā)工具的演進(jìn)發(fā)展。AI 引擎的開(kāi)發(fā)旨在提供四大優(yōu)勢(shì):

• 在實(shí)現(xiàn)計(jì)算密集型應(yīng)用方面,與 PL 實(shí)現(xiàn)方案相比提供單位芯片面積多三到八倍的計(jì)算容量

• 與實(shí)現(xiàn)在 PL 中的相同功能相比,將計(jì)算密集型應(yīng)用的功耗減少 50%

• 提供確定性、高性能、實(shí)時(shí) DSP 功能

• 顯著改善開(kāi)發(fā)環(huán)境,助力設(shè)計(jì)人員提高生產(chǎn)力

AI引擎塊架構(gòu)詳解

要真正理解AI引擎的大量功能,必須對(duì)其架構(gòu)和功能建立整體理解。圖 4 所示的 AI 引擎塊詳細(xì)體現(xiàn)了每個(gè)塊里的資源:

• 專用的16KB 指令存儲(chǔ)器和 32KB RAM

• 32位RISC 標(biāo)量處理器

• 512 位定點(diǎn)和 512 位浮點(diǎn)矢量處理器(帶有相關(guān)的矢量寄存器)

• 同步處理器

• 追溯與調(diào)試

圖4:AI引擎塊詳解

綜合使用專用 AXI 總線布線和直接連接,連接到相鄰的 AI 引擎塊,內(nèi)置指令和數(shù)據(jù)專用存儲(chǔ)器的 AI 引擎與其他 AI 引擎塊互聯(lián)。在數(shù)據(jù)傳輸方面,專用 DMA 引擎和鎖直接連接到專用 AXI 總線,實(shí)現(xiàn)連接、數(shù)據(jù)傳輸和同步。

操作數(shù)精度支持

矢量處理器由整數(shù)單元和浮點(diǎn)單元構(gòu)成。支持 8 位、16 位、32 位操作數(shù)和單精度浮點(diǎn) (SPFP)。對(duì)于不同的操作數(shù),每時(shí)鐘周期操作數(shù)數(shù)量有變化,詳見(jiàn)表 1。

表 1:AI 引擎矢量精度支持

指令與數(shù)據(jù)并行

通過(guò)指令級(jí)和數(shù)據(jù)級(jí)并行能實(shí)現(xiàn)多種層次的并行。

指令級(jí)并行如圖 5 所示。在每個(gè)時(shí)鐘周期,執(zhí)行兩個(gè)標(biāo)量指令、兩個(gè)矢量讀取、一個(gè)單矢量寫(xiě)入和一個(gè)單矢量指令,即 6 路 VLIW。

圖5:AI指令級(jí)并行

數(shù)據(jù)級(jí)并行通過(guò)矢量級(jí)并行實(shí)現(xiàn),即在每個(gè)時(shí)鐘周期內(nèi)運(yùn)算多個(gè)數(shù)據(jù)集,如表 1 所示。

確定性性能與連接

AI 引擎架構(gòu)專為要求確定性性能的實(shí)時(shí)處理應(yīng)用開(kāi)發(fā)。確保確定性時(shí)序的兩項(xiàng)關(guān)鍵架構(gòu)特性是:

• 專用指令和數(shù)據(jù)存儲(chǔ)器

• 與 DMA 引擎配對(duì)的專用連接,使用 AI 引擎塊間的連接實(shí)現(xiàn)有調(diào)度的數(shù)據(jù)傳輸

直接存儲(chǔ)器 (DM) 接口提供指定 AI 引擎塊與其北、南和西向 AI 引擎塊數(shù)據(jù)存儲(chǔ)器之間的直接訪問(wèn)。這一般用于在整個(gè)處理鏈產(chǎn)生和/或消費(fèi)數(shù)據(jù)之際,向矢量處理器輸入/從矢量處理器輸出結(jié)果。實(shí)現(xiàn)數(shù)據(jù)存儲(chǔ)器的目的是形成“交替”緩存方案,從而最大限度減輕存儲(chǔ)器爭(zhēng)用對(duì)性能的影響。

AI 引擎塊間的 AXI-Stream 和 AXI-存儲(chǔ)器映射連接

AI 引擎塊間的數(shù)據(jù)傳輸?shù)淖詈?jiǎn)方式是通過(guò)直接相鄰的 AI 引擎塊間的共享存儲(chǔ)器。然而,如果 AI 引擎塊間距離遙遠(yuǎn),那么 AI 引擎塊就需要使用 AXI-Streaming 數(shù)據(jù)流。AXI-Streaming 連接由 AI 引擎編譯器工具根據(jù)數(shù)據(jù)流圖預(yù)先定義并編程。此外,這些流接口也能用來(lái)直接接口連接 PL 和片上網(wǎng)絡(luò) (NoC)。參見(jiàn)圖 6。

圖6:AI 引擎陣列 AXI-MM 和 AXI-Stream 互聯(lián)

AI引擎和PL連接

Versal 產(chǎn)品組合最突出的優(yōu)勢(shì)之一,是能夠在自適應(yīng)引擎中將 AI 引擎陣列與可編程邏輯結(jié)合使用。這樣的資源結(jié)合為在最佳資源、AI 引擎、自適應(yīng)引擎或標(biāo)量引擎中實(shí)現(xiàn)功能提供了極大的靈活性。圖 7 所示的是 AI 引擎陣列和可編程邏輯間的連接,也稱為“AI 引擎陣列接口”。AXI-Streaming 連接存在于 AI 引擎陣列接口的每一側(cè),并分別延伸連接至可編程邏輯和 NoC 內(nèi)。

圖7:AI引擎陣列接口

AI引擎控制、調(diào)試與追溯

控制、調(diào)試與追溯功能集成在每一個(gè) AI 引擎塊里,為調(diào)試、性能監(jiān)控和性能優(yōu)化提供可見(jiàn)性。通過(guò)在 Versal 產(chǎn)品組合中推出的高速調(diào)試端口就能調(diào)用調(diào)試功能。

AI 引擎與可編程邏輯實(shí)現(xiàn)方案對(duì)比

AI 引擎的目的和目標(biāo)一節(jié)介紹了評(píng)估是否滿足應(yīng)用需求和市場(chǎng)需求的指標(biāo)。通過(guò)將 4G 和 5G 蜂窩分別實(shí)現(xiàn)在 PL 和 AI 引擎內(nèi),即可衡量該架構(gòu)的效果。結(jié)果總結(jié)說(shuō)明基于 AI 引擎的解決方案能夠提供:

• 相對(duì)于在相同工藝節(jié)點(diǎn)上采用 PL 實(shí)現(xiàn)的相同功能,芯片占用面積降低 3 到 8 倍

• 功耗與 PL 實(shí)現(xiàn)方案相比降低大約 50%

對(duì)于不適合采用矢量實(shí)現(xiàn)的功能,AI 引擎的效率大幅降低,AI 引擎往往并非是理想選擇。在這些情況下,PL 是更優(yōu)秀的解決方案。AI 引擎和 PL 旨在當(dāng)作對(duì)等計(jì)算單元進(jìn)行使用,每個(gè)分別處理與其優(yōu)勢(shì)相匹配的功能。PL 非常適合數(shù)據(jù)傳輸、數(shù)位型功能和非矢量型運(yùn)算;PL 也能為非 AI 引擎支持的操作實(shí)現(xiàn)定制加速器。PL 和 AI 引擎相輔相成,構(gòu)成更強(qiáng)大的系統(tǒng)級(jí)解決方案。在大多數(shù)計(jì)算密集型應(yīng)用中,可編程邏輯仍然是一種非常寶貴的資源。AI 引擎與 PL 的結(jié)合,能提供靈活性、優(yōu)異的計(jì)算性能、高帶寬數(shù)據(jù)傳輸和存儲(chǔ)。

配備 AI 引擎架構(gòu)的 Versal 產(chǎn)品組合概述

Versal 器件包括三種類型的可編程處理器:Arm® 處理器子系統(tǒng) (PS)、可編程邏輯 (PL) 和 AI 引擎。每一種都提供不同的計(jì)算功能,以滿足總體系統(tǒng)不同部分的需求。Arm 處理器一般用于控制平面應(yīng)用、

操作系統(tǒng)、通信接口和較低級(jí)別的運(yùn)算或復(fù)數(shù)運(yùn)算。PL 負(fù)責(zé)數(shù)據(jù)操作與傳輸、非矢量型計(jì)算和接口。AI 引擎一般用于矢量實(shí)現(xiàn)方案中的計(jì)算密集型功能。

圖 8 是 AI 引擎陣列布局在器件頂層的 Versal 器件的高級(jí)視圖。AI 引擎陣列與 PL 之間的連接通過(guò)直接連接和 NoC 實(shí)現(xiàn)。

 

圖 8:配備 AI 引擎架構(gòu)的 Versal ACAP 概略圖

AI引擎開(kāi)發(fā)環(huán)境

近年來(lái),賽靈思高度重視使用高層次語(yǔ)言 (HLL) 來(lái)提升使用賽靈思器件進(jìn)行開(kāi)發(fā)的抽象水平。Versal 架構(gòu)擁有三個(gè)完全不同的可編程單元:PL、PS 和 AI 引擎。所有三個(gè)單元都可以使用 C/C++ 編程。

使用基于 x86 的仿真環(huán)境,能對(duì) AI 引擎開(kāi)展功能仿真或周期精度仿真。對(duì)于系統(tǒng)級(jí)仿真,提供支持全部三種處理域的 System-C 虛擬平臺(tái)。

開(kāi)發(fā)環(huán)境中的一個(gè)關(guān)鍵元素是 AI 引擎庫(kù)。該庫(kù)能夠?yàn)?DSP 和無(wú)線功能、ML 和 AI、線性代數(shù)和矩陣數(shù)學(xué)提供支持。這些庫(kù)專為效率和性能進(jìn)行優(yōu)化,以便開(kāi)發(fā)者充分發(fā)揮 AI 引擎功能的全部?jī)?yōu)勢(shì)。

AI 引擎應(yīng)用

AI 引擎專門(mén)為計(jì)算密集型應(yīng)用優(yōu)化,特別是數(shù)字信號(hào)處理 (DSP) 和某些人工智能 (AI) 技術(shù),如機(jī)器學(xué)習(xí) (ML) 和 5G 無(wú)線應(yīng)用。

使用 AI 引擎開(kāi)展數(shù)字信號(hào)處理

無(wú)線電解決方案驗(yàn)證套件

實(shí)時(shí) DSP 在無(wú)線通信中得到了廣泛的應(yīng)用。賽靈思通過(guò)比較經(jīng)典窄帶和寬帶無(wú)線電設(shè)計(jì)原則、大規(guī)模 MIMO 以及基帶和數(shù)字前端概念的實(shí)現(xiàn)方案,證明 AI 引擎架構(gòu)適用于構(gòu)建無(wú)線電解決方案。

示例:100MHz 五通道 LTE20 無(wú)線解決方案

100MHz 五通道 LTE20 無(wú)線解決方案在 Versal 器件的組成部分中得到實(shí)現(xiàn)。五個(gè)通道的 16 位輸入數(shù)據(jù)以 30.72MSPS 的速率傳輸并在 89 抽頭通道濾波器中進(jìn)行處理。信號(hào)接著使用兩級(jí)半帶濾波器(23 抽頭和 11 抽頭)四倍升頻采樣,得到 122.88MSPS 的采樣速率。

升頻采樣后的流接著與直接數(shù)字綜合 (DDS) 正弦/余弦波函數(shù)混合并求和。另外兩個(gè)半帶濾波器(47 抽頭和 27 抽頭)提供總共四倍采樣,為峰值因數(shù)衰減 (CFR) 函數(shù)產(chǎn)生 491.52MSPS 輸入流。41 抽頭濾波器提供分?jǐn)?shù)比率改變、五倍升頻/四倍降頻,為數(shù)字預(yù)失真函數(shù) (DPD) 產(chǎn)生 614.4MSPS 輸入采樣率。

峰值檢測(cè)器/比例尺發(fā)現(xiàn) (PD/SF) 電路在 PL 中實(shí)現(xiàn)。491.52MSPS DUC 和混合器級(jí)的輸出構(gòu)成其輸入之一,CFR 第二級(jí)為其提供第二個(gè)輸入。PD/SF 電路如果實(shí)現(xiàn)在 PL 中,則資源效率高;相反,如果實(shí)現(xiàn)在 AI 引擎里,則資源效率低。這充分體現(xiàn)出如何制定架構(gòu)決策,以針對(duì)設(shè)計(jì)的不同功能模塊最高效地運(yùn)用資源。參見(jiàn)圖 9。

圖9:原理圖采用DSP的100MHz五通道LTE20無(wú)線解決方案

DPD 功能需要周期性地重新計(jì)算系數(shù)。使用模數(shù)轉(zhuǎn)換器 (ADC) 從傳輸數(shù)模轉(zhuǎn)換器 (DAC) 的輸出中采樣反饋路徑,并緩存。緩存的樣本數(shù)據(jù)集被傳遞給 PS,用于每秒 10 次計(jì)算新的 DPD 系數(shù)集。新的系數(shù)集使用片上網(wǎng)絡(luò)和 AXI 總線連接寫(xiě)回 DPD。

機(jī)器學(xué)習(xí)與AI引擎

在機(jī)器學(xué)習(xí)中,卷積神經(jīng)網(wǎng)絡(luò) (CNN) 是一類深度前饋人工神經(jīng)網(wǎng)絡(luò),最常用于分析視覺(jué)圖像。隨著計(jì)算機(jī)正在被廣泛用于從自動(dòng)駕駛汽車(chē)到視頻監(jiān)控直至圖像和視頻的數(shù)據(jù)中心分析等萬(wàn)事萬(wàn)物,CNN 已成為必備要素。CNN 提供的技術(shù)突破在于讓視覺(jué)圖像的可靠性和準(zhǔn)確度足以用于安全地駕駛車(chē)輛。

CNN 技術(shù)目前處于初期階段,幾乎每個(gè)星期都有新突破涌現(xiàn)。這個(gè)領(lǐng)域的創(chuàng)新節(jié)奏令人驚嘆。這意味在未來(lái)幾年里就有望實(shí)現(xiàn)前所未有的全新應(yīng)用。

然而,CNN 面臨的挑戰(zhàn)在于所需的高強(qiáng)度計(jì)算,通常需要數(shù) TeraOPS。AI 引擎的優(yōu)化正是為了低成本、高能效地實(shí)現(xiàn)這樣的計(jì)算密度。

AI 引擎 CNN/DNN 疊加

賽靈思正在開(kāi)發(fā)一種在 AI 引擎上構(gòu)建的機(jī)器學(xué)習(xí)推斷引擎,并將作為一種應(yīng)用疊加應(yīng)用。可編程邏輯用于高效地傳輸和管理數(shù)據(jù)。AI 引擎應(yīng)用疊加為執(zhí)行計(jì)算和實(shí)現(xiàn)眾多流行的 CNN/DNN 網(wǎng)絡(luò),如 ResNet、GoogLeNet 以及 AlexNet 等所需的其他運(yùn)算提供所需的界定清晰的結(jié)構(gòu)。

站在用戶角度來(lái)看,疊加方法擁有眾多優(yōu)勢(shì),包括在更加新穎的網(wǎng)格架構(gòu)出現(xiàn)后進(jìn)行修改的能力。AI 引擎和 PL 的可編程結(jié)合提供了一種高效且極為靈活的平臺(tái),能夠隨著 ML 應(yīng)用空間的發(fā)展而成長(zhǎng)和擴(kuò)展。

AI 引擎 CNN/DNN 疊加既適用于加速 ML 網(wǎng)絡(luò)推斷的數(shù)據(jù)中心應(yīng)用,也適用于嵌入式系統(tǒng)。將該解決方案實(shí)例化到用戶的整體設(shè)計(jì)中就能方便地完成集成。隨后使用 TensorFlow 或 Caffe 開(kāi)發(fā) CNN/DNN 神經(jīng)網(wǎng)絡(luò),編譯成在AI引擎CNN/DNN疊加上運(yùn)行的可執(zhí)行程序。

總結(jié)

AI引擎是新一類高性能計(jì)算的代表。AI 引擎集成在Versal 級(jí)別的器件中,能與PL和PS最優(yōu)結(jié)合,在單個(gè)賽靈思ACAP中實(shí)現(xiàn)高度復(fù)雜的系統(tǒng)。實(shí)時(shí)系統(tǒng)需要確定性行為。對(duì)此 AI 引擎通過(guò)結(jié)合專用數(shù)據(jù)和編程存儲(chǔ)器、DMA與鎖以及編譯工具予以實(shí)現(xiàn)。

與傳統(tǒng)的可編程邏輯DSP與 ML實(shí)現(xiàn)方案相比,AI引擎的單位芯片面積計(jì)算密度提高了3-8倍,

同時(shí)在名義上降低功耗50%。C/C++ 編程模式可提高抽象水平,有望大幅提升開(kāi)發(fā)者的生產(chǎn)力。

從內(nèi)置30個(gè)AI引擎和8萬(wàn)LUT的小型器件到內(nèi)置 400個(gè)AI 引擎和近百萬(wàn)個(gè) LUT 的大型器件,系統(tǒng)性能可擴(kuò)展性通過(guò)系列器件得以實(shí)現(xiàn)。這些器件間封裝腳位兼容,方便在產(chǎn)品系列內(nèi)進(jìn)行遷移,以滿足不同的性能目標(biāo)和價(jià)格目標(biāo)要求。

 

閱讀全文,請(qǐng)先
您可能感興趣
“通用處理器”這一術(shù)語(yǔ)一直被廣泛用于描述可運(yùn)行各類軟件工作負(fù)載的CPU。在現(xiàn)代基于Arm架構(gòu)的系統(tǒng)級(jí)芯片(SoC)領(lǐng)域,這一稱謂仍被廣泛使用,但隨著系統(tǒng)復(fù)雜度不斷提升,我們有必要追問(wèn):這類器件在實(shí)際應(yīng)用中,究竟有多“通用”?
隨著AI基礎(chǔ)設(shè)施分化為多層專用架構(gòu),CPU正成為智能體工作負(fù)載的編排層。
本屆WAIC期間,《2026全球AI商業(yè)落地價(jià)值洞察報(bào)告》重磅發(fā)布,并在大會(huì)的兩大高規(guī)格論壇上進(jìn)行了重點(diǎn)展示。作為大會(huì)最受關(guān)注的產(chǎn)業(yè)研究成果之一,這份報(bào)告以“從技術(shù)爆發(fā)到價(jià)值兌現(xiàn)”為主線,系統(tǒng)梳理了全球AI產(chǎn)業(yè)的競(jìng)爭(zhēng)格局與商業(yè)落地路徑。 镕銘微電子憑借在VPU賽道上的開(kāi)創(chuàng)性地位與規(guī)模化商業(yè)落地能力,成功入選該報(bào)告的兩大核心榜單,與全球及國(guó)內(nèi)頂尖科技企業(yè)同臺(tái)亮相。
NVIDIA?已驗(yàn)證?ST?的?12?kW?電源傳輸概念驗(yàn)證板,實(shí)際上已進(jìn)入生產(chǎn)測(cè)試階段。
7月22日,在2026中國(guó)汽車(chē)論壇上,中國(guó)汽車(chē)工業(yè)協(xié)會(huì)副會(huì)長(zhǎng)兼秘書(shū)長(zhǎng)付炳鋒表示,當(dāng)前全球汽車(chē)產(chǎn)業(yè)格局深度調(diào)整,發(fā)展環(huán)境更加復(fù)雜多變,汽車(chē)行業(yè)既面臨低碳新規(guī)、地緣政治帶來(lái)的外部沖擊,也遭受?chē)?guó)內(nèi)競(jìng)爭(zhēng)加劇、
點(diǎn)擊上方藍(lán)字談思實(shí)驗(yàn)室獲取更多汽車(chē)網(wǎng)絡(luò)安全資訊7月23-24日,由AI基礎(chǔ)設(shè)施圈和談思科技主辦、東莞市集成電路行業(yè)協(xié)會(huì)作為支持單位的「CPO Asia 2026 亞洲光電共封裝技術(shù)創(chuàng)新大會(huì)」將在上海盛
點(diǎn)擊上方藍(lán)字談思實(shí)驗(yàn)室獲取更多汽車(chē)網(wǎng)絡(luò)安全資訊7月20日,歐洲汽車(chē)制造巨頭Stellantis集團(tuán)官方宣布人事變動(dòng),任命Matt VanDyke擔(dān)任Ram品牌首席執(zhí)行官,自7月20日起生效;任命Bra
一覽眾咨詢公司專注于汽車(chē)產(chǎn)業(yè)鏈領(lǐng)域的產(chǎn)業(yè)研究、咨詢及品牌推廣。經(jīng)過(guò)多年的發(fā)展,公司在汽車(chē)領(lǐng)域積累較深的行業(yè)經(jīng)驗(yàn)及客戶資源,是該領(lǐng)域?qū)I(yè)權(quán)威的第三方市場(chǎng)研究咨詢機(jī)構(gòu)。一覽眾咨詢公司主要業(yè)務(wù)包括:市場(chǎng)調(diào)研
7月22日,在2026中國(guó)汽車(chē)論壇上,零跑汽車(chē)董事長(zhǎng)、CEO朱江明表示,以增程為代表的插電混動(dòng)技術(shù)不會(huì)終結(jié),未來(lái)5到10年內(nèi),大電量的插電混動(dòng)汽車(chē)在海外市場(chǎng)將是很強(qiáng)勁的產(chǎn)品類型。朱江明指出,這種技術(shù)方
來(lái)源:《中國(guó)半導(dǎo)體濕電子化學(xué)品年度報(bào)告2026》 濕電子化學(xué)品屬于半導(dǎo)體材料中的制造材料,是集成電路產(chǎn)業(yè)發(fā)展所需的“水”和 “空氣”,濕電子化學(xué)品是電子化學(xué)品領(lǐng)域的分支,是集成電路中的關(guān)鍵性
當(dāng)前,AIDC數(shù)據(jù)中心、新能源汽車(chē)、人形機(jī)器人、家電、消費(fèi)電子、儲(chǔ)能等領(lǐng)域正迎來(lái)高速增長(zhǎng)與高質(zhì)量發(fā)展的雙重浪潮,亟須突破性電源轉(zhuǎn)換(電力電子變換)新技術(shù)方案,以破解系統(tǒng)能效提升、功率密度升級(jí)、綜合成本
韓國(guó)無(wú)晶圓廠系統(tǒng)半導(dǎo)體公司Global Technology Co., Ltd.(簡(jiǎn)稱GT)7月21日宣布,已于20日獲得韓國(guó)交易所(KRX)KOSDAQ市場(chǎng)上市預(yù)備審查批準(zhǔn),主承銷(xiāo)商為韓國(guó)投資證券。
 首屆CMP與先進(jìn)封裝材料論壇將于2026年7月29–30日在蘇州召開(kāi)來(lái)自長(zhǎng)電科技、鼎龍、博來(lái)納潤(rùn)、銳杰微、新安納、寧波贏晟、中國(guó)工程物理研究院、SEMI 、江南大學(xué)、蘇州大學(xué)、華東師范、S
插播:2026行家說(shuō)-新世代電源創(chuàng)新技術(shù)研討會(huì)將于8月25日在深圳舉辦,屆時(shí)智光電氣、賽米控丹佛斯、三安半導(dǎo)體、英諾賽科、PI、國(guó)聯(lián)萬(wàn)眾、納芯微、創(chuàng)銳光譜等企業(yè)將發(fā)表最新技術(shù)報(bào)告,覆蓋800V數(shù)據(jù)中心