
8月?29 日至 9 月?2 日,可編程邏輯領域的頂級會議之一——“現場可編程邏輯與應用國際會議”(簡稱FPL)?將在英國貝爾法斯特舉行,AMD北京?AI 研發團隊的兩篇論文成功入選本屆會議,分別為《XVDPU:基于 Versal 平臺 AI 引擎的高性能 CNN 加速器設計》和《A-U3D:?基于 Versal 平臺統一 2D/3D CNN 加速器設計以及針對視差估計應用的優化》。FPL 會議注重硬件架構設計和硬件工具領域的研究。此次 AMD AI 研發團隊入選的兩篇論文側重基于 Versal 異構計算平臺的 AI 處理器架構設計,充分發揮 Versal 平臺的算力和靈活性優勢。
今年 CVPR 會議上,AMD AI 研發團隊的兩篇論文成功入選。在同期舉辦的計算機圖像恢復領域最具影響力的全球賽事 NTIRE 2022 挑戰賽上,團隊獲得高效超分辨率(Efficient Super-Resolution)精度賽道第一的佳績,相關技術報告也被 CVPR Workshop 接收。

“數據、算法和算力是?AI?的三大基石。AMD AI研發團隊在頂級學術會議上取得的一系列成績,不僅展現了團隊在算法和算力提升方面的研究成果,也源于團隊在創新研究和客戶需求雙重驅動下的不懈探索,通過前沿研發更好地提升產品核心競爭力,從而助力客戶打造更卓越的解決方案。”
單羿博士
AMD公司副總裁、AI研發團隊負責人

論文第一作者:賈希杰,AMD高級開發經理
當前,卷積神經網絡廣泛應用于計算機視覺領域。更高精度和分辨率的需求引入了更復雜的神經網絡,算力和數據讀寫 I/O 因而日益成為瓶頸。AMD 7nm Versal ACAP 具備 AI 引擎核(AIE 核),與傳統 FPGA 解決方案相比,能夠以 50% 的能耗提供8倍的算力。

上圖展示了論文中 XVDPU 加速器的架構設計,它具有以下特征:
??上下滑動查看更多內容??

實驗表明,僅使用 96個AIE 核的配置,XVDPU 具有 9.8 倍于 ZCU102 ZU9 MPSoC 的計算能力和更高的計算效率,對于非 I/O 瓶頸的網絡,如 MLPerf_resnet50_v1.5_tf 和 vgg_16_tf,可以獲得 9 倍多的 FPS 性能,限于板卡的 DDR 帶寬(68.3GB/s),所支持的網絡中可以獲得 1 倍多到 9 倍多的 FPS 性能。
XVDPU 是一個“AI 引擎?+ PL 邏輯?+ PS CPU”的混合異構計算系統:AI 引擎具有強大的并行計算能力,應用于推理計算可以獲得高能效比;PL 邏輯的在線可編程特性提供了靈活性,可以根據網絡模型的變化進行升級,支持最新的網絡模型;借助 PS ARM核中的Linux系統,靈活支持應用軟件。異構計算系統各部分發揮各自優勢,合力構建了高性能CNN加速器。
得益于強大的計算性能和計算效率、新型網絡模型的廣泛支持,XVDPU 上已經成功部署超過 100 個CNN模型,從低時延數據中心到高階自動駕駛、再到復雜機器人系統等廣泛的嵌入式系統,都能夠從中受益。

論文第一作者:張天宇,AMD高級工程師
視差估計是一項基本的計算機視覺任務,它在給定一對校正立體圖像的情況下預測每個像素的視差,在自動駕駛、機器人等領域具有廣泛的應用。最近基于 CNN 的方法將 3D 卷積和視差回歸用于視差估計。PSMNet 是流行的基于 3D CNN 的解決方案之一,具有良好的保真度結果,但部署網絡消耗算力大。在這項工作中,團隊以 PSMNet 為例,旨在為嵌入式設備上的一般視差估計任務提供參考解決方案。論文中介紹的加速器架構設計如下圖所示。

本論文研究的獨特價值在于以下3方面:
??上下滑動查看更多內容??
與不同平臺相比,團隊的工作實現了更高的能量效率、0.289s的延遲和10.1FPS的幀率。在輕量級工作負載模型中,該解決方案展示了超過 10,000 GOP/s E2E 吞吐量。因此,這種解決方案具備更高的實用性,非常適合應用于自動駕駛、機器人和其它機器視覺相關領域。

人才招聘?2022
AMD AI 研發團隊位于北京,聚焦 AI 領域的前沿研究,涵蓋 AI 算法、編譯器、軟件和 IP 開發等方向,服務于眾多數據中心、自動駕駛和機器人等企業客戶。
這里有窗明幾凈的工作環境,濃厚的工程師氛圍,充滿競爭力的薪酬福利,歡迎相關方向的小伙伴加入,簡歷可發送至:xijie.jia@amd.com。

