當傳統(tǒng) EDA 方法學(xué)撞上 AI 大算力時代,一場靜悄悄的效率革命正在發(fā)生。
上一篇我們聊到了商業(yè)仿真器與開源工具各司其職的“雙軌驗證體系”。但在所有芯片賽道中,AI 芯片團隊無疑是把這套新流程玩得最極致、也最激進的一群人。
在過去很長一段時間里,芯片驗證的行業(yè)金標準是千篇一律的:用 SystemVerilog 搭建 standard UVM 平臺,購買商業(yè)仿真器跑動態(tài)隨機測試,直到代碼覆蓋率收斂。這套流程在開發(fā) CPU、GPU 或通用 MCU 時不滿意,但是確有其優(yōu)勢,加上歷史包袱很重,所以繼續(xù)用。
然而,當大戲的主角變成大算力 AI 芯片時,這套運轉(zhuǎn)了二十年的傳統(tǒng)齒輪,突然轉(zhuǎn)不動了。
越來越多的頂尖 AI 芯片團隊——無論是研發(fā)大算力加速卡的獨角獸,還是互聯(lián)網(wǎng)大廠內(nèi)部的自研團隊——開始做出同一個激進的選擇:打破原有的驗證規(guī)矩,引入像 Verilator 這樣的開源編譯器,重構(gòu)硬件驗證流程。
他們這樣做并非為了省 License 費,而是因為在 AI 大算力面前,傳統(tǒng)驗證方法學(xué)迎面撞上了無法逾越的效率高墻。
01
要理解這場變革,必須先看清 AI 芯片與傳統(tǒng)通用處理器在底層架構(gòu)與計算模式上的本質(zhì)不同。
事實上,這套依靠事件驅(qū)動(Event-Based)的傳統(tǒng)仿真齒輪,早在十多年前面對超大型 SoC(系統(tǒng)級芯片)的體量膨脹時,就已經(jīng)開始發(fā)出“咯咯吱吱”的卡頓聲。傳統(tǒng) CPU 或 SoC 的核心難點在于控制流極度復(fù)雜(分支預(yù)測、深度亂序、嚴苛?xí)r序耦合)。當時雖然計算體量也在增長,但靠著堆疊服務(wù)器集群和商業(yè)仿真器的局部優(yōu)化,行業(yè)尚能勉強維持平衡。
但到了這兩年,AI 芯片的爆發(fā)讓這套齒輪徹底卡死。
1.大規(guī)模并行計算陣列帶來的設(shè)計體量躍遷
AI 芯片(如 NPU、TPU、矩陣乘法加速器)的本質(zhì)是由大規(guī)模張量/矢量計算單元組成的龐大陣列。為了追求極致的吞吐量,AI 芯片以一種極其暴力的邏輯在芯片上堆疊模塊。這種面向并行計算規(guī)模的擴張,比傳統(tǒng) SoC 模塊的增長速度要快得多。
2.極漫長的計算周期拉長了仿真時間
相較于傳統(tǒng) SoC 計算場景有長有短、可以頻繁做局部快照,AI 芯片的計算模式類似于視頻編解碼處理一幀數(shù)據(jù)——每一次完整的算子計算(如跑完一次 Transformer 矩陣乘法或一幀推理),都有一個普遍極其漫長的計算周期。
當“暴增的并行計算規(guī)?!?/span>疊加“持續(xù)增長的數(shù)據(jù)流執(zhí)行時間”,商業(yè)仿真器的事件驅(qū)動機制直接遭遇了效率危機:每次時鐘沿跳變,陣列中成千上萬個節(jié)點同時觸發(fā)事件,仿真器需要維護的事件調(diào)度規(guī)模和內(nèi)部狀態(tài)快速增長,跑一個完整的測試甚至需要等待數(shù)天。
正是這種技術(shù)維度上的“仿真墻”,迫使現(xiàn)在的 AI 芯片公司不得不不惜代價地尋找硬件加速與軟件轉(zhuǎn)譯等各種替代手段,來重新設(shè)計驗證流程。
除了仿真速度本身的崩塌,這種低效還進一步引發(fā)了傳統(tǒng)驗證流程的連鎖危機:
02
面對這些痛點,AI 芯片團隊開始重新思考驗證的本質(zhì)。
AI 運算在算法層面是高度確定性的——數(shù)據(jù)怎么進、矩陣怎么乘,在輸入測試集的那一刻就已經(jīng)固定。驗證團隊的核心精力,不再是去抓某一個極其隱蔽的分支控制 Bug,而是要解決:“數(shù)據(jù)流在片上有沒有塞車?總線帶寬有沒有跑滿?系統(tǒng)吞吐有沒有達到理論預(yù)期?”
這正是以 Verilator 為代表的“周期驅(qū)動(Cycle-Based)”技術(shù)的絕佳主場。
正如我們在第一篇中所講,Verilator 抹去了微觀的時序延遲和繁重的事件隊列調(diào)度,它只在時鐘有效沿推進數(shù)據(jù)流的求值。這種近乎暴力的“平鋪式求值”,讓它在跑大批量的 AI 數(shù)據(jù)吞吐測試時,展現(xiàn)出了恐怖的速度優(yōu)勢——這就是為什么 Tesla 能在 NPU 的驗證流程中,獲得高達 30 倍的驚人仿真速度提升。
提到“用軟件/高級語言思維來加速硬件驗證”,業(yè)內(nèi)資深專家或許會聯(lián)想到十幾年前由歐洲車企與巨頭推動的 SystemC 虛擬建模。然而,SystemC 最終因“非 Golden 源導(dǎo)致的邏輯/時序隔閡”以及“極高的虛擬建模門檻”,淪為了少數(shù)大廠的昂貴遺跡。
今天的 AI 芯片團隊徹底吸取了這個歷史教訓(xùn)。他們不再試圖脫離 RTL 去重造一套昂貴的 SystemC 虛擬模型,而是直接以真實的 RTL 代碼為 Golden 源,借助 Verilator 將其轉(zhuǎn)譯為純 C++ 模型,在極速提升吞吐量的同時,無縫融入現(xiàn)有的 Python 與 AI 算法生態(tài)。
基于這種“不破壞既有 RTL”的新思路,頂尖 AI 團隊正在衍生出三種顛覆性的驗證范式:
范式一
在傳統(tǒng)流程中,驗證工程師需要用復(fù)雜的 SystemVerilog 編寫一層又一層的 Testbench。
而在全新的 AI 驗證流程中,團隊通過 Verilator 將 RTL 轉(zhuǎn)化為純 C++ 模型,通過 C++/Python 語言綁定,直接打通至 Python 生態(tài)。AI 算法工程師可以直接用 Python 原生語言輸入一個真實的 Transformer 算子,直接去喂 RTL 編譯出的 C++ 模型。算法與硬件模型之間的鴻溝被瞬間抹平,實現(xiàn)了端到端的超速求值。

范式二
AI 芯片為了驗證軟硬件協(xié)同,需要跑海量的實際網(wǎng)絡(luò)測試集。如果全部壓在商業(yè)仿真器上,昂貴的 License 額度會在瞬間耗盡,導(dǎo)致任務(wù)無限排隊。
AI 團隊的破局點,是將編譯出來的純 C++ 可執(zhí)行文件直接無縫打包進 Docker 容器。在云端集群,他們不需要任何 License 限制,可以瞬間調(diào)度上千個 CPU 核心做完全并行的 Regression(回歸測試),用軟件工程的“無限算力并發(fā)”去對沖商業(yè) EDA 的“物理 License 高墻”。
范式三
借助極速的 Cycle-Based 仿真模型,AI 編譯器團隊和算子庫團隊在芯片流片前幾個月,就能拿到一個“每秒能跑幾萬個時鐘周期”的真實硬件行為模型。
他們不需要等待真實的硅片(Silicon),就能提早在上面跑真實的 AI 編譯器測試,反饋架構(gòu)缺陷,實現(xiàn)真正意義上的軟硬件協(xié)同設(shè)計(Co-Design)。

縱觀 AI 芯片的發(fā)展史,它本身就是一場對傳統(tǒng)計算規(guī)則的叛逆。而伴隨硬件架構(gòu)創(chuàng)新而來的,必然是驗證方法學(xué)的重構(gòu)。
這場發(fā)生在頂尖 AI 芯片團隊內(nèi)部的效率革命,表面上是引入了開源工具,本質(zhì)上則是用更加敏捷、現(xiàn)代的“軟件工程思維”,對陳舊的硬件開發(fā)流程進行了一次降維打擊。
領(lǐng)先的科技巨頭與獨角獸們,憑借龐大的內(nèi)部底層技術(shù)團隊,成功為自己敲打出了一整套高度定制化的新型驗證體系。