芯片人看AI · AI for DV
約5200字 / 閱讀約9分鐘
Agentic EDAAI4EDAStage ContractValidator GateEDA Tool GatewayAgent HarnessDomain PackAI-Native DesignCopilot vs AgentL1-L5 AutonomyDesign State GraphSignoff
這幾天,我干了一件有點笨的事。
我把 AI for Design Verification 這個方向,從2012年的早期機器學習論文,一直翻到了DVCon 2026。
一共50篇。
能找到公開版本的,我都下載了下來。找不到的,就順著 DOI、作者主頁、會議論文集繼續挖。中間還踩了不少坑,有些鏈接看著像PDF,下載下來其實是個付費墻頁面,有些論文搜索引擎能讀,真正點進去卻只剩一個403。
折騰完以后,完整論文拿到了42篇,另外還有一份官方演示稿和一份作者海報。
然后我開始一篇一篇看。
一開始我以為,這批論文大概會告訴我,大模型已經可以寫UVM、生成SVA、自動補coverage,甚至準備把驗證工程師也一起優化掉了。
畢竟最近兩年的標題,一個比一個狠。
什么自動生成Testbench,什么AI Formal Verification Engineer,什么Agentic Regression,什么從Spec到Sign-off。
看著都挺嚇人。
但把50篇論文連起來看完以后,我反而松了一口氣。
AI當然不是不行。只是它開始有用的地方,跟很多人想的并不一樣。
現在AI for DV最成熟的能力,不是獨立完成驗證。
而是回答一個驗證工程師每天都在回答的問題。
下一步,最值得做什么?
該跑哪批測試,哪個失敗跟以前見過的很像,哪個coverage hole值得繼續追,哪個formal engine更可能收斂,這條assertion缺了什么helper,眼前這個log到底應該先交給誰。
這些問題單獨看都不性感,甚至有點臟活累活。
可真正在項目里待過的人都知道,驗證的大量時間,恰恰就耗在這里。
測試大家都會寫,難的是判斷下一組最值錢的測試是什么。log也都能看,麻煩的是nightly regression一覺醒來炸出幾千條失敗,里面可能只有兩個根因。
coverage更折磨人。最后那零點幾個百分點,經常藏在一組極其別扭的約束組合里,隨機跑十萬次都未必撞得到。
這才是AI真正開始切進去的地方。
這條路其實很早就開始了。
2012年那篇關于機器學習自動化Coverage-Directed Test Generation的綜述,已經把基本結構講得很清楚了。跑一輪仿真,觀察coverage,再根據反饋調整下一輪激勵。
今天大家說的RL、LLM、Agent,外殼變了很多,里面那根骨頭其實沒怎么變。

還是一個反饋閉環。
只是以前模型改的是約束和參數,現在的Agent開始決定調用哪個工具、讀取哪份規格、生成哪條屬性、什么時候停下來找人。
我印象很深的一篇,是DVCon 2020的Machine Learning-Guided Stimulus Generation。

它沒有試圖把UVM推翻重寫,而是研究test內部哪些transaction更值得跑。作者在自己的實驗配置中報告,把模型訓練和數據處理的成本也算進去,整體CPU時間仍然減少了大約70%。
這個思路很工程。它沿用原來的驗證體系,只把低價值的重復勞動擠出去。
NVIDIA在DAC 2023的一篇工作更直接。 __IMG_02_DAC2023__
他們從快速功能仿真的結構覆蓋數據里,用無監督學習挑出更有差異的測試。論文報告,在保持相近功能覆蓋的條件下,RTL仿真時間最高可以減少約85%。其中一個GPU單元里,約4000個測試命中了全量20000個測試所覆蓋點的90%。
五分之一的測試,覆蓋了九成的點。
看到這個數字,我第一反應不是模型真牛。
而是我們過去到底燒掉了多少重復的仿真資源。。。
當然,這個數字不能直接搬到另一個項目里。設計規模、coverage model、測試質量、版本階段都不一樣。無監督模型認為某個測試在結構上很特別,也不代表它一定能抓到高風險bug。
但這個方向是成立的。
AI不一定比驗證工程師更懂設計,它可以比人更耐心地盯著幾十萬次歷史回歸,找到那些人眼很難看出來的重復和偏差。
再往后走,就到了大家更熟悉的生成式AI。
這里有一個特別容易被標題帶偏的地方。
LLM會寫SystemVerilog,不等于LLM會驗證。
這兩個能力,中間隔著一條很寬的河。
AutoBench、CorrectBench、LLM4DV、UVLLM、UVM2,這幾年的論文都在嘗試生成testbench、刺激、checker或者UVM環境。數字看起來也越來越漂亮。
CorrectBench在論文中報告的總pass ratio是70.13%,高于前代方法的52.18%和直接生成的33.33%。MEIC在178個RTL錯誤組成的數據集上,語法修復率和功能修復率分別報告到93%和78%。
這些結果已經不能再用「大模型只是玩具」來搪塞了。
它確實能干活。
可越往論文細節里看,越會發現起作用的并不是一次生成。
是編譯失敗以后重寫。
是仿真結果不對以后繼續修。
是formal engine返回counterexample以后,重新生成helper assertion。
是coverage沒有增長以后,換一個約束和場景。
也就是生成、執行、反饋、再生成。模型負責提出候選,工具負責打臉。
我覺得這句話,幾乎可以概括當前所有相對靠譜的AI for DV系統。
工具必須負責打臉,因為驗證里最可怕的東西,從來不是編譯錯誤。
編譯錯誤擺在那兒,誰都看得見。
真正可怕的是false pass。
一個testbench跑通了,波形也挺漂亮,coverage看著也在漲,但它的scoreboard跟DUT犯了同一個錯誤。或者生成的assertion語法沒問題,卻表達錯了規格。更離譜一點,模型為了讓proof收斂,順手加了一個過強的assumption,把真正的bug也一起假設沒了。
整個流程一片綠色。

芯片回來以后再告訴你,綠色是假的。
所以VerifLLMBench這類工作很重要。

它不再只問testbench能不能編譯,而是問這個testbench能不能把故意注入DUT的bug找出來。
這個評價方法一下就把問題拉回了驗證的原點。
驗證資產的價值不看它寫得像不像UVM,要看它能不能對錯誤敏感。
同樣的事情也發生在SVA生成上。
從早期的自然語言轉SVA,到Security Assertions by LLMs,再到AssertLLM、VERT、HADA和NVIDIA的AssertionForge,路線越來越清楚。
只把一段規格扔給模型,效果很有限。
真實規格里的信息太散了。接口時序在波形圖里,例外條件在表格腳注里,信號真正的名字和層次又在RTL里。規格講的是意圖,assertion卻必須落到真實的狀態、信號和時間關系上。
AssertionForge的做法就很有意思。

它把規格和RTL一起變成知識圖譜,再從不同分辨率提取上下文生成assertion。這個思路沒有迷信模型參數,而是先把需求、實現和信號路徑對齊。
模型再聰明,喂錯上下文也沒用。
甚至有時候,模型越聰明,錯得越像真的。
這話聽著有點刺耳,但我越來越覺得,AI for DV最后拼的可能不是誰家的模型大,而是誰家的驗證知識整理得更干凈。
規格條目跟哪段RTL有關。
這條property依賴了哪些assumption。
哪個coverage hole以前追過,后來為什么判定不可達。
這個failure signature歸過誰,最終對應哪個bug,修復以后跑了哪些回歸。
這些東西,大多數公司其實都有。
只不過散在PDF、Excel、Jira、回歸數據庫、波形、郵件、工程師腦子和一些已經沒人敢動的腳本里。
亂得很真實。
大模型不是魔法。它面對一堆互相沖突的舊規格、失效鏈接和過期測試,也只會把這鍋知識粥煮得更像一鍋知識粥。
這就是我看DVCon 2025和2026時,感受最強烈的變化。
2025年,大家還在展示一個個具體用例。
NVIDIA用LLM做VIP實例化,Samsung用設計元數據提前生成coverage定義,AMD用隨機森林做regression triage,Infineon用Saarthi把formal plan、SVA、proof、counterexample和formal coverage串起來。
那一年的AI,很像一個個裝在驗證流程旁邊的外掛。
有的負責挑測試,有的負責分log,有的負責寫property,有的負責補coverage。
到了DVCon 2026,詞突然變了。

Spec-RAG、Knowledge Graph、GraphRAG、Memory、Multi-Agent、MCP、Agentic Sign-off、Autonomous Regression。
AI已經不滿足于給某個環節打輔助了,它開始試圖維護整個驗證任務的狀態。
Samsung公開的三層Agentic Regression Framework,把Agent分成user、block和central三層。個人層處理局部測試和日志,block層維護IP狀態,中央層再解決跨block資源和風險。

這套結構挺像真實的驗證組織。
一個工程師不需要知道全芯片每個角落的細節,一個block owner也不應該隨便改另一個block的策略,真正跨模塊的問題才升級到中央層。
Agent開始有了組織結構。
這比造一個無所不能的超級Agent靠譜多了。
因為驗證從來就不是一個人的獨角戲。
回到公司這邊看,三大EDA廠商的路線也很有意思。
Synopsys把VSO.ai、Verdi、Formal Advisor和AgentEngineer往一起串。Cadence把Verisium里的Manager、Debug、AutoTriage、CodeMiner、WaveMiner、SimAI、SmartProof放在同一套驗證數據面上。Siemens則強調Questa引擎原生的MCP和受控Agent。
表面上大家都在講Agent。
可它們真正有價值的資產,還是下面那些跑了很多年的仿真、形式、調試和verification management引擎。
模型可以換。
VCS、Xcelium、Questa里的工具狀態,項目積累的coverage、failure、waveform和proof數據,沒那么容易換。
芯片公司又是另一邊。
EDA廠商有執行引擎,芯片公司有規格、歷史回歸、缺陷和組織經驗。
NVIDIA、Samsung、Micron、AMD、Infineon、Intel公開出來的路線都不一樣,因為它們最貴的驗證瓶頸不一樣。
Micron在NAND和DRAM驗證里更關注高維參數和序列。AMD從owner和failure signature預測這種標簽清楚的場景切入。Infineon把力氣放在Agentic Formal上。Samsung看起來則在搭一整套內部Verification Intelligence Platform。
這里比的不是誰跟風快,而是誰手里有什么數據,又愿意先解決哪個最貴的問題。
寫到這里,可能有人會問,驗證工程師到底會不會被替代?
坦率地講,我不知道五年以后會怎樣。
但只看這50篇論文和DVCon 2025、2026的公開證據,我不相信短期內會出現一個AI,獨立接手生產級SoC驗證,然后自己簽字說可以tape-out。
現在離這一步還很遠。
Saarthi的端到端形式驗證框架很有啟發性,但作者后續也承認初代整體效能大約只有40%。很多LLM testbench論文仍然集中在規模較小、邊界清楚的設計上。工業論文里的數據又大多來自單項目和私有環境,跨IP、跨團隊、跨設計代際的泛化證據并不夠。
更麻煩的是,sign-off不是一道有標準答案的題。
規格可能自己就矛盾。
coverage model可能漏了場景。
一個不可達bin到底是真不可達,還是約束寫錯了,需要架構、設計和驗證一起判斷。
模型可以給建議,但最后接受風險的人還是人。
不過,如果因為AI暫時不能簽字,就覺得驗證工作不會變,我覺得也有點自欺欺人。
它已經在變了。
過去一個強驗證工程師的價值,很大一部分是會寫環境、會調約束、會看波形、會追coverage、會從幾千條log里聞出那條不對勁的味道。這些能力以后仍然重要,但還會多出一層。
你能不能把自己的判斷過程,變成機器可以使用的規則、數據和反饋。
你能不能定義什么可以自動執行,什么必須審批。
你能不能設計一個不會靠刪測試來提高回歸效率、不會靠弱化assertion來提高proof成功率、不會靠忽略corner case來制造漂亮coverage的guardrail。
你能不能讓AI給出的每一步,都留下可重放的證據。
驗證工程師的工作單元,可能會從「親手完成每一個動作」,慢慢變成「定義目標、設置邊界、檢查證據、處理異常」。
有點像飛機上的自動駕駛。
穩定、重復、可觀測的階段,機器會接手越來越多。真正惡劣的天氣、傳感器沖突和超出預案的情況,還是要人回來。
而且人不能因為平時不碰操縱桿,就把判斷力也一起丟了。
這才是我覺得最難的地方。
所以,如果現在讓我給一個DV團隊排AI落地順序,我不會從自動生成整套UVM環境開始。
我會先做regression triage和failure clustering。
因為標簽現成,風險可控,做錯了也容易發現。
然后做test selection和coverage recommendation,但保留關鍵測試、隨機探索和周期性全量回歸。模型可以少跑測試,但不能自己悄悄改掉風險定義。
再往后做SVA和formal helper生成。
讓LLM起草,讓formal engine判定,再加vacuity、mutation和known-bug replay。
Testbench生成可以試,但評價指標不能只看compile rate。得給DUT注入bug,看看它到底能抓住幾個。
至于從Spec一路自治到Sign-off的超級Agent,可以研究,可以做原型。
別急著把簽字權給它。
寫這篇文章的時候,我總想起驗證里一個很樸素的事實。
設計工程師負責把功能做出來。
驗證工程師負責證明,世界沒有按我們想當然的方式運行。
AI最擅長的,偏偏也是從歷史里學習最可能發生什么。
這兩者放在一起,既強大,又有一點危險。
因為芯片里最貴的bug,往往藏在所有人都沒想到、數據里也從來沒有出現過的地方。
所以AI for DV成熟的標志,不是模型終于可以寫出一萬行UVM。它得在該快的時候快,在不知道的時候承認不知道,在風險越界之前把人叫回來。
我看完50篇論文,最后留下的就是這么一個有點樸素的判斷。
AI不會替我們證明芯片一定正確。
它會逼著我們重新回答,什么才算證據。
而這件事一旦開始,驗證工作就已經回不去了。
。
芯片是視角,AI是目的地。
1. Coverage-Directed Test Generation Automated by Machine Learning—A Review
2. Machine Learning-Guided Stimulus Generation for Functional Verification
3. Test Selection for RTL Coverage by Unsupervised Learning from Fast Functional Simulation
4. DVCon U.S. 2025 Program
5. DVCon U.S. 2026 Technical Sessions
6. Saarthi for AGI
7. A 3-Tiered Agentic AI Framework for Verification Regression
*免責聲明:本文由作者原創。文章內容系作者個人觀點,路科驗證轉載僅為了分享與討論,不代表路科驗證對該觀點贊同或支持,也不構成投資建議。如果有任何異議,歡迎聯系路科驗證。