微信公眾號:OpenCV學堂
關注獲取更多計算機視覺與深度學習知識
概述
工業產品缺陷檢測中,異常樣本稀缺且標注困難。零樣本異常檢測(ZSAD)旨在不依賴目標類別異常樣本的情況下完成檢測任務。然而,現有方法面臨三大痛點:文本提示語義模糊、跨模態交互不足、SAM分割依賴低質量提示。
關鍵改進
DCS框架整合了Grounding DINO、CLIP和SAM三個基礎模型,提出三項關鍵改進

1. FinePrompt:細粒度文本提示
利用大語言模型為每個類別生成多樣化的缺陷描述(如“劃痕”“破損”“污漬”),并結合可學習的文本嵌入和自適應權重機制。模型會根據圖像內容自動為匹配的描述賦予更高權重,有效緩解語義歧義。
2. ADCI:自適應雙路徑跨模態交互
設計了兩條互補路徑:
Strip Path:通過行/列注意力聚合,強化條狀缺陷和邊界的定位能力
Scale Path:通過多尺度池化,捕捉不同大小的異常區域
兩條路徑經門控機制自適應融合,顯著提升CLIP粗分割的準確性。
3. BPPC:框點提示組合器
框提示:Grounding DINO生成候選框,經CLIP異常圖篩選校準
正點提示:從異常高響應區域代表性采樣
負點提示:從異常區域周邊環狀區域挖掘邊界感知的負樣本
三者組合輸入SAM,引導其生成更精細、完整的異常分割結果
實驗效果
在MVTec-AD和VisA數據集上,DCS在AUROC、F1-max、AP三項指標上均達到最優。例如在MVTec-AD上,相比CLIP-SAM方法,AUROC提升21.4%,充分驗證了框架的有效性。


結論
個人認為該方法的優勢,基于本文 + Box + Point的組合提示,對缺陷位置分割更加精細,可以自動分類缺陷類別。但是 串聯Grounding DINO、CLIP、SAM三個大模型,不適合實時場景。
計算開銷大,主要瓶頸在Grounding DINO的候選框生成和SAM ViT-H的掩碼解碼。同時方法基于CLIP、SAM、DINO預訓練模型的基礎能力,三者任一短板都會影響整體。

推薦閱讀
玩轉YOLOv8~YOLO11全系模型從訓練到推理就靠它了
C#上位機開發專屬OpenCV系統化教程
C#中輕松實現OpenCV算法零代碼開發
深度學習系統化學習路線圖專題(2025版本)
【零代碼】OpenCV C# 快速開發框架演示
正式發布|OpenVINO2025深度學習與大模型部署教程
C#上位機開發專屬OpenCV系統化教程
