微信公眾號:OpenCV學堂
關注獲取更多計算機視覺與深度學習知識
深度學習已經應用在計算機視覺領域多個方面,在最常見的圖像分類、對象檢測、圖像語義分割、實例分割視覺任務都取得了良好的效果,如下圖所示:

深度學習在圖像語義分割上已經取得了重大進展與明顯的效果,產生了很多專注于圖像語義分割的模型與基準數據集,這些基準數據集提供了一套統一的批判模型的標準,多數時候我們評價一個模型的性能會從執行時間、內存使用率、算法精度等方面進行考慮。有時候評價指標也會依賴于模型的應用場景而有所不同,精準度對一些嚴苛的使用場景是優先考慮的,速度是對一些實時應用場景優先考慮的。對語義分割模型來說,通常用下面的一些方法來評價算法的效果。
執行時間
運行時間或者速度是一個很關鍵的指標,特別是在模型部署以后的推理階段,在有些應用場景下,我們知道訓練模型所需要的時間也是有意義的,但是通常不是很重要。主要原因在于訓練/學習不是一個實時需求,除非訓練時間極其漫長或者訓練時候運行速度極其慢。另外一個問題是,執行時間容易受到各種硬件資源不同的影響,所以一般情況下很難去統一度量,不考慮硬件資源,片面的通過執行時間來衡量模型好壞有失公平。
內存占用
對所有的語義分割模型來說,內存是另外一個重要因素,盡管多數場景中內存是可以隨時擴充的,但是在一些嵌入式設備上,內存也是很珍貴的,即時高端GPU卡,內存也不是無限制可以消費的,所以網絡的對內存的消耗也是一個評估考量的指標。
精度(Accuracy)
精度是評價圖像分割網絡最主要也是最流行的技術指標,這些精度估算方法各種不同,但是主要可以分為兩類,一類是基于像素精度,另外一類是基于IOU。當前最流行的語義分割方法評估都是基于像素標記為基礎完成的。
假設總計有k+1分類(標記為L0到Lk,其中包含一個背景類別),Pij表示類別為i的像素被預測為類別為j的數目,這樣來說Pii就表示TP(true positives),Pij與Pji分別表示為FP(false positives)與FN(false negatives)。
像素精度
PA – (Pixel Accuracy)?
最簡單的度量計算,總的像素跟預測正確像素的比率:

平均像素精度
MPA –Mean Pixel Accuracy
基于每個類別正確的像素總數與每個類別總數比率求和得到的均值:

平均并交比
MIoU-Mean Intersection over Union
這是語義分割網絡的一個標準評價指標,它通過計算交并比來度量,這里交并比代指ground truth與預測分割結果之間。是重新計算TP跟 (TP + FN+FP)之和之間的比率。IoU是基于每個類別計算,然后再求均值。公式如下:

頻率權重并交比
FWIoU(Frequency Weighted Intersection over Union)
他是MIoU的改進版本,它會根據每個分類出現頻率,對每個分類給予不同權重。它的計算方法如下:

上述四種精度計算方法,MIoU是各種基準數據集最常用的標準之一,絕大數的圖像語義分割論文中模型評估比較都以此作為主要技術指標。常見如下:


金舟不能凌陽侯之波
玉馬不任騁千里之跡
?推薦閱讀?
實戰 | 基于YOLOv8的PCB板缺陷檢測
三行代碼實現 TensorRT8.6 C++ 深度學習模型部署
OpenCV4.8+YOLOv8對象檢測C++推理演示
ONNXRUNTIME部署一鍵人像摳圖模型
