
現今的嵌入式產品需要在本地具備智能,而不必承擔云運算所需的成本或功耗。這正是邊緣AI(Edge AI)在內建微控制器(MCU)的嵌入式系統中逐漸成為基本需求的原因,熱門應用包括:工業感測、智能家居與汽車子系統等。雖然AI/ML模型部署已變得更容易,但真正的挑戰往往出現在設計流程的后期。開發者需要能夠判斷系統是否能在嚴格的功耗預算下持續運行,延遲是否在所有操作條件下保持受控且可預測,以及執行AI運算管道(Pipeline)引入了多少系統負擔。解決這些因素對于確保在真實應用中可靠、高效且可擴展的部署至關重要。
在這個階段,成功的衡量標準在于工作負載能否高效利用底層的運算架構。
邊緣 AI管道的實現
大多數邊緣 AI 系統遵循一個常見結構:傳感器數據 → 預處理(DSP) → AI 推理(ML) → 動作
從實現角度來看:
一個關鍵觀察是:DSP與ML緊密耦合。在許多工作負載中,預處理可能消耗總計算和能量的相當大部分。僅優化推理是不夠的,系統必須同時高效處理這兩個階段。
邊緣 AI 計算譜系
基于MCU的邊緣 AI 架構通常分為三類:
這些類別通常以峰值TOPS或吞吐量進行比較。但在MCU級系統中,這種比較往往具有誤導性,因為主導約束因素是能耗、內存和確定性,而不應是峰值計算能力。
邊緣 AI 工作負載的實際需求
現實中的邊緣AI部署遵循一致的模式。模型通常較小,大小僅為幾十到幾百KB,并在常開系統中持續或周期性運行。輸入一般是低帶寬數據流,例如音頻信號或傳感器讀數,成功的關鍵在于延遲的可預測性,而不僅僅是降低平均延遲。常見應用包括關鍵詞檢測與音頻分類、利用IMU數據的手勢識別、時間序列信號中的異常檢測,以及低分辨率的存在檢測。
在這些環境中,主要約束并非峰值計算性能,而是整體系統效率。每次推理的能耗往往比原始吞吐量更重要,而內存占用和數據傳輸對性能的影響通常大于可用處理能力。確定性執行與一致的延遲也是關鍵要求。因此,優化的重點從最大化基準性能轉向實現系統層面的高效與可靠運行。
這意味著優化目標從“最大性能”轉向“系統級效率”。
芯科科技MVP:匹配AI工作負載的計算能力
Silicon Labs(芯科科技)的矩陣向量處理器(MVP)正是圍繞這種工作負載特性而設計的。與其完全依賴M33內核,不如將計算工作卸載到MVP引擎來完成以下功能:
許多用于ML推理的數學運算同樣也會在信號處理過程中使用。MVP同時加速這兩類運算,從而提升整體系統效率,而不僅僅是加快神經網絡的執行速度。
架構層面的啟示:系統效率來源何處
這種方法通過加速運算并與更廣泛的系統架構緊密集成來帶來優勢。
1. 減少數據傳輸:在許多嵌入式系統中,數據在內存與計算單元之間的移動消耗的能量往往比計算本身更多。緊耦合的加速器并不能完全消除數據傳輸,但能讓其更高效。集成的加載-存儲與DMA機制允許數據以可預測的訪問模式在內存與加速器之間流動,減少CPU干預,避免在不同計算子系統之間不必要的復制。相比之下,獨立NPU往往需要額外的內存傳輸與同步開銷,從而增加能耗與延遲。
現實中的AI工作負載
音頻與語音:關鍵詞檢測與聲音分類系統在嚴格的功耗預算下持續運行。延遲必須低且一致,以實現實時響應。
運動與交互:手勢識別系統依賴連續的傳感器數據流與快速分類。這類系統受益于傳感器處理與推理之間的緊密耦合。
工業監測:預測性維護應用處理時間序列數據以檢測異常。它們需要確定性執行,并在受限能耗預算下保持長期可靠性。
低分辨率視覺:嵌入式視覺應用通常處理小尺寸圖像,以保持在內存與計算限制范圍內。效率比吞吐量更為關鍵。
連接型邊緣AI:設備越來越多地結合本地推理與無線連接。需要高效計算來平衡AI工作負載與通信任務。許多這類AI工作負載并未充分利用高吞吐量NPU。它們往往更受益于與MCU內存系統和執行流程緊密耦合的低開銷、節能型加速。
輕量化加速在邊緣AI部署中的適配性
輕量化加速特別適合以下場景:
這些特性與許多當前MCU邊緣AI部署的需求高度契合,使輕量化加速成為大部分AI工作負載的有效方法。
超越計算:工具與生態系統
僅有高效硬件不足以確保邊緣AI部署成功。開發者還需要簡化整個流程的軟件棧,從模型優化與部署到調試與長期維護。這包括量化與剪枝等技術的工作流、性能分析與調試工具、與固件及RTOS環境的集成,以及支持模型開發的數據收集與訓練管線。
芯科科技提供了包括EFR32第二代無線SoC系列與SiWx917在內的硬件平臺,以及面向開發者的軟件工具、TensorFlow Lite Micro支持,并與Edge Impulse和SensiML等生態伙伴合作。探索AI/ML解決方案:https://cn.silabs.com/applications/artificial-intelligence-machine-learning
在邊緣平衡計算、內存與能耗
在MCU級邊緣AI中,峰值計算性能很少是決定性指標。成功的系統是那些能在嚴格約束下平衡計算、內存與能耗的系統。像MVP這樣的輕量化加速架構與現實工作負載需求高度契合。通過減少數據傳輸、最小化系統開銷并同時支持DSP與ML,它們能夠實現高效且可預測的執行。
對于許多邊緣 AI 應用而言,問題不在于如何最大化計算,而在于如何以最有效的方式使用“恰到好處”的計算能力。


