書接上文:
瑞薩嵌入式AI技術(shù)漫談 · 技術(shù)架構(gòu)與部署模式
使用傳感器為Edge AI/TinyML采集數(shù)據(jù)
1
概述
在基于傳感器的Edge AI與TinyML應用中,數(shù)據(jù)采集是整個機器學習開發(fā)流程的基礎環(huán)節(jié),也是決定模型能否在真實世界穩(wěn)定運行的關(guān)鍵因素。現(xiàn)實環(huán)境中的傳感器信號通常具有高噪聲、多變性和強場景依賴性,使得構(gòu)建高質(zhì)量的數(shù)據(jù)集成為一項具有挑戰(zhàn)性的工作。若在數(shù)據(jù)采集階段缺乏結(jié)構(gòu)化方法,模型往往會因覆蓋不足、標注不準確或數(shù)據(jù)偏
差而無法在現(xiàn)場可靠工作。
為應對這些挑戰(zhàn),瑞薩電子的Reality AI軟件提供了一套針對傳感器與信號處理場景優(yōu)化的完整AI開發(fā)工具鏈。Reality AI Tools?能夠處理加速度、振動、聲音、電氣(電流/電壓/電容)、雷達、射頻及各類專有傳感器數(shù)據(jù),通過識別信號中反映真實世界事件與狀態(tài)的特征,自動生成適用于嵌入式端的高效模型。同時,Reality AI提供數(shù)據(jù)管理、數(shù)據(jù)增強、數(shù)據(jù)可用性評估和端側(cè)部署等能力,使開發(fā)團隊能夠在數(shù)據(jù)規(guī)劃、采集、驗證和優(yōu)化過程中降低風險、縮短周期并提升整體質(zhì)量。
本章將介紹適用于Edge AI/TinyML應用的數(shù)據(jù)采集方法,包括如何設計數(shù)據(jù)覆蓋矩陣、如何規(guī)劃采集環(huán)境、如何建立可信的標注機制,以及如何在采集過程中持續(xù)監(jiān)控數(shù)據(jù)質(zhì)量。同時,本章還將闡述Reality AI Tools在數(shù)據(jù)可用性評估和迭代式數(shù)據(jù)覆蓋中的作
用,幫助開發(fā)者更高效地構(gòu)建可適應真實世界復雜性的高質(zhì)量數(shù)據(jù)集。
2
規(guī)劃需要采集的數(shù)據(jù)
數(shù)據(jù)采集是機器學習項目中投入最大、耗時最長且風險最高的階段。傳感器數(shù)據(jù)具有高噪聲、多樣性和復雜背景條件,如果規(guī)劃不當,模型很可能在真實環(huán)境中出現(xiàn)泛化失敗的情形。因此,在開始采集之前制定一套嚴謹、結(jié)構(gòu)化的數(shù)據(jù)采集規(guī)劃至關(guān)重要。完善的規(guī)劃能夠顯著降低采集成本,并確保后續(xù)模型訓練、驗證與部署更具魯棒性和可預測性。
為了避免常見的數(shù)據(jù)采集陷阱,Reality AI建議從以下四個方面構(gòu)建完整的數(shù)據(jù)采集規(guī)劃:
在規(guī)劃階段越是投入時間進行預研和周密設計,后續(xù)的采集、訓練與驗證階段就越能避免高成本、不可逆的問題。

需要多少數(shù)據(jù)?
在明確了數(shù)據(jù)采集規(guī)劃的總體要素之后,隨之而來的關(guān)鍵問題是如何確定采集數(shù)據(jù)的數(shù)量與覆蓋范圍。對于大多數(shù)信號類機器學習任務而言,“采集一些數(shù)據(jù)”遠不足以支撐模型訓練。模型要在真實世界中表現(xiàn)穩(wěn)健,必須對目標現(xiàn)象的自然變異、設備差異以及環(huán)境變化具有充分認識,而這一切都依賴于足夠且具有代表性的數(shù)據(jù)。因此,Reality AI推薦使用數(shù)據(jù)規(guī)劃表作為規(guī)劃工具,以系統(tǒng)化方式識別數(shù)據(jù)需求并設計采集策略。
規(guī)劃數(shù)據(jù)范圍的核心目標,是確保采集的數(shù)據(jù)能夠捕捉并克服測量對象在真實場景中的自然變化。這意味著需要在目標類別與關(guān)鍵元數(shù)據(jù)變量的多種組合下采集具有統(tǒng)計意義的獨立觀測數(shù)據(jù)。例如,當任務涉及兩類目標(如“正常”與“故障”)并結(jié)合若干不同運行模式時,必須為這些組合構(gòu)建相應的數(shù)據(jù)規(guī)劃表。在項目早期,如果尚不確定同一個模型能否泛化至不同設備類型,則更有必要為每種設備分別構(gòu)建獨立的表,使其從二維變?yōu)槎嗑S。

簡單數(shù)據(jù)規(guī)劃表示例
一個完整的數(shù)據(jù)規(guī)劃表應囊括所有能夠?qū)е聰?shù)據(jù)分布變化的維度,包括目標類別、環(huán)境條件(溫度、濕度、噪聲等)、設備屬性(型號、尺寸、使用年限)、安裝方式以及運行工況。由于這些維度數(shù)量通常較多,難以在單一表格中一一列出,因此常見做法是先整理每個維度的取值范圍,再據(jù)此構(gòu)建一份可用于跟蹤、管理與補充的數(shù)據(jù)規(guī)劃表或數(shù)據(jù)庫。
Reality AI工具文檔中給出了一個典型案例:如果設備使用年限按5年劃分、溫度按-12℃劃分、濕度按10%劃分,同時需要覆蓋6種目標類別、5種設備型號、4種尺寸和4檔使用年限,那么潛在的采集組合數(shù)量將達到:

更復雜的數(shù)據(jù)規(guī)劃表示例
在理想情況下,每個單元格應包含至少25個獨立觀測樣本,這一經(jīng)驗值源于中心極限定理與大數(shù)定律,用于確保模型在噪聲和隨機性條件下仍能學習到穩(wěn)定的分布結(jié)構(gòu)。而在實際應用中,具體所需樣本量仍會受目標變化量、背景條件復雜度以及設備差異的影響,有些維度可能需要更多,有些則可能需要較少。
然而,真實世界的數(shù)據(jù)采集通常無法完全填滿數(shù)據(jù)規(guī)劃表的每一個組合條件——無論是成本還是時間都不允許。因此,數(shù)據(jù)規(guī)劃表的真正價值不在于“窮舉”,而在于幫助開發(fā)者識別哪些維度是必須覆蓋的、哪些維度可以適當抽樣、哪些維度需要在模型表現(xiàn)不佳時再行補充。通過這種方法,開發(fā)者既能確保模型具備足夠的泛化能力,又能在采集成本與系統(tǒng)性能之間取得平衡。Reality AI推薦采用迭代式方法,通過逐步擴展覆蓋區(qū)域,以更加成本可控、風險更小的方式構(gòu)建高質(zhì)量數(shù)據(jù)集。
例如,在一個復雜的數(shù)據(jù)規(guī)劃表案例中,可以從“概念驗證”階段開始,選擇一種設備型號與尺寸,在不同使用年限的4–5臺設備上采集數(shù)據(jù),并在測試環(huán)境下人為模擬目標故障模式。如果能夠控制環(huán)境條件,則在4–5種環(huán)境下采集數(shù)據(jù);若無法控制,則記錄關(guān)鍵環(huán)境變量并盡量保持一致。通過填充如下單元格的數(shù)據(jù)規(guī)劃表:
即可構(gòu)建模型的1.0版本。隨后,通過觀察各故障模式的預測準確率、正常狀態(tài)的誤報率以及在使用年限、溫度、濕度等元數(shù)據(jù)的表現(xiàn)差異,可以判斷哪些維度需要在后續(xù)階段補充采集。
還可以通過選擇性驗證測試進一步識別哪些類別更為關(guān)鍵。例如,將五臺設備中的四臺用于訓練,將最老的一臺用于驗證,判斷模型是否能夠跨不同使用年限泛化。如果驗證表現(xiàn)良好,則說明使用年限并不是模型性能瓶頸,可適當降低該維度的采集優(yōu)先級;反之,則需要增加該維度的采集量。同樣的方法可用于測試不同尺寸、不同型號或不同環(huán)境組合的數(shù)據(jù),以系統(tǒng)判斷哪些維度對模型性能影響最大。
基于上述方法,Reality AI推薦使用以下迭代流程來完成數(shù)據(jù)規(guī)劃:
1 | 選擇數(shù)據(jù)規(guī)劃表的一部分作為初始重點關(guān)注對象。 |
2 | 盡可能全面地采集這部分數(shù)據(jù)。 |
3 | 基于這些數(shù)據(jù)構(gòu)建初版模型。 |
4 | 觀察各維度的準確率差異并據(jù)此決定下一步采集重點。 |
5 | 在新區(qū)域內(nèi)測試模型泛化能力,并根據(jù)準確率決定是否補采。 |
6 | 將新數(shù)據(jù)加入訓練集并重復上述流程,直到數(shù)據(jù)規(guī)劃表的關(guān)鍵區(qū)域均得到探索與驗證。 |
在實踐中,一個有效的策略是在約三分之一的數(shù)據(jù)規(guī)劃表的單元格中收集至少25個獨立樣本,同時確保表中不存在完全空白的行或列。這種方法既能減少不必要的數(shù)據(jù)采集成本,又能確保模型具備足夠的泛化能力,滿足Edge AI與TinyML場景中對實時性和魯棒性的要求。

概念驗證階段的數(shù)據(jù)規(guī)劃表示例

規(guī)劃采集環(huán)境
規(guī)劃需要采集數(shù)據(jù)的第二部分是對采集的環(huán)境進行系統(tǒng)性設計。規(guī)劃采集環(huán)境不僅包括規(guī)劃傳感器的類型、采樣率、安裝方式與控制裝置,還應明確數(shù)據(jù)在采集過程中的存儲、時間同步、格式化與傳輸方式。如果采集過程涉及特殊環(huán)境(例如高溫、高濕、強振動或潛在危險場景),則需要在規(guī)劃階段明確這些限制,并設計相應的實驗條件與硬件防護要求。
在早期的概念驗證階段,使用預裝有傳感器的開發(fā)板快速采集數(shù)據(jù)通常是一種高效、低成本的方式。然而,這類方式在硬件靈活性、噪聲控制和精度穩(wěn)定性方面存在局限,因此在進入正式采集前需要進行更完整、系統(tǒng)的環(huán)境規(guī)劃。

搭建采集數(shù)據(jù)的環(huán)境
1 | 使用更多的傳感器 在正式開始采集數(shù)據(jù)時,Reality AI建議在初期暫時使用比最終產(chǎn)品更多的傳感器或更高規(guī)格的采樣條件,以便探索硬件對模型表現(xiàn)的影響。例如,當需要評估不同加速度計或麥克風的位置時,可以將多個傳感器同時部署在候選位置并并行采集數(shù)據(jù);當需要評估采樣率、位深度或靈敏度對模型的貢獻時,可以在早期使用高保真?zhèn)鞲衅鞑⒁宰罡卟蓸勇?/span>記錄信號。 通過這種方式,Reality AI Tools?可自動對比不同通道、不同采樣率以及不同硬件配 置下的模型準確率表現(xiàn),從而幫助開發(fā)者在不重復采集的前提下快速確定最優(yōu)的傳感器布置與采樣參數(shù)。這種方法不僅提高了決策效率,也減少了后期因硬件選擇不當而被迫重新采集數(shù)據(jù)的風險。 |
2 | 多維度地采集數(shù)據(jù) 在項目早期盡可能采集各種維度的數(shù)據(jù),是構(gòu)建魯棒模型的一項關(guān)鍵原則。許多工程師在處理振動或聲音類信號時,只會記錄RMS能量、峰值或若干頻段的FFT數(shù)據(jù)。然而這些經(jīng)過高度壓縮的統(tǒng)計特征往往會濾除最重要的細粒度信息,而Reality AI發(fā)現(xiàn)特征的方法依賴識別原始信號中的局部結(jié)構(gòu)、瞬態(tài)事件、異常點和復雜紋理。因此,在早期建議保留全部原始傳感器波形,以最大化捕捉關(guān)鍵信息。如圖16和圖19所示,原始數(shù)據(jù)包含的瞬態(tài)特征和局部結(jié)構(gòu)往往是高層統(tǒng)計特征無法保留的。 |
3 | 采集真實標注 真實標注是采集數(shù)據(jù)過程中最常被忽視、但也是最關(guān)鍵的要素之一。真實標注定義了每段數(shù)據(jù)所對應的真實狀態(tài),例如設備是否正常運行、是否存在特定故障,或動作是否完成。真實標注直接決定模型訓練的準確性,也是后續(xù)評估模型性能的唯一標準。 在采集環(huán)境規(guī)劃中,應明確如何以最高精度獲得真實標注。方式包括:
對于無法系統(tǒng)性獲取標注的場景,例如某些異常檢測任務,仍需建立必要的反饋機制。當檢測到異常時,應能夠通過調(diào)查、日志比對或輔助測量確認異常是否真實存在。若缺乏這一反饋渠道,即便模型在實驗環(huán)境中表現(xiàn)良好,也無法評估其在真實部署中的有效性,更無法對其進行迭代改進。 通過設計完善的真實標注獲取流程,開發(fā)者能夠確保采集到的數(shù)據(jù)不僅數(shù)量充足,更具備訓練與驗證所需的語義準確性,為構(gòu)建高可信度的Edge AI與TinyML模型奠定基礎。 |
3
設計采集數(shù)據(jù)流程
采集數(shù)據(jù)流程是對執(zhí)行采集任務所需步驟的系統(tǒng)性說明,涵蓋從硬件安裝、環(huán)境準備、數(shù)據(jù)記錄到存儲與傳輸?shù)娜^程。流程的清晰度與詳細程度越高,數(shù)據(jù)采集的一致性越容易保證,尤其是在多批次采集、多人協(xié)作或多地點測試等場景下這一點尤為重要。
1 | 安裝硬件與準備環(huán)境 采集流程應從硬件環(huán)境的搭建開始,包括傳感器的安裝方式、固定結(jié)構(gòu)、供電方式以及采樣設備的配置。與此同時,需要記錄現(xiàn)場環(huán)境的元數(shù)據(jù),如測試位置、環(huán)境條件、設備狀態(tài)等,以便在后續(xù)分析中復現(xiàn)采集條件。 |
2 | 啟動數(shù)據(jù)采集與觸發(fā)目標狀態(tài) 在開始采集數(shù)據(jù)之前,應明確如何啟動采集系統(tǒng),以及如何觸發(fā)或引導目標狀態(tài)的產(chǎn)生(例如設備的運行模式轉(zhuǎn)換、動作執(zhí)行、故障觸發(fā)等)。這一部分在信號任務中尤為重要,因為不同觸發(fā)方式可能直接影響采集數(shù)據(jù)的時序特征和穩(wěn)定性。若需要確保設備處于穩(wěn)定狀態(tài),應在流程中明確等待時間、平衡條件或準備動作,以確保采集的是高質(zhì)量、代表性的信號。 |
3 | 數(shù)據(jù)狀態(tài)與真實標注同步執(zhí)行 在采集過程中,應確保數(shù)據(jù)與真狀態(tài)實標注同步采集,包括事件時間點、測試條件變化、操作行為、設備狀態(tài)等內(nèi)容。對關(guān)鍵事件進行可靠的標注和記錄,是確保數(shù)據(jù)集在后續(xù)訓練、驗證和調(diào)試中能夠被準確利用的重要前提。 |
4 | 結(jié)束采集與明確最小觀察窗口 結(jié)束采集階段需要定義清晰的終止條件,例如達到最小觀察時長、收集到指定數(shù)量的數(shù)據(jù)樣本,或任務狀態(tài)恢復到初始條件。若任務涉及分類,則應明確定義最小分類窗口,以確保每類樣本在時長與數(shù)量上都具備統(tǒng)計意義。 |
5 | 統(tǒng)一標注、文件內(nèi)容和命名規(guī)范 采集流程應明確如何記錄觀察內(nèi)容、如何組織與命名數(shù)據(jù)文件、如何管理元數(shù)據(jù),使不同參與者所生成的數(shù)據(jù)能夠以一致格式存儲和解析。良好的數(shù)據(jù)管理規(guī)則能夠避免數(shù)據(jù)混亂,減少后期處理成本。 |
6 | 存儲與傳輸數(shù)據(jù) 最后,應規(guī)定數(shù)據(jù)在采集完成后如何存儲、備份、提取,并上傳至預處理區(qū)域。這包括選擇數(shù)據(jù)存儲介質(zhì)、上傳頻率、數(shù)據(jù)分批機制以及傳輸鏈路的可靠性要求。確保數(shù)據(jù)在采集與傳輸過程中不會丟失、損壞或混淆。 |
如您在使用瑞薩MCU/MPU產(chǎn)品中有任何問題,可識別下方二維碼或復制網(wǎng)址到瀏覽器中打開,進入瑞薩MCU/MPU官方技術(shù)論壇尋找答案或獲取在線技術(shù)支持。
https://bbs.21ic.com/renesas
未完待續(xù)
推薦閱讀
瑞薩嵌入式AI技術(shù)漫談 · 實驗室模型與真實世界部署
瑞薩嵌入式AI技術(shù)漫談 · 信號處理場景的AI-as-a-Service
瑞薩嵌入式AI技術(shù)漫談 · 面向信號數(shù)據(jù)的機器學習方法

