
摘要:智能座艙人機交互是汽車用戶體驗的重要組成部分。在信息化、智能化背景下,依托各種先進技術,智能座艙多模態交互已成為汽車行業研發的核心方向。其不僅保留了觸控等傳統物理交互方式,還整合了語音、手勢、眼控及多屏等新興交互方式。通過感知層信息的共享與交互,智能汽車能夠獲取可靠的決策依據,從而優化駕駛行為并顯著提升舒適性與安全性。概述了智能座艙多模態交互技術,系統分析其發展現狀、面臨的問題與未來趨勢,以期為提升智能座艙人機交互體驗提供理論參考。
智能座艙在現代汽車產業中,尤其是新能源汽車智能化領域占據重要地位,是提升用戶駕駛體驗的關鍵因素。與傳統座艙的物理交互方式相比,智能座艙融合了多模態感知技術,結合人工智能、虛擬化和個性化定制等手段,形成了更復雜的人機交互模式。多模態融合、主動化、擬人化和自然化的交互方式成為智能座艙人機交互的發展趨勢。
模態指的是數據或者信息的表現形式,如文本、圖像、音頻、視頻等。多模態指的是數據或者信息多種表現形式的融合,通過對多模態數據進行學習,從而提高模型的感知和理解能力。
多模態人機交互是車輛通過融合類人的視覺、聽覺、觸覺等多種感知設備,使計算機利用多通道響應輸入信息,充分模擬人與人之間的交互方式。
智能座艙多模態交互是實現人與車、人與生態的連通。通過觸控、語音、手勢、眼控、多屏交互等多維度感知,結合主動決策、人性交互,為用戶提供個性化、更具情感化的便捷體驗。
智能座艙多模態交互包括觸控交互、語音交互、手勢交互、眼控交互、多屏交互,甚至包括腦電信號的交互。常見模態、相關技術和車輛相關的物理層部件如圖1所示[1]。

圖1 常見模態、相關技術和車輛相關的物理層部件
觸控技術是智能座艙中傳統的人機交互技術之一,通過觸控、按鍵、旋鈕等物理方式實現交互。觸控技術在大屏化、多屏化、智能表面技術的影響下,應用范圍多樣化,可多手指同時操作實現操作結果的及時反饋,完成觸控交互的可視化。隨著觸控技術的發展,“重觸控輕按鍵”逐漸成為設計主流。這樣不僅實現了人機界面(human machine interface, HMI)的美觀性,而且有利于功能布局優化與成本控制。
觸控技術的反饋方式一般有聲音、HMI和振動觸覺。振動觸覺反饋在駕駛安全方面得到廣泛應用,用于提醒駕駛員安全行駛。具體為座艙域控制器通過感知層判斷駕駛員打哈欠、閉眼等不規范行為,通過座椅內布置的傳感器,向駕駛員提供定向觸覺信號,提醒駕駛員安全行駛,顯著降低因疲勞駕駛引發的安全隱患。
隨著汽車智能化的發展,語音識別技術在智能座艙交互中的應用愈發成熟。“可見即可說”、連續對話、聲源定位、免喚醒等技術廣泛應用,語音交互也將變得更自然,甚至可以提供情感陪伴,提高駕駛員對語音交互的信任感。但是由于車輛運行環境包括胎噪、風噪、媒體音頻等復合噪聲,所以語音數據采集后需要運用降噪算法消除無關噪聲,保證語音識別的準確率,從而提高語音交互的連續性。
語音識別技術使駕駛員在駕駛過程中通過語音指令的方式來控制媒體娛樂、藍牙電話、導航、車輛功能等。語音識別技術流程如圖2所示。語音識別技術避免了駕駛員雙手和視線偏離駕駛位,提高了駕駛的安全性。

圖2 語音識別技術流程
智能座艙手勢交互主要通過手勢識別技術完成交互工作。智能座艙內攝像頭用來判斷手勢,并將數據傳遞給智能座艙域控制器,由控制器調出與手勢相對應的功能。相較于語音控制,手勢控制操作更加精準、快速,且更容易學習掌握。手勢交互是對語音交互、觸控交互的補充,手勢交互能夠讓駕駛員通過簡單的手勢就能完成智能座艙的交互任務,也是能夠增加交互趣味性、傳遞情感的另一個自然交互方式。常用的手勢:單指滑動(上下左右)、雙指滑動(左右)、雙指點擊等[2]。但是手勢交互在駕駛場景中存在一定弊端:攝像頭和車載屏幕固定安裝的特性,需要結合車內攝像頭的安裝位置及性能,并配合HMI完成手勢交互的識別反饋;同時手勢交互中需要考慮不同車型,不同用戶行為的差異性,以便在交互中更加便捷高效[3]。手勢識別功能現階段比較單一,所以手勢識別技術更多地被汽車行業作為補充交互技術。
智能座艙眼控交互是利用眼動追蹤技術來監測駕駛員的視線方向和注視位置,駕駛員通過眼睛的運動與車輛的信息系統進行交互與控制。智能座艙利用車內攝像頭,獲取駕駛員眼部或面部圖像,然后用圖像處理算法實現眼部和面部圖像的檢測、定位與跟蹤,估算駕駛員的注視位置,從而使駕駛員無須物理接觸車輛設備即可傳達指令和接收反饋,提高交互的自然性和效率性。由于眼動追蹤技術比較復雜,在車載應用上還不成熟,其采樣率、精確度、抗干擾性及算法層面均存在一定缺陷。因此目前眼控追蹤技術在智能座艙人機交互中的應用還存在一定的局限性,使用功能比較簡單。隨著神經網絡與大模型技術的發展,眼控追蹤等生物技術將成為未來人機交互的重要發展方向。
智能座艙多屏交互現階段應用廣泛,大屏化和多屏化成為主流趨勢。智能座艙域控制器上設計2~6個屏幕,包括儀表屏、中控屏、副駕屏和后排屏等。多屏交互主要包括多屏互動、內容分享和遠程控制3種技術。多屏互動技術的特點是實現了智能座艙多個屏幕的聯動,通過連接不同位置的顯示屏,駕駛員可以在相應位置獲取所需的信息。駕駛員還可以通過觸控、語音識別、手勢識別等交互進行操作,從而實現了多屏信息的互動交流。
智能座艙除了可以同艙內多屏互動外,還可以通過有線或者無線的連接方式與移動端進行了內容分享及遠程控制。移動端生態的接入提升了智能座艙的娛樂性,并增強了用戶個性化定制功能。
單一模態的交互方式,在不同的場景下都有一定局限性,因此需要采用多模態融合的方式促進人機交互更加精準和流暢。多模態交互相融合應用場景如下。
語音交互場景:語音識別技術對“這個、那個”一類的模糊詞匯沒有識別能力,若加入眼控交互的眼動追蹤技術,鎖定駕駛員的視線方向,再通過語音識別技術發布指令,那么車輛的響應速度和準確性將得到顯著提升。
輔助駕駛場景:智能座艙通過語音識別、手勢識別、眼動追蹤等技術獲取感知數據,實現對車輛行駛速度、車道保持、疲勞監控等功能的輔助管控、提醒,從而減輕駕駛員的操作負擔,降低復雜環境引發的駕駛危險[4]。
座艙舒適場景:智能座艙通過觸控,眼動追蹤等技術獲取感知數據,依據駕駛員當前的心理狀態、行為需求自動調節氛圍燈、空調、座椅、車窗等,實現內部環境自動調節以提升駕駛員的舒適感。
隨著人工智能技術、通信技術的快速發展,智能座艙多模態交互技術的融合將更加密切化、智能化和個性化。
駕駛員在體驗智能座艙智能化、便捷化交互方式的同時,隱私數據和信息問題也必須得到重視。因此在設計上從以下重點方向實施。多層次(物理安全、網絡安全、應用安全)安全保護;對傳輸數據和存儲數據進行協議加密;采用多因素身份認證方式和權限管理;定期更新保證及時修復安全漏洞;對智能座艙運行日志進行記錄并監控,以便追溯和分析;遵循法律法規,防止用戶隱私數據濫用;制定應急和恢復機制。
智能座艙多模態交互技術在復雜環境中需要感知大量信息。感知方式如果不可靠則感知結果將包含大量無關甚至錯誤的信息。所以在車輛復雜運行場景中,智能座艙的環境適應性、長期穩定性、快速故障處理能力等問題與駕駛員的舒適體驗和人身安全都密切相關。智能座艙關鍵技術還需要進行大量嚴格的測試驗證和不斷的技術創新,關鍵技術的成熟度和可靠性是智能座艙持續、穩定運行的保障。
人工智能技術、多模態與大數據技術、5G/6G通信技術的快速發展,將為智能座艙多模態交互技術提供更加流暢、穩定、可靠的數據保障。汽車人機交互向多模態融合技術發展,覆蓋駕駛艙內所有人員的交互需求,更智能、更深度理解艙內人員的狀態,提供情緒、情感上的交互和撫慰。智能座艙提供身體及心理方面的健康監測,可以主動提供適合的音樂、氛圍燈和香氛。眼動追蹤技術將更深入算法的挖掘,在復雜路況和長時間駕駛的情況下,智能座艙主動提供輔助駕駛和安全提醒功能,并通過歷史交互數據定制化分析每一位駕駛員的行為偏好和需求[5]。
未來的智能座艙人機交互必將具備類人的多模態多感知等能力,越來越趨向于人與人之間的交互。
智能座艙人機交互通過集成先進的觸控技術、語音識別技術、手勢識別技術、眼動追蹤技術等,在人工智能、大數據及物聯網等技術的支持下,為駕駛員提供了更智能化、舒適化和個性化的車內環境。多模態交互技術的融合使人與車的交互更加自然、高效。雖然智能座艙多模態人機交互在智能汽車行業得到廣泛應用,但是汽車制造企業仍需認識到技術的不成熟,時刻保持嚴謹的設計理念,才能滿足用戶日益增長的高效、舒適、安全等需求。
參考文獻
[1]王偉偉,顧炎輝,余隋懷,等.智能座艙人機交互設計關鍵技術研究進展[J]. 機械設計,2024,41 (8):30-36.
[2]魏嘉焜,王家潤.手勢識別與交互綜述[J].計算機與現代化,2024(8):67-76.
[3]劉聰,朱蘭芹.基于多模態交互的汽車人機交互設計研究[J].汽車電器,2022(8):3-5.
[4]陳向斌.智能座艙多模態交互技術發展現狀及趨勢分析[J].汽車知識,2024,24(1):12-14.
[5]劉堯,李亞楠.智能座艙多模態交互技術發展現狀及趨勢[J].汽車實用技術,2023,48 (1):182-187.