亞馬遜Alexa、谷歌助手和蘋果Siri等消費者語音平臺的興起從根本上重塑了人們對語音交互的期望。這些在智能家居和個人設備中無處不在的平臺催生了對汽車中對話式直觀語音系統的需求,而免提交互已成為新車買家對安全性和便利性的期望。
語音識別成為汽車系統的一部分已有二十多年的歷史,從福特SYNC和梅賽德斯-奔馳Linguatronic等基于關鍵字的基本系統發展到我們今天看到的更先進的語音助手。早期的系統功能有限,命令結構僵化,無法處理自然語音,因此常常令用戶感到沮喪。
目前的系統采用先進的自動語音識別(ASR)和自然語言處理(NLP)技術,并由麥克風陣列提供支持,可以執行調整音量、撥打電話或更改音樂曲目等基本任務。然而,它們在處理復雜或上下文相關的命令時卻顯得力不從心,而且它們控制的系統通常在架構上是分離的,導致功能有限且運行不暢。
盡管車載語音助手的集成度不斷提高,但其使用率仍然相對較低,許多駕駛員在初次使用后就放棄了。挑戰在于如何縮小這些現有系統與駕駛員所期望的自然、直觀體驗之間的差距。
時至今日,車載語音技術正處于變革的邊緣。為OpenAI的ChatGPT和Google Gemini等系統提供支持的大型語言模型(LLM)的出現,正在推動從簡單的命令式系統向能夠理解上下文、管理復雜任務、學習消費者行為并預測用戶需求的智能語音助手的轉變。
先進的LLM可以實現多模式交互,將語音與文本、圖像和視頻相結合,以獲得更自然、更多樣化的用戶體驗。展望未來,語音將成為車載系統的主要界面,并通過其他模式的增強,大大改善用戶交互。
向軟件定義汽車(SDV)的轉變進一步推動了這一轉變,在SDV中,整個車輛的集成軟件(而不是孤立的硬件)決定了車輛的功能。在SDV中,語音成為控制信息娛樂、調整座艙設置、導航路線、查詢車輛健康狀況等的關鍵。隨著自動化水平的提高,特別是高級駕駛輔助系統第4級和第5級的出現,語音作為中央界面的應用將進一步加快。在完全自動駕駛汽車中,乘客將與語音助手互動,以管理娛樂、監測他們的健康狀況和管理商業活動,從而將汽車轉變為家庭的延伸。
然而,這種轉變也帶來了挑戰,特別是在邊緣計算和基于云的人工智能之間的爭論中。邊緣計算具有重要優勢,如減少延遲、降低帶寬要求,以及無需互聯網連接即可運行。它通過在本地處理命令來確保隱私和響應速度。
但是,由于實時人工智能處理需要強大的計算能力,因此將LLM集成到邊緣模型中會帶來挑戰。相反,基于云的人工智能(AI)可以訪問更大、最新的模型,但會帶來延遲、連接依賴性、持續訪問的訂閱成本以及數據隱私問題。
數據所有權是汽車制造商的另一個關鍵考慮因素。由于語音系統收集了大量用戶數據(包括偏好、駕駛習慣甚至情緒狀態),汽車制造商必須決定是將這些數據保留在內部還是與第三方平臺共享。通過控制這些數據,OEM廠商可以開辟新的收入來源,例如定向廣告或個性化服務,并更好地了解客戶行為和偏好,以創造更好的產品和服務,同時還能保護用戶隱私。
為了充分利用語音技術的潛力,汽車制造商應該掌握與基礎LLM的關系。通過將這些模型直接集成到其生態系統中,OEM廠商可以減少對第三方平臺的依賴,確保其系統保持獨特性并降低長期成本。
像Sensory這樣的供應商已經在倡導邊緣優先的語音AI解決方案,提供能夠處理車輛特定語音命令的嵌入式語言模型,并集成車主手冊和車輛狀態查詢等功能——同時在有連接的情況下,從基于云的LLM檢索動態和復雜的響應。這種混合方法可確保關鍵的控制和信息系統能夠離線運行,同時有選擇地利用云端獲取更廣泛的知識并執行車外的補充任務。
展望未來,語音技術將超越基本命令,成為車內體驗不可或缺的一部分。由LLM支持的智能語音助手將管理復雜的多層次任務,從個性化娛樂到健康監測和車載商務(圖1)。

圖1:汽車語音時間線。
隨著軟件定義自動駕駛汽車的普及,語音將在定義用戶體驗方面發揮關鍵作用。那些優先考慮集成語音解決方案(同時保持對數據、隱私和客戶參與的控制)的汽車制造商,將引領下一代汽車的發展,其中軟件和語音將成為定義移動未來的核心要素。
(原文刊登于EE Times美國版,參考鏈接:The Evolution of Voice in Automotive,由Franklin Zhao編譯。)
本文為《電子工程專輯》2025年4月刊雜志文章,版權所有,禁止轉載。免費雜志訂閱申請點擊這里。