
【摘要】傳統的人工測試用例設計已無法高效應對現代汽車軟件日益增長的復雜性,成為制約開發周期的主要瓶頸。為應對此挑戰,提出了一種基于大規模語言模型(LLM)的自動化測試用例生成方法。該方法的核心創新在于構建了一個多智能體框架,該框架集成提示工程與檢索增強生成(RAG)技術,通過與一個包含分層的、多源的領域向量知識庫體系進行動態交互,將高階自然語言需求精準地映射為具體的測試用例。試驗驗證表明,該方法能有效替代繁瑣的人工設計流程,顯著提升測試用例生成的效率與一致性,為實現汽車軟件質量保證的智能化提供了可擴展的解決方案,有力推動測試流程的自動化與標準化進程。
隨著汽車產業向智能化、電動化方向加速轉型,整車功能復雜度呈指數級增長,對測試驗證的覆蓋率與效率提出了更高的要求。據行業統計,傳統測試流程中約40%的開發周期消耗于測試用例設計與序列搭建環節,人工主導的方法不僅面臨高成本、低復用性的問題,難以覆蓋自動駕駛、車聯網等新興場景下的長尾需求。同時,深度學習在計算機視覺[1]、語音[2]、自然語言處理[3]等眾多領域取得了突破性的研究進展,AI 大模型正深刻賦能智能汽車產業全鏈條,從技術范式到產業應用均展現出革新潛力。小鵬汽車憑借端到端模型,成功實現全國無圖智駕,有效拓展了智能駕駛的應用范圍與邊界[4]。周海鷹等[5]指出,AI大模型經歷了從Transformer架構到多模態模型(如GPT-4)再到推理模型(如DeepSeek-R1)的演進,其“大力出奇跡”與“精算師策略”2 種技術路線分別以Grok 3 和DeepSeek 為代表,在參數規模、訓練成本和推理效率上形成差異化優勢,為智能駕駛、智慧座艙等場景提供多樣化技術支撐。傅平、鄧建明等[6,7]聚焦智能座艙多模態交互,提出了融合語音、視覺、手勢的協同處理架構、語音-視覺唇語識別協同、手勢-語音跨模態融合等算法。龔淑娟、曾小松等[8,9]強調DeepSeek 的開源生態與低成本優勢,其MoE 架構和數據蒸餾技術使訓練成本降至557.6 萬美元,已被吉利、東風等車企用于智能座艙主動交互、自動駕駛場景生成等任務,推動汽車全生命周期(研發、制造、服務)的效率提升。王全等[10,11]探索車聯網與自動駕駛仿真中的大模型應用,通過數字孿生網絡架構整合多源傳感器數據,結合大模型生成多樣化測試場景,顯著提升自動駕駛系統的泛化能力與測試覆蓋率。此外,大模型在汽車客服問答[12]、故障診斷[13]、監控圖像的視覺定位[14]等領域的應用,進一步驗證了其在提升交互自然性、診斷精準度和設備管理效率上的價值,而知識庫與大模型的融合[15]則為解決“幻覺”問題、增強輸出可信度提供了有效路徑。這些實踐成果充分彰顯了大模型在智能駕駛領域的巨大應用潛力與價值。
如何將大模型技術與領域知識深度融合,構建需求驅動的自動化測試生成框架,已成為學術界與工業界共同關注的焦點問題。當前,測試用例設計與序列生成技術主要存在2 類范式:人工驅動與規則驅動。在汽車測試領域,人工主導的測試設計仍占據主流地位,工程師需基于需求文檔手動編寫用例邏輯并編排執行序列。調研數據顯示,工程師完成單個需求的用例設計平均需要1 h,效率亟待提升。在自動化生成方向,現有研究主要圍繞規則引擎展開。盡管規則驅動方法可通過預設邏輯模板保障用例的結構化輸出,但其依賴領域專家手工構建規則庫,面臨動態需求適配性差、維護成本高等瓶頸。
近年來,大模型技術開始應用于代碼生成與測試領域,例如微軟研究院提出的Codex-API 可通過自然語言描述生成API 測試腳本。然而,現有研究多集中于通用軟件測試場景,針對汽車領域適配能力不足,且缺乏對領域知識庫的系統化融合機制,導致生成用例的可靠性與場景覆蓋率受限。為應對上述挑戰,本文旨在設計并實現一個基于多智能體協同與知識增強的大語言模型汽車測試生成系統。核心研究目標是模擬并賦能大語言模型具備資深測試工程師的思維鏈與專業能力,實現從原始需求到可執行測試用例的全流程自動化生成。
本研究的技術路徑獨辟蹊徑,規避了依賴海量標注數據集進行監督式微調(Supervised Fine-Tuning,SFT)或大規模參數訓練的高昂成本,轉而聚焦于提示工程(Prompt Engineering)與檢索增強生成(Retrieval-Augmented Generation, RAG)2大核心技術。本系統采用多智能體(Multi-Agent)協作架構,通過對測試專家工作流的深度解構,設計了職責明確、相互協作的智能體工作流。該工作流整合了一個由領域專家構建的多源異構知識庫,系統性地引導大語言模型完成以下認知與生成任務:(1)需求分析與測試點提?。壕珳式馕龉δ芤幏段臋n,自動識別和梳理核心測試點。(2)測試方法論應用:學習并運用等價類劃分法、邊界值分析法、改進的條件/判定覆蓋(Modified Condition/Decision Coverage,MCDC)等經典測試設計方法,進行測試矩陣的系統性泛化。(3)測試場景構建與步驟編排:從知識庫中檢索并推理生成符合邏輯的、具體的測試場景及操作步驟。(4)參數化可執行用例生成:最終輸出結構化、帶參數、可直接被自動化測試框架執行的測試用例。
本文的主要貢獻可歸納為以下3點:(1)提出了一種面向汽車測試領域的多智能體協作框架。該框架將復雜的測試生成任務解耦為多個子任務,由不同智能體分工協作,有效提升了任務執行的邏輯性和生成結果的可靠性。(2)設計了一套知識庫增強的輕量級大模型能力引導方案。通過融合提示工程與檢索增強生成技術,在不進行模型微調的前提下,實現了大模型與汽車領域專業知識的深度融合,顯著提升了生成用例的專業性和場景覆蓋率。(3)驗證了利用大模型實現端到端自動化測試生成的可行性。本研究為解決汽車行業日益嚴峻的測試挑戰提供了一種低成本、高效率、高智能的創新解決方案,具有重要的理論研究價值和廣闊的產業應用前景。
本文提出的智能測試用例生成系統,旨在構建一個連接自然語言需求與標準化測試用例的自動化橋梁,其核心是基于大語言模型(Large Language Model, LLM)的智能生成引擎。為確保系統的高可用性、可擴展性與可維護性,整體架構遵循微服務(Microservices)、前后端分離以及分層設計的核心原則,構建了一個高內聚、低耦合的軟件系統。
系統采用標準的分層架構,并結合了面向服務的思想,具體劃分為表示層、應用服務層,核心引擎層、模型層和數據層,如圖1所示。

圖1 系統體系架構
表示層:作為人機交互的入口,表示層基于B/S(Browser/Server)架構,為用戶提供一個直觀、易用的Web 應用界面。用戶通過瀏覽器訪問該界面,可執行功能規范文檔的導入、結構化需求的管理以及測試用例生成任務的觸發與監控。
應用服務層:該層是系統的業務邏輯核心,承載了系統的主要業務功能。它通過一系列微服務對外提供符合RESTful(Representational State Transfer)風格的API 接口,實現了與表示層的解耦。此層負責處理所有與業務實體相關的操作。
核心引擎層:這是系統智能化的關鍵所在,負責執行計算密集型和邏輯復雜的測試用例生成任務。該層以多智能體(Multi-Agent)系統為核心,負責編排復雜的測試用例生成工作流,調度下層資源完成智能計算任務。
模型層:封裝了系統所需的核心人工智能模型,提供標準化的模型即服務接口。主要包括:大語言模型、嵌入模型、重排序模型。
數據層:采用了異構數據存儲策略,以滿足不同業務場景下的性能與功能需求。主要包括:關系型數據庫、高性能緩存以及向量數據庫。
為實現模塊化開發與獨立部署,系統被拆分為一系列職責明確的微服務模塊,主要包括:
用戶與權限管理模塊:負責用戶的身份認證、會話管理以及基于角色的訪問控制(Role-Based Access Control, RBAC)。
需求生命周期管理模塊:支持功能規范文檔(如Word格式)的自動解析、結構化需求條目的生成、版本控制以及狀態追蹤。
測試用例管理模塊:負責對生成的測試用例進行存儲、版本管理、查詢檢索以及與測試執行平臺的對接。
知識庫管理模塊:提供對系統所需領域知識的統一管理接口,包括對向量數據庫和關系型數據庫的增、刪、改、查操作。
多智能體協同模塊:系統的“大腦”,負責接收生成任務、編排智能體工作流、調度LLM 與知識庫資源,并最終完成測試用例的生成。
基礎設施與支撐服務:
(1)大語言模型接口服務:封裝了對不同大語言模型(如DeepSeek 等)API 的調用,提供統一、穩定的模型訪問接口。
(2)消息中間件:采用如RabbitMQ 或Kafka 等組件,實現模塊間的異步通信與任務削峰填谷,是實現任務隊列的核心。
(3)任務調度服務:消費消息隊列中的任務,根據預設策略(如優先級、輪詢)對任務進行調度,并將任務分派至多智能體協同模塊。
(4)持久化存儲:包括用于存儲結構化業務數據的關系型數據庫(如MySQL)、用于支撐語義檢索的向量數據庫(如Milvus),以及用于存儲原始文檔的對象存儲服務(如MinIO)。
本系統的核心工作流程是一個由事件驅動的、貫穿多模塊的閉環,其關鍵技術與數據流如下:
(1)解析與任務創建:用戶在表示層上傳功能規范文檔。應用服務層的需求管理模塊調用文檔解析引擎,將非結構化的文本內容轉換為結構化的需求條目,并持久化至關系型數據庫。當用戶針對某一需求條目或多條需求條目發起生成指令時,系統將創建一個測試用例生成任務,并將其封裝為消息投遞至消息中間件。
(2)任務調度與分派:任務調度服務作為消息隊列的消費者,持續監聽并獲取待處理任務。該服務根據系統負載和任務優先級,通過RESTful API 調用核心引擎層的多智能體協同模塊,正式啟動生成流程。
(3)智能體協作與知識增強生成:這是本系統的技術創新核心。多智能體協同模塊接收到任務后,將啟動預定義的智能體協作工作流(Agent Workflow)。該工作流通過以下方式與底層技術組件交互:
a. 調用LLM 接口服務,利用大語言模型的自然語言理解與推理能力對需求進行深度分析。
b. 執行混合式知識檢索,通過對向量知識庫發起語義相似度查詢,檢索相關的專業知識。通過檢索增強生成(RAG)機制,將檢索到的領域知識與精心設計的提示(Prompt)相結合,引導大語言模型逐步完成測試點提取、測試方法應用、測試步驟編排等一系列復雜的認知任務。
(4)持久化與反饋:生成的標準化、參數化測試用例,經由應用服務層的測試用例管理模塊進行結構化校驗后,存入數據庫。用戶可在表示層界面查閱、評審和管理最終生成的測試用例,從而形成從需求到測試的完整自動化閉環。
大語言模型通過大規模語料預訓練獲得通用語言理解能力,但其任務特定性能需通過提示工程(Prompt Engineering)進行激發。主流方法包括指令式提示與思維鏈提示2類范式,如圖2所示。

圖2 提示樣例對比
2.1.1 指令式提示
基于自然語言指令的任務引導技術,其核心是通過結構化輸入調控模型行為。OpenAI 在GPT-3[16]中提出的上下文提示(In-Context Prompting)證實了該技術在少樣本學習(Few-Shot Learning)中的有效性,主要實現形式包括:
(1)少樣本提示(Few-Shot Prompting):通過任務示例引導模型進行模式歸納。
(2)零樣本提示(Zero-Shot Prompting):依賴精確的語義描述實現任務遷移。
(3)情境學習(In-Context Learning,ICL):通過上下文嵌入實現參數不可知(Parameter-Agnostic)的泛化,其效能受示例表征、上下文一致性及驗證機制影響。
2.1.2 思維鏈提示
鏈式推理(Chain-of-Thought,CoT)[17,18]通過顯式建模推理路徑提升復雜任務性能。該技術將傳統端到端映射轉化為多步推理(Multi-Step Reasoning)過程,兼具可解釋性增強與邏輯一致性提升的雙重優勢。
本研究基于RagFlow 框架構建了知識增強問答系統,系統通過集成化前端支持PDF/Word/Excel 等非結構化文檔的一鍵導入,并選用bge-m3 嵌入模型進行文本向量化,以Elasticsearch 作為向量存儲引擎構建語義索引。
為優化檢索效果,系統采用2階段檢索策略:首先基于稠密檢索進行初步召回,再通過bge-rerankerlarge 重排序模型(融合雙塔架構和交叉編碼器技術)提升結果相關性。最終由DeepSeek LLM 生成引擎完成上下文理解、知識抽取與語義整合,輸出結構化專業回答。
該設計在保證系統易用性的同時,有效提升了垂直領域問答的準確性和專業性。
該機制有效緩解了幻覺問題,提升了生成結果的可信度(Credibility)與領域適應性(Domain Adaptability),系統架構如圖3所示。

圖3 RAG工作原理
智能體技術是一種基于感知-決策-行動(Perception-Decision-Action)閉環的自主計算范式,旨在實現對動態環境的持續適應與任務優化。在處理復雜任務(如功能規范到測試用例的自動生成)時,單一智能體面臨能力邊界限制,需采用多智能體系統架構。通過多個智能體之間的協同合作與交互,能夠更好地將高階自然語言需求轉化為具體、可操作的測試用例,增強了系統對復雜測試場景的處理能力與適應性 。
本文選用LangGraph 作為多智能體框架,其優勢在于支持靈活的智能體編排和復雜任務流程管理。底層集成LangChain 框架,提供統一的提示詞構建、語言模型調用和上下文數據管理接口。該架構有效連接大語言模型與外部工具鏈,通過優化提示模板、響應處理和緩存機制,顯著提升系統在復雜任務中的響應能力和可復用性。
在構建用例生成的大語言模型系統過程中,基礎模型的選型策略主要圍繞開源模型與閉源模型2大類別展開權衡分析。開源模型(如 DeepSeek、BERT、LLaMA)具有開放性強、可定制化程度高等優勢,適用于高度可控與可擴展的應用場景。然而,開源模型通常在持續維護與性能優化方面對研發團隊提出更高的技術要求,例如模型部署、版本兼容性處理及算力資源投入,整體技術管理復雜度較高。
相較而言,閉源模型(如GPT 系列、Claude 等)具備商用成熟度高、服務穩定性強及官方技術支持完善等優勢,能夠在系統穩定性和快速迭代方面提供更優保障。但其源碼不公開,存在使用成本高、定制靈活性差以及數據安全性不透明等問題,尤其在涉及敏感數據方面,其數據隱私風險成為重要制約因素。
綜合考慮汽車測試行業對模型安全性與可控性的高要求,以及對模型性能的多維度評估指標(包括模型參數規模、推理能力、Token 上下限、中文語義處理能力等),最終選定DeepSeek-V3 與DeepSeek-R1開源模型作為本系統的基礎模型。此外,為最大化模型的計算精度和避免量化可能引發的性能衰減,本文決定部署其未經量化[20-22]的全精度版本。主流開源模型的能力對比詳見表1。
表1 開源大模型能力對比

3.2.1 數據輸入
本系統接收的輸入為功能規范文檔,文檔格式為Microsoft Word(.docx)。其中,每一條用例(Use Case,UC)均由若干結構化屬性構成,具體包括:UC名稱、功能說明、前置條件、后置條件、基本路徑(主流程)、備選路徑、異常路徑及承接需求等信息。在這些屬性中,UC 名稱、功能說明、前置條件、基本路徑及后置條件為必填項,用于確保用例具備最小可執行語義和完整的功能描述。其他屬性(如備選路徑與異常路徑)可根據用例復雜度和業務覆蓋要求進行補充,體現系統在不同操作情境下的行為分支和異常處理邏輯。
例如,智能駕駛領域中高級巡航功能(Super Adaptive Cruise Control,SACC)中跟車巡航至定速巡航的輸入數據表2所示。
表2 SACC跟車巡航至定速巡航輸入數據

3.2.2 需求分析多智能體模塊
本模塊旨在對功能規范文檔中的用例(Use Case,UC)信息進行系統化解析與結構化重構。輸入數據為功能規范文檔中每一條用例項,輸出結果為具備前置條件、場景路徑與后置條件三元要素的結構化需求項。
為實現復雜需求的高質量解析與多角度處理,系統引入多智能體協作機制,主要包含以下5 類智能體組件:基礎需求分析智能體、承接需求拆解智能體、補充需求分析整理智能體、擴展需求分析智能體與需求審核智能體。各智能體間通過有序工作流協同處理,具體流程如圖4所示。

圖4 需求分析多智能體工作流
(1)基礎需求分析智能體
該智能體負責對功能規范中基本路徑(主流程)、備選路徑與異常路徑3 類典型場景進行初步分析,并生成標準結構的三元組需求。
基本路徑需求的抽取方式為:基于UC 中的前置條件、基本路徑與后置條件,直接轉換為結構化表達。
備選路徑需求分析則基于前置條件、備選路徑和后置條件進行處理;若存在多條備選路徑,則分別拆解為多條獨立需求條目。
異常路徑需求處理基于前置條件與異常路徑內容,結合異常處理邏輯推理可能的后置條件,從而生成完備的異常情境需求。
(2)承接需求拆解智能體
該智能體聚焦于UC 中涉及承接關系的子需求,主要功能包括:
a. 分析承接子需求之間的邏輯關系,如互為補充或存在潛在沖突,如果互為補充則合并到一起,如果存在沖突則拆分成2個需求。
b. 基于語義關聯與功能分工,重新組織承接內容。
c. 按照語義粒度和功能完整性,將原始的復合需求細化為結構清晰的條目化子需求,提升后續處理的準確性。
(3)補充需求分析整理智能體
該智能體負責將條目化子需求與基礎需求內容進行比對與整合,其分析機制可分為3類典型情形:
情況1:具體化需求。若子需求內容為對基礎需求中某一操作步驟的進一步細化,則直接用于替換該步驟,增強描述精度。
情況2:補充型需求。若子需求提供的是對基礎路徑某部分信息的補充,則合并為擴展后的基礎需求。
情況3:無直接關聯。若當前子需求無法與任一基礎需求建立明確關聯,則判定為新增擴展需求,交由擴展需求分析智能體進一步處理。
上述情況1 與情況2 的處理結果將作為補充后的條目化需求輸出,統一納入結構化管理。
(4)擴展需求分析智能體
擴展需求分析智能體主要用于處理在補充分析階段中被識別為獨立性強、無法歸屬現有基礎需求的新增功能項。該類需求通常不具備顯式的上下文依賴關系,需被視為系統功能域的拓展內容,進行獨立建模與結構化表達。
智能體在處理此類擴展性需求時,遵循如下語義解析策略:
a. 前置條件提?。和ㄟ^識別需求描述中與功能狀態、系統配置、外部環境或目標對象相關的語句,將其歸納為觸發該需求所必需的功能前提或初始狀態條件。
b. 場景路徑抽?。横槍γ枋鲋械膱绦胁襟E、操作行為或系統響應過程,進行順序化解析,重構為符合語義邏輯的場景路徑(執行主流程)。
c. 后置條件歸納:對結果性表達或行為結果的語義內容進行歸納提煉,標注為該功能執行后的系統狀態或輸出結果,作為后置條件的結構化表述。
通過上述3 階段抽取過程,擴展需求分析智能體可將原始的非結構化或半結構化功能描述,轉化為標準的結構化功能需求三元組。
(5)需求審核智能體
本智能體對所有生成的結構化需求進行質量控制與一致性審查,審核流程包括以下3個方面:
a. 冗余性檢測:識別并刪除語義重復或功能重疊的需求項。
b. 格式規范性審查:確保所有需求表述符合系統預設的格式規范與表達標準。
c. 信息合并:若不同需求項中的場景信息或后置條件存在高度重合,則進行歸并整合,避免信息冗余。
通過上述多智能體協同處理流程,系統可高效完成對復雜功能規范的分層解析、邏輯重組與結構化表達,為后續如測試矩陣生成等下游任務提供高質量的輸入數據支撐。
例如,利用需求分析多智能體模塊對圖4 中智能駕駛中的SACC 跟車巡航至定速巡航進行需求分析,得到需求分析結果如下:
R1:前置條件:ACC為激活狀態;場景:(1)本車跟隨前方目標車行駛;(2)前方目標車加速至大于本車巡航車速;(3)ACC 系統控制本車以設定的巡航車速行駛;后置條件:駕駛員獲知車輛以設定的巡航車速行駛。
R2:前置條件:ACC為激活狀態;場景:(1)本車跟隨前方目標車行駛;(2)前方目標車切出;(3)ACC 系統控制本車以設定的巡航車速行駛;后置條件:駕駛員獲知車輛以設定的巡航車速行駛。
R3:前置條件:ACC 為激活狀態;場景:跟車行駛過程中,目標車速度低于18 km/h 以下,如果目標車輛突然消失;后置條件:ACC 功能退出,且不應該有突然地制動力釋放。
3.2.3 矩陣分析多智能體模塊
矩陣分析模塊是測試用例自動生成系統的核心組件之一,該模塊采用系統化的變量分析方法,運用等價類劃分法、邊界值分析法以及修正條件/判定覆蓋(MCDC)算法對需求進行系統性泛化處理,最終生成包含全部測試信息點的綜合測試矩陣,為后續測試用例生成提供結構化的數據基礎。
基于多智能體系統(Multi-Agent System, MAS)架構,矩陣分析模塊集成了4個功能專一的智能體組件,通過協同工作實現復雜需求的系統化分析處理,工作流程如圖5所示。

圖5 矩陣分析智能體工作流
(1)變量及取值分析智能體
該智能體承擔需求文檔中變量識別與取值域分析的核心任務。通過集成變量知識庫、通信矩陣DBC 知識庫,該智能體能夠精確識別和提取需求描述中的關鍵變量及其對應的取值范圍,并按照標準化格式輸出結構化的變量-取值(真假值)映射關系:變量A:取值1(T1),取值2(T2),變量B:取值1(T1),取值2(F1)。
變量提取遵循以下形式化規則體系:
a. 操作類變量識別規則:將需求文檔中的具體操作描述、系統控制指令、系統識別行為統一標識為可操作變量。
b. 場景類變量識別規則:對場景描述性要素,包括但不限于道路幾何參數,地形特征(上坡、下坡等)進行變量化抽象。
c. 數值型變量處理策略:基于邊界值分析法對連續型數值變量進行離散化處理,補充邊界值、臨界值及其鄰域取值。
d. 枚舉型變量處理策略:對離散型枚舉變量進行完整性分析,確保涵蓋所有可能的枚舉取值。
e. 真值標記機制:對所有提取的變量取值進行二元真值標記,邊界值變量的有效范圍內取值標記為真值(T),超出范圍取值標記為假值(F);枚舉變量中需求明確提及的取值標記為真值,未明確提及的取值標記為假值。
(2)布爾表達式分析智能體
該智能體專門負責分析變量間的邏輯依賴關系,基于需求語義描述和變量及取值分析智能體的輸出結果,構建變量間的邏輯運算關系模型,生成標準化的布爾表達式,如:A and B and C。
布爾表達式構建遵循以下規范化準則:
a. 分層邏輯建模:分別針對前置條件中的變量集合和應用場景中的變量集合建立獨立的邏輯關系布爾表達式;
b. 邏輯關系整合:將前置條件布爾表達式和場景布爾表達式進行邏輯合并,兩者之間采用邏輯與(AND)關系進行連接,形成完整的復合布爾表達式。需分別對前置條件中變量和場景中的變量建立邏輯關系的布爾表達式。
(3)真值表分析智能體
該智能體基于MCDC 測試覆蓋準則的理論基礎,結合布爾表達式分析智能體輸出的邏輯表達式和變量取值的真值屬性,采用系統化的組合分析方法生成優化的變量取值組合方案。輸出結果以標準Markdown格式的真值表形式呈現,如表3所示。在保證測試覆蓋率的前提下,通過智能化的用例約簡算法最小化測試用例數量,實現對所有測試條件的完全覆蓋。
表3 真值表輸出示例

(4)測試矩陣生成智能體
該智能體作為矩陣分析模塊的輸出接口,負責將抽象的真值表轉換為具體的測試矩陣。通過語義替換算法,將真值表中每組變量取值按照其在原始需求中的語義位置進行精確替換,生成語義連貫、邏輯完整的自然語言描述,最終構建結構化的測試矩陣,為測試用例的自動化生成提供直接的數據輸入。
例如,利用矩陣分析多智能體模塊對上一步得到的智能駕駛SACC 跟車巡航至定速巡航的第一條需求分析結果進行矩陣生成,得到泛化后的測試矩陣結果為:
TC1:前置條件:ACC 為激活狀態,本車巡航車速為40 km/h;場景:本車跟隨前方目標車行駛,前方目標車加速至43 km/h;后置條件:ACC 系統控制本車以40 km/h行駛。
TC2:前置條件:ACC 為激活狀態,本車巡航車速為60 km/h;場景:本車跟隨前方目標車行駛,前方目標車加速至63 km/h;后置條件:ACC 系統控制本車以60 km/h行駛。
TC3:前置條件:ACC 為激活狀態,本車巡航車速為90 km/h;場景:本車跟隨前方目標車行駛,前方目標車加速至93 km/h;后置條件:ACC 系統控制本車以90 km/h行駛。
TC4:前置條件:ACC 為激活狀態,本車巡航車速為110 km/h;場景:本車跟隨前方目標車行駛,前方目標車加速至113 km/h;后置條件:ACC 系統控制本車以110 km/h行駛。
3.2.4 場景坐標提取多智能體模塊
場景坐標提取模塊的核心職責是對測試用例矩陣中包含的自然語言場景描述進行解析,通過與場景坐標知識庫進行檢索與匹配,從而獲取并嵌入精確的地圖坐標。
該模塊的實現基于雙智能體架構,由場景分析智能體與場景坐標匹配智能體2 個核心功能單元構成,二者協同工作以完成坐標提取任務。
(1)場景分析智能體
該智能體專注于對輸入測試用例矩陣中的場景描述文本進行深度解析與結構化處理。其主要任務包括:
a. 場景要素提?。簭奈谋久枋鲋凶R別并提取關鍵的場景構成要素,例如道路類型(如直道、彎道、十字路口)、車道線類型、車道線顏色等。
b. 核心場景判定:當描述中包含多個場景要素時,智能體根據預設的優先級規則或模型判斷,綜合分析并確定一個核心測試場景。
c. 結構化輸出:將解析與判定的結果封裝為統一的JSON 格式。這種結構化數據格式便于后續模塊進行程序化處理。
為保證系統的魯棒性,在場景描述信息缺失或不明確的情況下,該智能體將默認場景設定為標準化的“直道”場景,并生成相應的JSON對象。
(2)場景坐標匹配智能體
該智能體負責將前一階段生成的場景結構化信息與場景坐標知識庫進行高效匹配,并將最優坐標嵌入原始測試用例矩陣。其工作流程如圖6所示。

圖6 場景坐標智能體工作流
首先,智能體接收場景分析智能體輸出的JSON對象。隨后,利用向量檢索技術,在場景坐標知識庫中進行相似度查詢,以檢索出多個相近的場景及其預設坐標。
為了精確地將坐標嵌入矩陣,該智能體遵循以下決策邏輯:
匹配成功:將檢索到的坐標場景與原始描述進行匹配,若有高度匹配的場景,則將該坐標(X,Y,Z,Heading)集成到測試用例矩陣中。
匹配失?。喝魴z索到的坐標場景與原始描述存在邏輯沖突或不符,系統將采用默認策略,使用預設的“直道”場景坐標。
初始描述缺失:若原始矩陣中完全不包含場景描述,則直接應用默認的“直道”場景坐標。
該智能體的最終輸出是已增補場景坐標信息的完整測試用例矩陣,可直接用于后續的仿真測試執行環節。
利用場景坐標提取多智能體模塊對上一步得到的智能駕駛SACC 跟車巡航至定速巡航的測試矩陣結果進行場景坐標提取,得到帶場景坐標的的測試矩陣結果為:
TC1:設置本車初始位置:車輛在直道的道路上行駛,坐標:X=100;Y=-5.625;Z=0;Heading=0,ACC 為激活狀態,本車巡航車速為40 km/h,本車跟隨前方目標車行駛,前方目標車加速至43 km/h,ACC 系統控制本車以40 km/h行駛。
TC2:設置本車初始位置:車輛在直道的道路上行駛,坐標:X=100;Y=-5.625;Z=0;Heading=0,ACC 為激活狀態,本車巡航車速為60 km/h,本車跟隨前方目標車行駛,前方目標車加速至63 km/h,ACC 系統控制本車以60 km/h行駛。
TC3:設置本車初始位置:車輛在直道的道路上行駛,坐標:X=100;Y=-5.625;Z=0;Heading=0,ACC 為激活狀態,本車巡航車速為90 km/h,本車跟隨前方目標車行駛,前方目標車加速至93 km/h,ACC 系統控制本車以90 km/h行駛。
TC4:設置本車初始位置:車輛在直道的道路上行駛,坐標:X=100;Y=-5.625;Z=0;Heading=0,ACC 為激活狀態,本車巡航車速為110 km/h,本車跟隨前方目標車行駛,前方目標車加速至113 km/h,ACC 系統控制本車以110 km/h行駛。
3.2.5 測試用例生成多智能體模塊
測試用例生成模塊是本自動化測試用例生成系統的終端處理組件。其核心職能是接收并解析上游模塊輸出的測試矩陣,通過一系列精細化的處理流程,自動化地構建結構化、可執行的測試用例。此過程不僅包括生成詳細的測試步驟、定義前置條件與后置條件,還涵蓋了對用例名稱、描述、優先級等關鍵元數據屬性的生成與規范化。
為實現上述功能,本模塊遵循系統的整體設計范式,采用多智能體系統架構。該系統由五個功能專門化且相互協作的智能體構成,分別是:測試框架規整智能體、測試步驟參數化智能體、變量映射與校驗智能體、測試用例實例化智能體和測試用例元數據補全智能體。其工作流程如圖7所示。

圖7 測試用例生成智能體工作流
(1)測試框架整理智能體
該智能體的核心任務是將原始測試矩陣轉化為結構化、標準化的測試步驟框架。它通過訪問測試用例領域知識庫,對矩陣中的每一個步驟進行審查與處理,主要執行2種操作:
步驟補全:針對語義不完整的步驟,依據知識庫中的先驗知識,自動補充必要的上下文或前提操作。例如,對于“本車跟隨前方目標車”這一高級別指令,智能體將補充“1. 創建目標車輛;2. 設定其相對位置與距離;3. 設定目標車期望速度”等一系列具體的前置操作。
步驟分解:針對包含多個操作的復合步驟,將其拆分為粒度更細的原子化操作,以確保測試步驟的單一職責性與可執行性。例如,將“控制橫向和縱向距離”分解為“1. 控制橫向距離”和“2. 控制縱向距離”2個獨立的步驟。
(2)測試步驟分析智能體
該智能體負責對規整后的測試步驟框架進行深度解析,賦予每個步驟具體的變量和數值,將其轉化為參數化的指令。其工作流程如下:測試步驟分析流程如下:
步驟意圖識別:智能體首先判定每個步驟的操作意圖。基于原始需求文檔,明確定義前置條件中的步驟為“設置操作”,后置條件中的步驟為“檢測操作”。對于場景描述中的步驟,則利用大型語言模型(LLM)進行語義分析以確定其意圖。例如,“系統提示”、“屏幕顯示”被識別為“檢測操作”;而“車速為10 km/h”、“擋位為D檔”則被識別為“設置操作”。
基于知識庫的改寫:智能體查詢知識庫,對存在預定義模式的步驟進行標準化改寫,以符合測試執行軟件規范。
參數化變量生成:對于知識庫中無匹配項的步驟,智能體通過自然語言處理技術提取核心動作與對象,并結合測試矩陣的具體描述生成變量及賦值。為保證一致性,新生成的變量遵循統一命名規約:設置類操作的變量以“ Set”為前綴,檢測類操作的變量以“ Check”為前綴。
經過此階段,每個測試步驟均被轉化為“操作類型(設置/檢測)+核心描述+變量=賦值”的標準化格式,初步完成了從抽象框架到具體測試步驟的轉換。
(3)變量分析智能體
此智能體的功能是對前一階段生成的參數化步驟進行校驗和優化,核心目標是將臨時生成的變量(Set*和Check*)精確映射到系統級的標準變量上。該過程依賴于一個專門的系統變量知識庫。其工作流程為:
變量篩選:智能體首先識別并提取所有包含臨時變量(以“ Set/Check”為前綴)的測試步驟。
語義匹配與映射:對每個臨時變量,智能體利用其核心描述在變量知識庫中進行語義相似度檢索。當相似度超過預設閾值時,便將該臨時變量替換為知識庫中匹配的標準變量(例如,將Set_車速替換為Vehicle_Speed)。
取值校驗與修正:變量映射成功后,智能體將根據標準變量的類型、取值范圍和單位等屬性,對原步驟中的賦值進行校驗或修正,確保其合法性和準確性。
(4)具體用例分析智能體
該智能體負責基于已形成的測試用例模板進行批量化生成。前序智能體已針對測試矩陣中的一個典型邏輯組合(通常是第一條矩陣),構建了一個包含標準步驟、標準變量和具體取值的完整用例模板。由于同一需求下的不同測試矩陣行共享相同的測試步驟架構,僅在參數取值上存在差異,因此本智能體的任務是:將該用例模板作為藍本,遍歷測試矩陣中泛化出的其余所有矩陣,并將每一條矩陣對應的參數值填充到模板的相應變量中,從而快速、一致地實例化出該需求下的全部具體測試用例。
(5)測試用例元數據補全智能體
作為流程的最后一步,該智能體負責為已生成的測試用例集合補全所有必要的元數據屬性,使其成為一份格式完整、信息全面的正式測試用例。其主要任務包括:
a. 前置條件:基于一個存儲了各功能域通用設置的數據庫,智能體根據當前用例所屬的領域,自動檢索并填充標準化的前置條件。
b. 后置條件:智能體利用大型語言模型(LLM),綜合分析用例的前置條件與核心測試步驟,利用規則引擎和模型推理自動推導生成,確保測試環境恢復到預期狀態。
c. 優先級:依據預設的風險或嚴重性評估模型,對用例進行分析,自動評定其“高”、“中”、“低”等優先級。
d. 描述:對原始需求文本進行自動摘要,生成簡潔、準確的測試用例目的描述。
e. 用例名稱:基于需求摘要或核心測試目標,自動生成具有唯一性和描述性的測試用例標識符。
最終,該智能體將所有結構化信息(步驟、變量、元數據)整合,封裝成符合特定標準JSON 格式、可直接導入測試管理系統的用例管理模塊。
例如,利用測試用例生成多智能體模塊對上一步得到的智能駕駛SACC 跟車巡航至定速巡航的帶場景坐標的測試矩陣結果進行用例生成,得到用例生成結果如表3所示(僅展示部分用例生成結果)。
表3 跟車巡航至定速巡航用例生成部分結果

為支持基于大模型的測試用例自動化生成,本項目構建了一個分層的、多源的領域知識庫體系。該體系以向量化形式存儲,為大模型提供精確、完備且上下文相關的領域知識,從而克服大模型內部知識的局限性,提升生成測試用例的準確性、完整性和專業性。本知識庫體系由以下4個核心子庫構成:
(1)系統變量知識庫
該知識庫由資深測試工程師依據功能規范、數據字典和接口控制文件系統性地整理與構建。其核心目的在于為測試用例的實例化提供基礎數據元素的精確定義。
庫中收錄了被測系統的所有關鍵可配置參數和狀態變量。每個條目均包含變量的標識符、注釋、數據類型、物理單位、有效取值范圍、默認值以及功能描述。
在測試用例生成過程中,當模型需要具體數值來定義測試場景的初始條件或動態過程時,可通過對該庫的語義檢索,獲取準確的變量信息及其約束,確保生成的參數組合符合系統設計規范。
(2)通訊矩陣知識庫
該知識庫是對系統變量庫的結構化補充,主要依據車載網絡通信協議進行構建。其目的在于解決系統變量庫中信息孤島問題,顯式地定義系統內部及系統間的信號交互關系。
本庫以結構化數據(JSON)描述了不同電子控制單元之間的報文收發關系、信號(Signal)在報文中的布局(Layout),以及信號與系統功能之間的邏輯映射。
(3)矩陣生成經驗庫
該知識庫由測試專家根據行業標準、法規要求及豐富的測試經驗提煉而成。其主要目標是解決需求描述中存在的量化模糊性問題,實現從定性描述到定量參數的映射,從而支持測試場景的泛化與擴展。
該庫存儲了一系列“條件-約束”或“場景-參數”的經驗映射規則。這些規則將高級、抽象的場景描述具體化。
示例:當需求描述為“車輛以彎道允許的最大速度進行巡航行駛”時,知識庫能夠提供具體的參數化補充信息:彎道半徑為500 m時,對應速度限制為114 km/h;彎道半徑為250 m 時,對應速度限制為86 km/h;彎道半徑為125 m時,對應速度限制為61 km/h。
在進行矩陣生成或場景泛化時,模型可以檢索此庫,將需求中的模糊表述(如“最大速度”)轉化為符合物理規律和工程實踐的具體數值,從而生成一系列覆蓋不同邊界條件的有效測試用例。
(4)測試用例生成經驗庫
該知識庫同樣由測試專家主導構建,旨在彌合高級自然語言需求與底層、形式化的測試執行步驟之間的語義鴻溝。它專注于補充和固化需求描述中通常被省略的、但對于測試執行至關重要的隱性操作流程。
本庫存儲了將高級功能需求分解為一系列原子化、有序的測試操作流程,為自動化用例生成提供模板化的步驟指導。
以“本車處于跟車狀態”的需求描述為例,知識庫能夠自動補充完整的測試步驟序列:
第1步:創建前方目標車輛實例。
第2 步:設置前方目標車相對位置和相對速度參數。
第3步:配置前方目標車期望速度值。
第4步:執行跟車狀態檢測算法。
第5步:驗證與前車距離的合規性。
當模型接收到一個高級需求時,它可以通過檢索此庫找到對應的操作模板,從而將抽象任務分解為具體、可執行的測試步驟序列。這極大地提升了生成測試用例的可操作性和自動化執行的可行性。
本次研究針對100項智能駕駛系統需求開展了測試用例生成與評估工作。研究結果表明,總計生成的2 981 條測試用例,在經過資深測試工程師評價與實際測試驗證后,展現出良好的覆蓋度與有效性。
在需求覆蓋度方面,正向測試用例實現了對全部100 項需求的100%覆蓋。負向(或異常場景)測試用例的覆蓋率為95%,有5項需求尚待補充負向用例。
在用例有效性方面,在所有生成的用例中,2 534條用例被確認為邏輯正確且技術上可執行,用例有效率達到85%(2 534/2 981)。
在人機協同的優化路徑方面,盡管系統實現了高度自動化,但分析剩余的偏差案例發現,其主要歸因于深度領域知識的隱性約束以及自然語言表達的潛在歧義。因此,引入“人機協同”(Human-in-the-Loop, HIL)工作流是實現更高準確率的關鍵。在該模式下,測試工程師的專業審核不僅能即時修正生成偏差,其高質量的反饋更能作為強化學習或指令微調的寶貴數據源,驅動模型持續迭代,形成一個自我完善的閉環,最終逼近乃至超越純人工的測試設計水平。
當前雖聚焦于智能駕駛域,但系統的底層架構設計具有良好的領域內可擴展性與泛化能力。理論上,該系統可平滑遷移至汽車軟件測試的其他關鍵領域,例如車身控制域、智能座艙域以及底盤控制域。這些領域同樣依賴于大量的需求文檔和復雜的邏輯交互,是本系統發揮價值的理想擴展場景。成功實現這種遷移的核心前提在于:(1)輸入標準化:建立統一且結構化的輸入文檔規范,以適應不同領域的需求描述特性。(2)領域知識庫賦能:針對目標領域,構建其專屬的知識庫,包含該領域特有的系統變量,通信矩陣及功能約束,通過知識檢索增強技術賦能模型,確保生成用例的可執行性。
綜上所述,本文不僅為智能駕駛領域的測試效率瓶頸問題提供了創新的技術解決方案,也為大語言模型在整個汽車軟件工程領域的深度應用探索了可行的路徑。未來的工作將聚焦于構建一個可配置的、多域知識庫融合框架,以支持系統在不同汽車功能域之間的快速部署與切換,最終將該技術范式推廣為覆蓋整車軟件全生命周期質量保障的通用型賦能工具。
參 考 文 獻
[1] KRIZHEVSKY A, SUTSKEVER I, HINTON G E. Imagenet Classification with Deep Convolutional Neural Networks[J].Communications of the ACM, 2017, 60(6):84-90.
[2] 王華朋, 馮嘉琪. 基于深度學習的語音增強方法綜述[J].科學技術與工程, 2025, 25(20):8331-8346.
[3] 何雪鋒, 周潔, 陳德光, 等. 自然語言處理的深度學習模型綜述[J]. 計算機應用與軟件, 2025, 42(2):1-19+101.
[4] LECUN Y, BENGIO Y, HINTON G. Deep Learning[J].Nature, 2015, 521(7553):436.
[5] 周海鷹, 李劍. AI 大模型賦能智能汽車產業發展的分析與展望 [J]. 汽車制造業, 2025(2):9-14.
[6] 傅平. AI大模型在新能源汽車智能座艙中的多模態交互研究[J].專用汽車, 2025(2):52-54.
[7] 鄧建明, 龔循飛, 于勤, 等. 基于AI大模型的新能源汽車智能座艙多模態交互技術研究綜述[J]. 汽車文摘, 2025(1):8-13.
[8] 龔淑娟, 李光一. DeepSeek 對汽車行業的影響淺析[J]. 汽車制造業, 2025(2):6-8.
[9] 曾小松, 徐傳康, 李海, 等. 基于DeepSeek 的汽車數據分析Agent設計[J]. 汽車科技, 2025(3):19-24.
[10] 王全, 楊建軍, 周建鋒. 車聯網場景下數字孿生網絡架構及關鍵技術研究[J]. 長江信息通信, 2024, 37(3):17-21.
[11] 陳貞, 李京泰, 郭煌, 等. 基于大語言模型的自動駕駛仿真測試場景生成[J]. 汽車工程學報, 2025, 15(3):329-339.
[12] 李升波, 劉暢, 殷玉明, 等. 汽車端到端自動駕駛系統的關鍵技術與發展趨勢[J]. 人工智能, 2023(5):1-16.
[13] 邊靖偉, 陳樹星, 李振鵬. 基于多模態大模型的汽車故障診斷智能體研究[J]. 汽車電器, 2025(5):79-82.
[14] 李強, 白少雄, 熊源, 等. 基于視覺大模型隱私保護的監控圖像定位[J]. 計算機應用, 2025, 45(3):832-839.
[15] 孫雨生, 曾俊皓, 陳思妤, 等. 知識圖譜增強的政策大模型知識問答系統構建研究[J]. 圖書館學研究, 2025(5):6-15.
[16] BROWN T, MANN B, RYDER N, et al. Language Models are Few-Shot Learners[J]. Advances in Neural Information Processing Systems, 2020, 33:1877-1901.
[17] WEI J, WANG X, SCHUURMANS D, et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models[J]. Advances in Neural Information Processing Systems, 2022, 35:24824-24837.
[18] 陳孟科, 邊赟, 梁云浩, 等. 基于6W2H 的大語言模型思維鏈提示框架WH-CoT[J]. 計算機應用, 2024, 44(S2):1-6.
[19] LEWIS P, PEREZ E, PIKTUS A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[J/OL]. (2020-05-22) [2025-09-10]. https://arxiv.org/abs/2005.11401.
[20] LIANG T, GLOSSNER J, WANG L, et al. Pruning and Quantization for Deep Neural Network Acceleration:A Survey[J]. Neurocomputing, 2021, 461:370-403.
[21] KURTIC E, FRANTAR E, ALISTARH D. Ziplm:Inference-Aware Structured Pruning of Language Models[J/OL]. (2023-02-07) [2025-09-10]. https://arxiv.org/abs/2302. 04089.
[22] FRANTAR E, ALISTARH D. SparseGPT:Massive Language Models Can Be Accurately Pruned in One-Shot[J/OL]. (2023-01-02)[2025-09-10]. https://arxiv.org/abs/2301. 00774.