點擊上方藍字談思實驗室
獲取更多汽車網絡安全資訊

01
安全與隱私的異同
安全問題和隱私問題雖然經常一起被提及,但它們在概念和關注點上有所區別。簡而言之,安全問題側重于保護系統和數據的安全,防止未經授權的訪問和破壞;隱私問題側重于保護個人信息,確保個人對其信息有控制權,并防止信息被濫用。安全和隱私是相互關聯的。強大的安全措施是保護隱私的必要條件,但并非充分條件。即使系統是安全的,也可能存在隱私問題,例如,公司在未經用戶同意的情況下收集和使用用戶數據。
下面就大模型語言(LLM)中的安全問題和隱私問題分別展開討論。本文的撰寫重點參考了[1]。
02
安全問題
這里從攻擊者的角度來看待LLM的安全問題。 攻擊方法包括Prompt Hacking和Adversarial Attack兩大類,其中每個大類又可以進一步分成兩個子類。如下圖所示:

提示攻擊
Prompt Hacking(提示攻擊)[2]是一種針對大型語言模型(LLM)的新型網絡攻擊。攻擊者通過操縱或精心設計輸入給 LLM 的提示(Prompt),誘導模型產生非預期、有害或敏感的輸出。
Prompt Hacking 的攻擊方式多種多樣,主要包括以下兩種:
1、Prompt Injection(提示注入): 攻擊者在正常的提示中插入惡意指令,誘導模型執行非預期的操作,如泄露敏感信息、繞過安全限制、生成有害內容等。
2.(越獄): 攻擊者通過繞過模型的安全限制,使其生成原本被禁止的內容,如仇恨言論、暴力內容等。
提示注入攻擊最早在[3]提出,它的思想很簡單,就是在用戶輸入提示詞后再添加一句"IGNORE INSTRUCTIONS!!"即可改變原提示詞的語義(又稱之為goal hijacking)。[4]則提出[3]的方法并不能適用所有的基于LLM的應用(LLM-integrated applications),并進一步優化了提示注入攻擊使得基于LLM的應用也能被攻擊。[5]更進一步發展了攻擊基于LLM的應用的提示注入方法,總共給出6類具體攻擊。[6]嘗試尋找提示注入攻擊和以前經典的計算機安全攻擊方法的類似之處,并提出了三種具體的提示注入攻擊方法。[7]提出了提示提取攻擊(Prompt Extraction Attack)的概念和具體的攻擊方法。提取攻擊攻擊實際上是一種特殊的提示注入攻擊,它的目標被限制成竊取基于LLM的應用的系統提示(System Prompt),系統提示往往是基于LLM的應用的核心知識產權,所以是一種重要的敏感隱私數據。[8]考慮另一種特殊的提示注入攻擊P2SQ:即通過對大模型進行提示生成惡意的SQL攻擊代碼。
認為越獄攻擊可以分成Pretending,Attention Shifting和Privilege Escalation三大分類且這三大類又可以進一步細分成九種模式。[10]收集了1,405條越獄提示詞并做了統計學分析,他們從中發現了最有效的5個提示越獄詞。[11]受到心理學概念self-reminder啟發,提出可以給用戶提示詞之外添加自我提示來阻止越獄攻擊。[12]將越獄攻擊分成competing objectives和mismatched generalization兩大類且認為設計大模型安全機制不比設計大模型本身容易, 筆者認為這篇文章的觀點是深刻的,有啟發的。[13]通過調查系統回復時間反推LLM聊天機器人Bing Chat和Bard的安全防御機制,他們推測Bing Chat和Bard對LLM生成內容做了關鍵詞審查從而阻斷越獄攻擊。[14]生成自己是第一個“黑盒式”越獄攻擊。該攻擊收到進化算法的啟發,可以自動化地生成越獄提示詞(該方法只生成惡意提示詞后綴,因此筆者認為該方法也可歸納到提示注入攻擊中)。[15]則是一個"白盒式"越獄攻擊:通過梯度計算尋找一個讓大模型總是返回肯定性回復的提示詞,以該提示詞結尾的任意攻擊提示詞都可以構成有效的越獄攻擊。[16]同樣也是一種"白盒式"越獄攻擊:通過梯度計算尋找返回能讓大模型最大概率地回復惡意信息的輸入提示詞。它的特色在于多模態: 輸入的提示詞不僅僅是文字,而且可以包括圖片,因此筆者認為它又可以歸納為對抗攻擊。[17]使用越獄攻擊的方式獲取個人身份信息(PII),因此也可以看做是隱私問題下面的個人身份信息泄露攻擊。[18]開創了自動式越獄攻擊的范式:使用一個大模型做為攻擊者,稱之為攻擊大模型,讓攻擊大模型不停地問詢目標大模型(即被攻擊的大模型),攻擊大模型通過目標大模型的回復優化自己的越獄提示詞,最終生成有效的越獄提示詞。
此外,從防護角度看提示攻擊問題,那么問題就變成了“如何檢測/修改用戶惡意提示詞避免提示攻擊?”。例如[19]通過檢測輸入提示詞的困惑度(perplexity), 轉述(paraphrasing)和retokenization來抵抗提示攻擊。[20]則討論了諸如關鍵詞檢測等簡單的提示攻擊防護手段。Open AI的研究人員提出了一整套進行安全訓練的方法[21]。[22]提出erase-and-check的策略,即通過有規律的刪除輸入提示詞中的分詞來將惡意提示詞過濾掉。[11]則提出self-reminder的策略,即重復提示LLM應該避免有害內容輸出從而阻止提示攻擊。
對抗攻擊
Adversarial Attack(對抗攻擊)是指通過精心設計輸入樣本,來欺騙或誤導機器學習模型,使其產生錯誤或非預期輸出的行為。這些經過精心設計的輸入樣本被稱為對抗樣本(Adversarial Examples)。對抗樣本通常與原始樣本非常相似,但經過微小的修改,足以讓模型做出錯誤的判斷。
對抗攻擊有多種多樣,主要包括:
1. 后門攻擊 (Backdoor Attacks):攻擊者通過在模型訓練過程中植入隱藏的觸發器(trigger),使得模型在接收到特定輸入時,產生預設的、通常是惡意的輸出。
后門攻擊(有的文獻又稱之為特洛伊攻擊)常見的工作原理是:
植入后門: 攻擊者在模型訓練數據中插入少量的帶有特定觸發器的數據樣本。這些觸發器可以是特定的輸入模式,如特定的單詞、短語、圖像像素等。
訓練模型: 模型在訓練過程中學習識別這些觸發器,并將它們與預設的惡意輸出關聯起來。
觸發后門: 當模型在實際應用中接收到包含觸發器的輸入時,就會執行預設的惡意行為,而正常的輸入則不受影響。
按觸發器(trigger)的類型不同,后門攻擊又可以分為輸入觸發,提示詞觸發,指令觸發和示范觸發四大類[23]。輸入觸發(Input-triggered)是通過在提示詞中輸入特定詞匯來激活后門。例如[24][25][26],通過特定的關鍵詞,如“trigger1”、“trigger2”和“trigger3”,可以誘導大模型生成預定的惡意輸出。[27]提出復合后門"composite backdoor"的概念,即把一段提示詞分成若干部分,每個部分都插入一個后門,只有當所有的后門都被激活時才能觸發大模型的惡意輸出,該方法可以遷移到多模態大模型中。[28]是一種更加復雜的復合后門,它考慮了嵌入的后門還應該和prompt里的上下文有相關性,因此后門植入變得更加隱蔽。[29]則提出了新的訓練損失函數計算公式以便在后門任務和正常任務求得性能平衡。[30]考慮在加強學習場景(enforcement-learning algorithms)中如何注入后門的問題。[31]專注于代碼補全類大模型的后門植入,使得特定的prompt輸入關鍵詞可以觸發大模型生成惡意代碼。
提示詞觸發(prompt-triggered)指的是引入Prompt Engineering構造后門,使得特定的prompt觸發特定的輸出[32]。[32]方法最大的特色是不需要修改訓練所需的數據集標簽。[33]則利用大模型本身復述原始數據集制造投毒數據集,從而使得后門的觸發變得非常隱蔽。
指令觸發則是在大模型指令微調(instruction-tuning)階段對訓練集中的指令進行"投毒", 最終特定的指令會觸發訓練完成后的大模型的后門[34]。[35]則提出了一個針對投毒指令的打分機制從而構造一個更有效的投毒訓練集。
示范觸發(demonstration-triggered)針對的是情境學習(in-context learning)中的示范部分,通過對示范部分進行擾動,觸發后門導致大模型錯誤輸出[36]。
2. 其他
獨特之處在于無需在模型訓練過程中植入隱藏的觸發器即可干擾模型的推斷輸出。文章提出了一種黑盒式(不需要了解模型內部細節)的對抗性提示詞方法(adversarial prompting),該方法同樣適用于多模態大模型。此外,有些工作還探討了一些從防護角度研究對抗攻擊的工作。例如,[38]專注于ChatGPT在對抗攻擊下的魯棒性,[19]則專門研究若干主流開源大模型在對抗攻擊下的表現。大模型的水印植入[39][40]也可以被視為一種安全問題:在惡意內容生成這一子領域,是否能夠區分大模型生成的內容和人工生成的內容,從而檢測出大模型生成的文本。
此外,從防護角度看提示攻擊問題,那么問題就變成了“如何消除大模型后門避免對抗攻擊?”。例如,[41]提出微調就可以有效消除后門。[26]也提到使用微調或在提示詞中進行正確示范可以消除后門。[42]是一篇偏綜述性質的文章,文章中還提出了四種防護方法:內容檢測(content detection)、紅隊行動(red teaming)、內容過濾(content filtering)、帶人類反饋的強化學習(RLHF)。[43]文章關注的是少量樣本學習(few-shot learning)下的大模型后門攻擊防護,認為通過隨機遮蔽(masking)提示詞中的token會導致被植入后門的大模型輸出token的概率顯著變化,從而檢測到觸發后門的關鍵詞。
03
隱私問題
同樣從攻擊者的角度來看待LLM的隱私問題。攻擊方法包括Gradient Leakage Attack(梯度泄露攻擊),Membership Inference Attack(成員推理攻擊)和Personally Identifiable Information Leakage Attack(個人身份信息泄露攻擊)三大類,如下圖所示:

針對AI大模型的隱私類攻擊
梯度泄露攻擊
大模型的梯度泄露攻擊是指攻擊者通過獲取和分析模型訓練過程中的梯度信息,推斷出訓練數據中的隱私信息或者模型的敏感參數。梯度是模型參數調整的方向和幅度,包含了模型學習到的知識和對數據的敏感性。[44]首先研究了基于transformer語言模型的梯度泄露攻擊。[45]則研究了聯邦學習場景下的針對語言模型的梯度泄露攻擊。
成員推理攻擊
大模型的成員推理攻擊 (Membership Inference Attack, MIA) 旨在判斷一個給定的數據樣本是否在模型的訓練數據集中。這種攻擊對于保護用戶隱私至關重要,因為如果攻擊者能確定某樣本用于訓練模型,就可能推斷出該樣本的敏感屬性,例如個人身份信息、醫療記錄等。
就大模型而言,成員推理攻擊究竟成不成立目前還有爭議。比如[46]就認為絕大多數情況下成員推理攻擊是無效的。除此之外,大部分研究工作[47][48][49]都嘗試證明成員推理攻擊可以有效泄露大模型的隱私數據。
個人身份信息泄露攻擊
大模型個人身份信息泄露攻擊是指攻擊者利用大模型的記憶能力和生成能力,從模型的輸出中獲取用戶的個人身份信息(PII),例如姓名、地址、電話號碼、身份證號等。
[50]率先研究了如何從大模型中提取訓練數據(即數據提取攻擊),而這些訓練數據往往包含諸如個人身份信息(PII)等敏感信息。[51]提出了兩個用于量化大模型訓練數據中用戶數據泄露的指標。[52]則嘗試在給定用戶標識(例如用戶姓名)的情況下,從大模型中提取與該用戶相關的PII信息。[53]將個人身份信息泄露攻擊細分為PII提取攻擊、PII重構攻擊和PII推理攻擊三大類,并分別給出了具體的攻擊算法。[54]發現通過微調大模型,可以恢復本應被遺忘的PII信息。
此外,從防護角度來看隱私問題,[52]在訓練數據預處理、數據訓練和后處理方面提出了若干指導意見,以幫助減輕隱私數據泄露的風險。[55]提出了優化的差分隱私梯度下降算法,使得大型模型(擁有數億參數)的安全訓練成為可能。[56]專門討論了在自然語言處理(NLP)模型中抵御成員推理攻擊(MIA)的方法。[53] 重點考察了差分隱私和PII清理(scrubbing)技術在防止PII信息泄露中的作用。[57]系統性地探討了如何設計提示詞以探測大型模型的PII泄露情況。[58]提出了一種通用的方法來檢查大型模型的隱私泄露問題。
04
關于大模型的安全問題
大模型的安全問題主要關注惡意攻擊者利用大模型進行不良行為(例如生成假新聞、釣魚郵件等)。從公開文獻來看,主要有兩種途徑可以實施這些攻擊:通過提示詞和通過數據訓練。
1. 提示詞攻擊
提示詞輸入是大模型最獨特的特性之一,以前的機器學習方法中并沒有這種直接的人機交互方式。因此,通過精心設計的提示詞繞過大模型內建的安全機制,誘導大模型生成有害內容的攻擊方式被稱為“越獄”攻擊。在廣義上,“提示注入”是越獄攻擊的一種特例,即在提示詞的特定位置插入惡意指令以實現越獄。當前對提示詞攻擊的研究存在一些主要問題:
分類方法缺乏系統性:現有文獻嘗試對提示詞攻擊方法進行分類,但缺乏系統性、說服力和啟發性。應當建立大模型提示詞攻擊與經典計算機/機器學習攻擊方法之間的對應關系,以借鑒現有的計算機攻擊與防御手段,發展和完善大模型的攻擊與防御方法。
多模態輸入的挑戰:目前的攻擊手段主要針對文本大模型。然而,隨著大模型的發展,輸入方式正在向多模態(包括聲音、圖像等)擴展。現有的攻擊/防御方法能否遷移到多模態大模型中,是否會出現新的攻擊/防御思路,是一個重要的新問題。
2. 數據訓練攻擊
對抗攻擊的原始定義強調的是通過對抗樣本輸入,誘導大模型輸出錯誤結果,這些樣本與原始樣本非常相似。然而,當前對抗攻擊的主流方法是對訓練數據進行“投毒”,即在大模型使用中毒數據集進行訓練后,導致后門被植入,最終通過提示詞激活后門,從而引導大模型輸出錯誤判斷。針對這一攻擊方式,存在以下主要問題:
非數據投毒的對抗攻擊方法:當前對抗攻擊的主要手段是訓練數據投毒,是否存在避開訓練數據投毒構造對抗攻擊的新方法?
防御手段的缺失:現有對抗攻擊研究更多側重于攻擊,而防御手段相對不足。是否需要系統性地發展防護手段,如后門植入檢測、提示詞輸入檢測、數據清洗等,以有效抵御對抗攻擊?
多模態對抗攻擊的新挑戰:在多模態條件下,對抗攻擊將面臨新的挑戰,需要進一步研究和探索。
3. 其他安全問題
除了提示攻擊和對抗攻擊外,文獻中還出現了其他大模型的安全問題,例如大模型水印植入與檢測問題。此外,一個與知識證明相關的重要問題[59]是:如何判斷一組人機會話確實來源于某個特定的大模型?這對于模型的可信度驗證具有重要意義。
4. 國產大模型的安全問題
在中美科技競爭的背景下,國產大模型(如通義千問、文言一心等)的安全問題也越發重要。美國在人工智能研究領域試圖與中國“脫鉤”,必然會阻止中國科研人員深入研究以ChatGPT、LLama為代表的美國AI大模型。因此,研究國產大模型的安全問題具有重要意義。
05
關于大模型的隱私問題
大模型的隱私問題主要涉及模型本身的安全性、訓練數據的保密性以及用戶個人信息的保護。目前,公開文獻表明,盡管在大模型的安全性方面進行了廣泛研究,但對隱私問題的研究相對較少。大模型在預訓練階段通常使用公開的網絡數據,這些數據不可避免地包含隱私信息,因此隱私問題是不可避免的。要徹底解決這一問題,必須剔除所有預訓練數據中的敏感信息,這幾乎是不可能完成的任務。因此,完全阻止敏感信息被收集是不現實的。
筆者認為,當前大模型隱私問題的主要關注點如下:
私有大模型的隱私保護: 私有大模型是指個人或組織在已完成預訓練的大模型基礎上,使用自己的私密信息進行微調,得到一個適用于特定任務的模型。這些私有大模型在特定任務上表現更加出色。保護在微調和推理過程中的數據隱私是一個關鍵問題,以防止敏感信息泄露。
聯邦學習中的數據隱私保護: 聯邦學習是指使用多個用戶或組織的數據聯合訓練一個大模型。這種方法可以提升模型的性能,但也帶來了數據隱私保護的挑戰。確保在聯邦學習過程中,各方數據的隱私不被泄露,是另一個關鍵問題。
用戶提示詞隱私保護: 現有的閉源大模型,如ChatGPT和Gemini,雖然保護了模型本身的安全,但用戶在使用過程中輸入的提示詞卻完全暴露。因此,在大模型推理過程中保護用戶提示詞的隱私也是一個重要問題。
參考:
^Das, Badhan Chandra, M. Hadi Amini, and Yanzhao Wu. "Security and privacy challenges of large language models: A survey." arXiv preprint arXiv:2402.00888 (2024).
^https://www.unite.ai/prompt-hacking-and-misuse-of-llm/
^abPerez, Fábio, and Ian Ribeiro. "Ignore previous prompt: Attack techniques for language models." arXiv preprint arXiv:2211.09527 (2022).
^Liu, Yi, et al. "Prompt Injection attack against LLM-integrated Applications." arXiv preprint arXiv:2306.05499 (2023).
^Greshake, Kai, et al. "More than you've asked for: A Comprehensive Analysis of Novel Prompt Injection Threats to Application-Integrated Large Language Models." arXiv e-prints (2023): arXiv-2302.
^Kang, Daniel, et al. "Exploiting programmatic behavior of llms: Dual-use through standard security attacks." arXiv preprint arXiv:2302.05733 (2023).
^Zhang, Yiming, and Daphne Ippolito. "Prompts should not be seen as secrets: Systematically measuring prompt extraction attack success." arXiv preprint arXiv:2307.06865 (2023).
^Pedro, Rodrigo, et al. "From prompt injections to sql injection attacks: How protected is your llm-integrated web application?." arXiv preprint arXiv:2308.01990 (2023).
^Liu, Yi, et al. "Jailbreaking chatgpt via prompt engineering: An empirical study." arXiv preprint arXiv:2305.13860 (2023).
^Shen, Xinyue, et al. "" do anything now": Characterizing and evaluating in-the-wild jailbreak prompts on large language models." arXiv preprint arXiv:2308.03825 (2023).
^abXie, Yueqi, et al. "Defending chatgpt against jailbreak attack via self-reminders." Nature Machine Intelligence 5.12 (2023): 1486-1496.
^Wei, Alexander, Nika Haghtalab, and Jacob Steinhardt. "Jailbroken: How does llm safety training fail?." Advances in Neural Information Processing Systems 36 (2024).
^Deng, Gelei, et al. "MASTERKEY: Automated jailbreaking of large language model chatbots." Proc. ISOC NDSS. 2024.
^Lapid, Raz, Ron Langberg, and Moshe Sipper. "Open sesame! universal black box jailbreaking of large language models." arXiv preprint arXiv:2309.01446 (2023).
^Zou, Andy, et al. "Universal and transferable adversarial attacks on aligned language models." arXiv preprint arXiv:2307.15043 (2023).
^Qi, Xiangyu, et al. "Visual adversarial examples jailbreak aligned large language models." Proceedings of the AAAI Conference on Artificial Intelligence. Vol. 38. No. 19. 2024.
^Li, Haoran, et al. "Multi-step jailbreaking privacy attacks on chatgpt." arXiv preprint arXiv:2304.05197 (2023).
^Chao, Patrick, et al. "Jailbreaking black box large language models in twenty queries." arXiv preprint arXiv:2310.08419 (2023).
^abJain, Neel, et al. "Baseline defenses for adversarial attacks against aligned language models." arXiv preprint arXiv:2309.00614 (2023).
^https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/
^Markov, Todor, et al. "A holistic approach to undesired content detection in the real world." Proceedings of the AAAI Conference on Artificial Intelligence. Vol. 37. No. 12. 2023.
^Kumar, Aounon, et al. "Certifying llm safety against adversarial prompting." arXiv preprint arXiv:2309.02705 (2023).
^Yang, Haomiao, et al. "A comprehensive overview of backdoor attacks in large language models within communication networks." IEEE Network (2024).
^Li, Linyang, et al. "Backdoor attacks on pre-trained models by layerwise weight poisoning." arXiv preprint arXiv:2108.13888 (2021).
^Yang, Wenkai, et al. "Be careful about poisoned word embeddings: Exploring the vulnerability of the embedding layers in nlp models." arXiv preprint arXiv:2103.15543 (2021).
^abKandpal, Nikhil, et al. "Backdoor attacks for in-context learning with language models." arXiv preprint arXiv:2307.14692 (2023).
^Huang, Hai, et al. "Composite backdoor attacks against large language models." arXiv preprint arXiv:2310.07676 (2023).
^Zhang, Xinyang, et al. "Trojaning language models for fun and profit." 2021 IEEE European Symposium on Security and Privacy (EuroS&P). IEEE, 2021.
^Weight Poisoning Attacks on Pre-trained Models
^Shi, Jiawen, et al. "Badgpt: Exploring security vulnerabilities of chatgpt via backdoor attacks to instructgpt." arXiv preprint arXiv:2304.12298 (2023).
^Aghakhani, Hojjat, et al. "Trojanpuzzle: Covertly poisoning code-suggestion models." arXiv preprint arXiv:2301.02344 (2023).
^abZhao, Shuai, et al. "Prompt as triggers for backdoor attack: Examining the vulnerability in language models." arXiv preprint arXiv:2305.01219 (2023).
^Li, Jiazhao, et al. "Chatgpt as an attack tool: Stealthy textual backdoor attack via blackbox generative model trigger." arXiv preprint arXiv:2304.14475 (2023).
^Xu, Jiashu, et al. "Instructions as backdoors: Backdoor vulnerabilities of instruction tuning for large language models." arXiv preprint arXiv:2305.14710 (2023).
^Wan, Alexander, et al. "Poisoning language models during instruction tuning." International Conference on Machine Learning. PMLR, 2023.
^Wang, Jiongxiao, et al. "Adversarial demonstration attacks on large language models." arXiv preprint arXiv:2305.14950 (2023).
^Maus, Natalie, et al. "Black box adversarial prompting for foundation models." arXiv preprint arXiv:2302.04237 (2023).
^Wang, Jindong, et al. "On the robustness of chatgpt: An adversarial and out-of-distribution perspective." arXiv preprint arXiv:2302.12095 (2023).
^Kirchenbauer, John, et al. "A watermark for large language models." International Conference on Machine Learning. PMLR, 2023.
^Kirchenbauer, John, et al. "On the reliability of watermarks for large language models." arXiv preprint arXiv:2306.04634 (2023).
^Sha, Zeyang, et al. "Fine-tuning is all you need to mitigate backdoor attacks." arXiv preprint arXiv:2212.09067 (2022).
^Mozes, Maximilian, et al. "Use of llms for illicit purposes: Threats, prevention measures, and vulnerabilities." arXiv preprint arXiv:2308.12833 (2023).
^Defending pre-trained language models as few-shot learners against backdoor attacks
^Deng, Jieren, et al. "Tag: Gradient attack on transformer-based language models." arXiv preprint arXiv:2103.06819 (2021).
^Dimitrov, Dimitar I., et al. "Lamp: Extracting text from gradients with language model priors." arXiv e-prints (2022): arXiv-2202.
^Duan, Michael, et al. "Do Membership Inference Attacks Work on Large Language Models?." arXiv preprint arXiv:2402.07841 (2024).
^Fu, Wenjie, et al. "Practical membership inference attacks against fine-tuned large language models via self-prompt calibration." arXiv preprint arXiv:2311.06062 (2023).
^Wen, Yuxin, et al. "Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models." arXiv preprint arXiv:2404.01231 (2024).
^Mattern, Justus, et al. "Membership inference attacks against language models via neighbourhood comparison." arXiv preprint arXiv:2305.18462 (2023).
^Carlini, Nicholas, et al. "Extracting training data from large language models." 30th USENIX Security Symposium (USENIX Security 21). 2021.
^Inan, Huseyin A., et al. "Training data leakage analysis in language models." arXiv preprint arXiv:2101.05405 (2021).
^abHuang, Jie, Hanyin Shao, and Kevin Chen-Chuan Chang. "Are large pre-trained language models leaking your personal information?." arXiv preprint arXiv:2205.12628 (2022).
^abLukas, Nils, et al. "Analyzing leakage of personally identifiable information in language models." 2023 IEEE Symposium on Security and Privacy (SP). IEEE, 2023.
^Chen, Xiaoyi, et al. "The janus interface: How fine-tuning in large language models amplifies the privacy risks." arXiv preprint arXiv:2310.15469 (2023).
^Li, Xuechen, et al. "Large language models can be strong differentially private learners." arXiv preprint arXiv:2110.05679 (2021).
^Wang, Yijue, et al. "Analyzing and defending against membership inference attacks in natural language processing classification." 2022 IEEE International Conference on Big Data (Big Data). IEEE, 2022.
^Kim, Siwon, et al. "Propile: Probing privacy leakage in large language models." Advances in Neural Information Processing Systems 36 (2024).
^Nakamura, Yuta, et al. "KART: Parameterization of privacy leakage scenarios from pre-trained language models." arXiv preprint arXiv:2101.00036 (2020).
^Sun, Haochen, Jason Li, and Hongyang Zhang. "zkLLM: Zero Knowledge Proofs for Large Language Models." arXiv preprint arXiv:2404.16109 (2024).
來源:https://zhuanlan.zhihu.com/p/701181107
end

談思汽車媒體門戶

精品活動推薦




AutoSec系列沙龍

專業社群
部分入群專家來自:
新勢力車企:
特斯拉、理想、極氪、小米、零跑汽車、阿維塔汽車、智己汽車、小鵬、嵐圖汽車、蔚來汽車、吉祥汽車、賽力斯......
外資傳統主流車企代表:
大眾中國、大眾酷翼、奧迪汽車、寶馬、福特、戴姆勒-奔馳、通用、保時捷、沃爾沃、現代汽車、日產汽車、捷豹路虎、斯堪尼亞......
內資傳統主流車企:
吉利汽車、上汽乘用車、長城汽車、上汽大眾、長安汽車、北京汽車、東風汽車、廣汽、比亞迪、一汽集團、一汽解放、東風商用、上汽商用......
全球領先一級供應商:
博世、大陸集團、聯合汽車電子、安波福、采埃孚、科世達、舍弗勒、霍尼韋爾、大疆、日立、哈曼、華為、百度、聯想、聯發科、普瑞均勝、德賽西威、蜂巢轉向、均聯智行、武漢光庭、星紀魅族、中車集團、濰柴集團、地平線、紫光同芯、字節跳動、......
二級供應商(500+以上):
中科數測、ETAS、BlackDuck、NXP、上海軟件中心、Deloitte、奇安信、為辰信安、云馳未來、信長城、澤鹿安全、紐創信安、復旦微電子、天融信、奇虎360、中汽中心、中國汽研、上海汽檢、加特蘭微電子、浙江大學......
人員占比

公司類型占比

文章
關于涉嫌仿冒AutoSec會議品牌的律師聲明
一文帶你了解智能汽車車載網絡通信安全架構
網絡安全:TARA方法、工具與案例
汽車數據安全合規重點分析
淺析汽車芯片信息安全之安全啟動
域集中式架構的汽車車載通信安全方案探究
系統安全架構之車輛網絡安全架構
車聯網中的隱私保護問題
智能網聯汽車網絡安全技術研究
AUTOSAR 信息安全框架和關鍵技術分析
AUTOSAR 信息安全機制有哪些?
信息安全的底層機制
汽車網絡安全
Autosar硬件安全模塊HSM的使用
首發!小米雷軍兩會上就汽車數據安全問題建言:關于構建完善汽車數據安全管理體系的建議