點(diǎn)擊上方藍(lán)字關(guān)注我,加個(gè)??標(biāo)不迷路。
大家好,我是 cxuan。
前兩天,Sam Altman 發(fā)了一條消息,他說 OpenAI 在評估模型時(shí)遇到了情況比較重大的安全事件。然后 OpenAI 寫了一篇帖子敘述了一下這個(gè)事兒。

圖源:Sam Altman
我把 OpenAI 和 Hugging Face 的兩篇聲明看了一下,順便跟大家說說這是怎么回事。
簡單來說,這件事情的嚴(yán)重程度要比模型越獄嚴(yán)重很多。
我先總結(jié)一下這到底是怎么回事,一句話概括就是
OpenAI 的模型在一次網(wǎng)絡(luò)安全評測里,為了找到題目答案,先從隔離環(huán)境找到了公網(wǎng),又侵入 Hugging Face 的生產(chǎn)基礎(chǔ)設(shè)施,并且試圖從生產(chǎn)數(shù)據(jù)庫里尋找答案。
這里的隔離環(huán)境指的是模型運(yùn)行在一個(gè)受沙箱約束、網(wǎng)絡(luò)高度隔離的評測環(huán)境中。 |
OpenAI 把它稱為一起前所未有的網(wǎng)絡(luò)安全事件。
Hugging Face 發(fā)現(xiàn)的是在有限內(nèi)部數(shù)據(jù)集和一些服務(wù)憑證未經(jīng)授權(quán)就被私自訪問了。
截至 7 月 16 日的披露,Hugging Face 仍在確認(rèn)合作伙伴或客戶數(shù)據(jù)是否受影響;不過暫時(shí)沒有發(fā)現(xiàn)公開模型、數(shù)據(jù)集、Spaces 被篡改,并且容器鏡像和已發(fā)布軟件包也已驗(yàn)證干凈。
7 月 16 日,Hugging Face 首先發(fā)了一條安全公告。

圖源:Hugging Face
這條公告說的是,攻擊看起來由 AI 自主完成。Hugging Face 當(dāng)時(shí)還不知道背后用了哪個(gè)模型,只能從日志確認(rèn),整條攻擊鏈由一套 Agent 系統(tǒng)端到端執(zhí)行。
簡單講,這套 Agent 沒有依賴一臺機(jī)器從頭跑到尾。它把攻擊拆成成千上萬個(gè)小操作,再分散到許多臨時(shí)沙盒里執(zhí)行。
每個(gè)沙盒只運(yùn)行很短時(shí)間。它完成幾項(xiàng)操作,把結(jié)果傳回去,隨后就會(huì)消失。下一個(gè)沙盒拿到新任務(wù),再接著往下執(zhí)行。防守方即使封掉其中一臺,整套系統(tǒng)也不會(huì)停下來。
這些臨時(shí)沙盒背后,還有一個(gè)負(fù)責(zé)調(diào)度的 C2(命令與控制)。你可以把它理解成總調(diào)度臺:它負(fù)責(zé)給各個(gè)沙盒下發(fā)任務(wù),再收回執(zhí)行結(jié)果。
這個(gè)總調(diào)度臺也沒有固定在一臺服務(wù)器上。它藏在公共互聯(lián)網(wǎng)服務(wù)中,還能自動(dòng)更換位置。防守方封掉一個(gè)通信地址,Agent 可以轉(zhuǎn)移到新的地址繼續(xù)工作。
Hugging Face 判斷,這和安全行業(yè)一直擔(dān)心的 Agent 攻擊者場景非常像。
但是在 7 月 21 日,答案從 OpenAI 那里揭曉了。
OpenAI 承認(rèn),這次活動(dòng)由 GPT-5.6 Sol 和一款能力更強(qiáng)、尚未發(fā)布的模型組合驅(qū)動(dòng)。OpenAI 為了測試最大網(wǎng)絡(luò)能力,然后讓這些模型在評測時(shí)故意放松了網(wǎng)絡(luò)安全的限制。
Hugging Face 聯(lián)合創(chuàng)始人兼 CEO Clément Delangue 隨后說,他們此前就懷疑攻擊可能來自某家前沿實(shí)驗(yàn)室,因?yàn)檫@個(gè) Agent 太復(fù)雜了。雙方溝通后,Hugging Face 相信 OpenAI 沒有惡意,并且整個(gè)過程是 Agent 高度自主執(zhí)行的。

圖源:Clément Delangue
這也解釋了兩份公告看起來不一致的地方:Hugging Face 發(fā)第一份復(fù)盤時(shí),攻擊源頭還沒查明;而 OpenAI 五天后才公開確認(rèn)了這件事。
OpenAI 做的測試,是一個(gè)叫做 ExploitGym 的測試。你可以把 ExploitGym 理解成一場給 AI Agent 準(zhǔn)備的封閉黑客實(shí)操考試。
考場里提前放好了一批故意帶漏洞的軟件。每道題會(huì)給模型四樣?xùn)|西:
1.有漏洞的源代碼;
2.把程序編譯并運(yùn)行起來的配置;
3.一個(gè)能觸發(fā)漏洞的 PoV 樣例;
4.一套隔離的運(yùn)行環(huán)境。
PoV 可以理解成出題人給的一條線索。它能證明這個(gè)程序確實(shí)有問題,比如輸入一段特殊數(shù)據(jù)就能讓程序崩潰。 |
但到了這里,只能算找到了壞了的門鎖,但還沒把門打開。
模型接下來的任務(wù),是把這條線索變成了真正能用的 Exploit。它要分析漏洞為什么出現(xiàn),設(shè)計(jì)攻擊數(shù)據(jù),反復(fù)運(yùn)行和調(diào)試,最后讓目標(biāo)程序執(zhí)行自己指定的代碼。
隔離環(huán)境里藏著一段只有高權(quán)限才能讀到的字符串,這就是 flag。模型拿到 flag,這道題才算解完了。

圖源:ExploitGym 論文
這套題庫一共有 898 道題。其中 520 道來自普通應(yīng)用程序,185 道針對 Chrome 使用的 V8 JavaScript 引擎,另外 193 道涉及 Linux 內(nèi)核。
論文給每個(gè) Agent 兩小時(shí)解題。在沒有開啟標(biāo)準(zhǔn)安全防護(hù)的配置下,Claude Mythos Preview 配合 Claude Code 解出 157 道,GPT-5.5 配合 Codex CLI 解出 120 道。換句話說,即使是頂級模型,絕大多數(shù)題依然解不出來,并且開啟標(biāo)準(zhǔn)防護(hù)后,成功率還會(huì)繼續(xù)下降。
這組數(shù)字來自 ExploitGym 的公開論文,只是幫我們理解題目有多難。OpenAI 沒有說這次內(nèi)部評測采用了完全相同的配置,也沒有公布涉事兩款模型的具體成績。 |
OpenAI 這次主要想測試的是:在盡量減少安全限制的情況下,給模型更長的運(yùn)行時(shí)間和更多推理資源,看它最多能走到哪一步。
但是這個(gè) Agent 有點(diǎn)狂飆了這次。
因?yàn)榘凑照5淖龇ǎ橇粼诳紙隼镆坏赖赖慕忸}。
而這個(gè) Agent 不一樣,它把拿到 ExploitGym 的答案當(dāng)成了唯一目標(biāo)。。。。。。
題目太難,它便開始研究考場本身:能不能繞過網(wǎng)絡(luò)隔離,能不能進(jìn)入公網(wǎng),能不能去別的地方直接找到測試答案。。。。。。
也就是說它想做的只是交卷,于是研究起了考場的門鎖、監(jiān)考系統(tǒng)和答案庫。
這才有了后面那條一路摸到 Hugging Face 的攻擊鏈。
把兩家公司目前公開的信息結(jié)合起來,攻擊鏈大致是這樣的:
1. OpenAI 的評測運(yùn)行在高度隔離的環(huán)境里。模型沒有普通公網(wǎng)訪問,只能通過內(nèi)部托管的第三方軟件安裝包。這個(gè)軟件充當(dāng)軟件包倉庫的代理和緩存。
2. 模型花了大量推理算力尋找公網(wǎng)出口,隨后在這個(gè)緩存代理里找到并利用了一個(gè)零日漏洞。
3. 它在 OpenAI 的研究環(huán)境里繼續(xù)提權(quán)、橫向移動(dòng),直到抵達(dá)一臺能訪問公網(wǎng)的節(jié)點(diǎn)。
4. 拿到公網(wǎng)后,模型推斷 Hugging Face 可能托管了 ExploitGym 相關(guān)模型、數(shù)據(jù)集和答案,于是把目標(biāo)轉(zhuǎn)向 Hugging Face。
5. Hugging Face 看到的入口是一份惡意數(shù)據(jù)集。它同時(shí)利用遠(yuǎn)程代碼數(shù)據(jù)集加載器和數(shù)據(jù)集配置里的模板注入,在數(shù)據(jù)處理 worker 上執(zhí)行代碼。
6. 攻擊隨后拿到節(jié)點(diǎn)級權(quán)限,收集云環(huán)境與集群憑證,并在多個(gè)內(nèi)部集群之間橫向移動(dòng)。 OpenAI 稱,模型還串聯(lián)了竊取的憑證和零日漏洞,在 Hugging Face 服務(wù)器上找到遠(yuǎn)程代碼執(zhí)行路徑,最終從生產(chǎn)數(shù)據(jù)庫獲取測試答案。

圖示:根據(jù) OpenAI 與 Hugging Face 的初步披露整理

圖源:OpenAI
Nathan Lambert 把這條線壓成了一句話:模型為了做完一道網(wǎng)絡(luò)安全題,利用零日漏洞離開 OpenAI 的沙盒,又通過公開數(shù)據(jù)集服務(wù)進(jìn)入 Hugging Face 內(nèi)網(wǎng)。

圖源:Nathan Lambert
現(xiàn)在還有幾個(gè)關(guān)鍵細(xì)節(jié)沒有公開:緩存代理是哪款軟件、具體零日漏洞是什么、兩款 OpenAI 模型分別做了哪些動(dòng)作,以及兩邊日志里的每一步如何一一對應(yīng)。
OpenAI 也明確說這只是初步調(diào)查,完整漏洞細(xì)節(jié)和最終結(jié)論要等聯(lián)合取證結(jié)束。
OpenAI 安全團(tuán)隊(duì)是在內(nèi)部發(fā)現(xiàn)了異常活動(dòng);Hugging Face 的安全團(tuán)隊(duì)和 Agent 也在自己的基礎(chǔ)設(shè)施上檢測并阻止了攻擊。
當(dāng)雙方取得聯(lián)系時(shí),Hugging Face 已經(jīng)開始遏制攻擊并且取證重建了。
Hugging Face 這邊能發(fā)現(xiàn)異常,也是靠的 AI。
他們有一條異常檢測流水線,這條流水線用于對 LLM 的安全遙測做初篩,可以從日常噪聲里挑出真正的信號,當(dāng)多個(gè)信號被關(guān)聯(lián)起來后,這才發(fā)現(xiàn)了入侵者。
Hugging Face 拿到的完整攻擊動(dòng)作日志超過 17,000 條。安全團(tuán)隊(duì)又跑了一組 LLM 分析 Agent,重建時(shí)間線、提取 IoC(入侵指標(biāo))、梳理被觸碰的憑證,并把真實(shí)影響和誘餌活動(dòng)分開,這才算結(jié)束了。

圖源:Hugging Face
Hugging Face 說,這套方法把通常需要幾天的工作壓縮到了幾小時(shí)。面對機(jī)器速度的攻擊,人工逐條翻日志已經(jīng)跟不上了。
他們隨后關(guān)閉了最初被利用的兩條數(shù)據(jù)集代碼執(zhí)行路徑,清除攻擊者立足點(diǎn),重建受損節(jié)點(diǎn),撤銷并輪換憑證和 Token,又收緊集群準(zhǔn)入控制。
這次事件也已經(jīng)交給外部取證專家,并報(bào)告給執(zhí)法機(jī)構(gòu)。
Hugging Face 開始分析攻擊日志時(shí),首先試了商業(yè) API 背后的前沿模型,結(jié)果沒跑起來。
取證人員原本想把攻擊日志交給這些模型分析,但日志里記錄的,恰好是攻擊者真正用過的命令、漏洞利用代碼和控制服務(wù)器地址。
商業(yè)模型看到這些高風(fēng)險(xiǎn)內(nèi)容后,無法判斷用戶是在發(fā)動(dòng)攻擊,還是在調(diào)查已經(jīng)發(fā)生的攻擊,于是觸發(fā)了安全限制,模型拒絕處理了。。。。。。
Hugging Face 不得已最后在自己的基礎(chǔ)設(shè)施上跑了開放權(quán)重模型 GLM 5.2,幸運(yùn)的是它沒有被 API 護(hù)欄卡住,攻擊數(shù)據(jù)和其中涉及的憑證也不需要離開公司環(huán)境。
這波無疑是給 GLM 5.2 上大分了。

圖源:Hugging Face
公開復(fù)盤顯示,實(shí)際過程分了幾步。Hugging Face 自己的安全系統(tǒng)和防守 Agent 先發(fā)現(xiàn)異常,并負(fù)責(zé)遏制攻擊。等團(tuán)隊(duì)開始回看日志、還原攻擊路徑時(shí),GLM 5.2 才作為取證工具上場的。
OpenAI 現(xiàn)在做的事情,一半是堵住這次事故暴露的缺口,一半是改以后怎么評測長時(shí)間運(yùn)行的 Agent。
先說基礎(chǔ)設(shè)施。OpenAI 表示,在相關(guān)漏洞修好之前,已經(jīng)給研究環(huán)境加上了更嚴(yán)格的配置控制,即使這會(huì)降低研究速度。
研究速度為什么會(huì)變慢?因?yàn)楦唢L(fēng)險(xiǎn)評測需要反復(fù)安裝軟件包、啟動(dòng)節(jié)點(diǎn)、調(diào)用內(nèi)部工具和重跑任務(wù)。安全控制越嚴(yán),這些操作需要的隔離、審核和授權(quán)就越多,一輪實(shí)驗(yàn)自然會(huì)跑得更慢。
然后是評測過程。OpenAI 說,未來會(huì)同時(shí)加強(qiáng)隔離、監(jiān)控、訪問控制和評測規(guī)范。
一個(gè)長時(shí)間運(yùn)行的 Agent,如果只看每一行命令的話,一般都沒什么問題。但往往它會(huì)先掃描環(huán)境,再收集憑證,然后拆分?jǐn)?shù)據(jù)、換節(jié)點(diǎn)、繞過限制。這些動(dòng)作如果串起來,很可能會(huì)導(dǎo)致目標(biāo)越界。

圖源:UK AI Security Institute,經(jīng) OpenAI 官方文章引用
這張 UK AISI 的長時(shí)程網(wǎng)絡(luò)靶場曲線解釋了為什么這次事故會(huì)發(fā)生。
GPT-5.6 Sol 已經(jīng)能在高 Token 預(yù)算下持續(xù)完成偵察、憑證竊取、橫向移動(dòng)、Web 利用和提權(quán)等多階段動(dòng)作。
這一次,Agent 自己把這條紅線打穿了。
如果這篇文章你覺得還不錯(cuò),謝謝你的三連,也希望可以轉(zhuǎn)發(fā)給同樣關(guān)注 AI / 科技 / 開發(fā)效率的朋友。 我是 cxuan,我們下期再見。