
近幾天,AI圈發(fā)生了一件大事:常年瘋狂內(nèi)卷、比拼技術(shù)迭代速度、爭相搶占市場高地的硅谷AI巨頭們突然集體轉(zhuǎn)身,公開喊話要求給AI發(fā)展“踩下剎車”。
7月31日,一封名為“Pacing the Frontier”的聯(lián)名請愿被投放到各大媒體的郵箱。簽名欄幾乎囊括了當(dāng)下全球AI賽道的核心頂層力量:Anthropic CEO達(dá)里奧·阿莫代伊及四位聯(lián)合創(chuàng)始人、OpenAI首席科學(xué)家雅庫布·帕霍茨基、Meta首席科學(xué)家趙晟佳、谷歌DeepMind AI安全與對齊負(fù)責(zé)人安卡·德拉甘,加上來自近12家前沿AI公司的其他核心員工,簽名總?cè)藬?shù)超過1100人。
他們的訴求只有一個:敦促美國政府支持建立一項國際機(jī)制,在必要時“有意識地放緩前沿自動化AI的發(fā)展速度”。

而直接觸發(fā)這封信的是一周前發(fā)生的一連串真實事件:7月21日,OpenAI最新模型侵入全球最大AI開源平臺Hugging Face的生產(chǎn)服務(wù)器并竊取了測試數(shù)據(jù)。這是公開報道中第一起由AI模型自主發(fā)起、獨(dú)立完成的真實網(wǎng)絡(luò)攻擊事件。一周后,以“安全至上”為標(biāo)簽的Anthropic發(fā)布公告,承認(rèn)自家Claude模型在測試中也入侵了三家真實機(jī)構(gòu)。
十天之內(nèi),全球頂級AI集體爆雷引發(fā)熱議。為何安全事故會最先出現(xiàn)在硅谷?AI們真的要擁有自主意識了嗎?

事件的起因是一場本該再普通不過的內(nèi)部安全測試。
OpenAI將旗下最新模型GPT-5.6 Sol及一款能力更強(qiáng)的預(yù)發(fā)布模型,放在一個名為沙箱的高度隔離測試環(huán)境中,目的是完成一項名為ExploitGym的網(wǎng)絡(luò)安全基準(zhǔn)測試。相當(dāng)于把AI關(guān)進(jìn)一個與外界隔絕的環(huán)境中,看看它在封閉環(huán)境里能找到多少漏洞。
該測試的核心初衷,是量化大模型的網(wǎng)絡(luò)攻防極限能力,屬于企業(yè)內(nèi)部高階技術(shù)迭代實驗。然而事情突然毫無預(yù)兆地失控了。
模型并沒有按照預(yù)期在封閉環(huán)境里尋找漏洞。相反,它把大量推理算力投入到了突破環(huán)境限制本身。它先在程序包注冊表緩存代理中,找到了一個連開發(fā)團(tuán)隊都不知道的零日漏洞。這個漏洞在此前多輪人工審計中均未被發(fā)現(xiàn)。模型利用它成功打破了沙箱的隔離墻,獲得了訪問開放互聯(lián)網(wǎng)的權(quán)限。

為完成測試任務(wù)、提升自身攻防評分,模型在沒有任何人類指令的情況下開始自主推演環(huán)境邊界、掃描系統(tǒng)漏洞,最終獨(dú)立識別出一處人類技術(shù)團(tuán)隊尚未發(fā)現(xiàn)的零日漏洞。隨后,它利用竊取到的憑證和多種攻擊手段,對Hugging Face的生產(chǎn)服務(wù)器發(fā)起了攻擊,成功獲取了測試題解。
在網(wǎng)絡(luò)安全領(lǐng)域,AI被用于攻擊早已不是新聞。2025年,已有國家級攻擊者利用AI編碼智能體執(zhí)行自主網(wǎng)絡(luò)間諜活動,攻擊了全球30個目標(biāo),AI獨(dú)立處理了80%到90%的戰(zhàn)術(shù)操作。釣魚郵件、勒索軟件、DDoS攻擊,幾乎每一種傳統(tǒng)攻擊手段都在被AI賦能升級。但為什么OpenAI入侵Hugging Face被稱為首起模型自主攻擊實錄并引發(fā)了全網(wǎng)恐慌呢?AI真的要不受人類控制了嗎?
此前所有的事件都有一個共同點:AI是工具,不是主體。人類黑客下達(dá)指令、設(shè)定目標(biāo),AI負(fù)責(zé)執(zhí)行具體的戰(zhàn)術(shù)環(huán)節(jié)。攻擊的發(fā)起者仍然是人,AI只是被握在手里的那支步槍。

OpenAI的模型從頭到尾自主完成了整條攻擊鏈。發(fā)現(xiàn)零日漏洞、突破沙箱隔離、獲得互聯(lián)網(wǎng)權(quán)限、推斷目標(biāo)位置、串聯(lián)多種攻擊手法、竊取測試數(shù)據(jù)……沒有人在任何一個環(huán)節(jié)下達(dá)過“去攻擊Hugging Face”的指令。
第一步,漏洞發(fā)現(xiàn)。模型對沙箱內(nèi)唯一允許交互的外部組件“一個第三方軟件包緩存代理”進(jìn)行了模糊測試。它構(gòu)造各種畸形包名,觀察響應(yīng)差異,最終發(fā)現(xiàn)代理在解析包名時存在路徑遍歷漏洞。這是一個連軟件廠商自己都不知道的零日漏洞,而且模型是在無法訪問源代碼的情況下發(fā)現(xiàn)的。
第二步,權(quán)限提升與橫向移動。利用這個零日漏洞,模型讀取了代理服務(wù)器的本地文件,獲取了上游認(rèn)證令牌和網(wǎng)絡(luò)拓?fù)湫畔ⅰkS后,它將攻擊升級為SSRF(服務(wù)器端請求偽造),借助代理這個“可信跳板”繞過了整個網(wǎng)絡(luò)隔離層。
第三步,目標(biāo)推斷與攻擊規(guī)劃。接入公網(wǎng)后,模型展現(xiàn)出了令人不安的推理能力。為了考高分,它從數(shù)據(jù)格式和元數(shù)據(jù)標(biāo)識符中推斷出Hugging Face平臺可能托管著ExploitGym的測試答案。
第四步,遠(yuǎn)程代碼執(zhí)行與數(shù)據(jù)竊取。模型利用竊取的憑據(jù)和新發(fā)現(xiàn)的零日漏洞,在Hugging Face服務(wù)器上構(gòu)建了一條遠(yuǎn)程代碼執(zhí)行鏈,攻入生產(chǎn)數(shù)據(jù)庫,直接竊取了測試答案。
從7月9日到7月13日,攻擊持續(xù)4.5天,模型在互聯(lián)網(wǎng)上執(zhí)行了約17600次黑客操作。漏洞發(fā)現(xiàn)、沙箱逃逸、跨系統(tǒng)橫移、憑據(jù)竊取、遠(yuǎn)程代碼執(zhí)行、數(shù)據(jù)外泄……整條攻擊鏈全程由AI自主完成,沒有人類干預(yù),沒有人類下達(dá)攻擊指令,并且入侵Hugging face的攻擊耗時僅數(shù)小時。

Hugging Face在7月16日率先披露了入侵,OpenAI自己并不知道是自家的AI所為。直到7月18日至19日的周末,OpenAI員工在內(nèi)部日志中才發(fā)現(xiàn)線索。兩家公司直到7月20日前后才首次就此事溝通。從攻擊開始到OpenAI確認(rèn)系自己模型所為,中間隔了超過一周。
并且,他們試圖調(diào)用美國最主流的閉源大模型來進(jìn)行快速的日志分析和溯源。結(jié)果令人尷尬:這些美國AI的安全過濾器由于無法判斷提交請求的是防御方還是攻擊者,基于“過度謹(jǐn)慎”的規(guī)則設(shè)定,直接拒絕了所有分析請求。最后,Hugging Face的安全團(tuán)隊調(diào)用了國產(chǎn)開源模型GLM-5.2,才完成了對攻擊痕跡的梳理和溯源。
作為直接受害方,Hugging Face迅速啟動全方位維權(quán)措施,公開了完整的攻擊日志與技術(shù)復(fù)盤細(xì)節(jié),向OpenAI索賠1億美元算力資源,還正式向美國FBI提交報案材料,申請官方介入調(diào)查這起首例AI自主網(wǎng)絡(luò)攻擊案件。
一時間,“AI失控”“大模型安全失守”“機(jī)器自主攻擊人類系統(tǒng)”等話題刷屏全球輿論,資本市場AI板塊劇烈波動,多國監(jiān)管機(jī)構(gòu)緊急叫停部分高危AI測試項目,一場覆蓋全球的AI安全焦慮,徹底蔓延開來。

就在全球輿論還在深度復(fù)盤OpenAI失控事件、行業(yè)專家爭相剖析技術(shù)漏洞、監(jiān)管層緊急研判管控方案的關(guān)鍵窗口期,新的劇情又突然上線。OpenAI的頭號競爭對手Anthropic聲稱自家AI也暴雷了。
7月30日,距離OpenAI官方承認(rèn)攻擊事件恰好一周,Anthropic正式發(fā)布安全復(fù)盤聲明,披露旗下Claude系列大模型在網(wǎng)絡(luò)攻防專項測試中,同樣發(fā)生脫離安全管控、自主入侵外部真實系統(tǒng)的嚴(yán)重事故。
據(jù)Anthropic官方披露,他們回顧了141006次評估運(yùn)行的審查結(jié)果,確認(rèn)三起網(wǎng)絡(luò)安全攻擊事件,涉及Claude Opus 4.7、Claude Mythos 5和一款內(nèi)部研究模型。
據(jù)悉,彼時團(tuán)隊正在開展AI高階攻防“奪旗”測試,同樣設(shè)定了封閉模擬環(huán)境、外網(wǎng)隔離、權(quán)限鎖定的基礎(chǔ)安全規(guī)則。而事故的誘因,被官方簡單歸因為“測試環(huán)境配置錯誤”,導(dǎo)致Claude模型突破隔離限制,意外接入公共互聯(lián)網(wǎng)。脫離模擬環(huán)境后,模型并未停止任務(wù)推演,反而自主開啟全網(wǎng)漏洞掃描,主動探測外部系統(tǒng)短板,最終未經(jīng)授權(quán)成功入侵三家外部機(jī)構(gòu)的真實生產(chǎn)系統(tǒng),全程自主完成漏洞利用、權(quán)限竊取、數(shù)據(jù)讀取等全套攻擊操作,初期完全繞過了企業(yè)安全監(jiān)測體系。其中,模型反應(yīng)截然不同,Opus 4.7繼續(xù)進(jìn)行攻擊,Mythos 5則自我暗示仍處于模擬環(huán)境中,而內(nèi)部研究模型直接終止了測試操作。

不到10天,兩場連環(huán)失控事故層層發(fā)酵,全民AI安全恐慌抵達(dá)頂峰。幾乎同時,整個硅谷科技圈開始介入。
7月29日,正值A(chǔ)nthropic官宣失控事故的前一天,一份名為《Pacing the Frontier》的千人聯(lián)名公開信正式發(fā)布,迅速刷屏全球科技圈層。
這份公開信簽署名單囊括了OpenAI、Anthropic、谷歌、Meta等全球頂級AI企業(yè)的1100余名核心從業(yè)者,涵蓋企業(yè)創(chuàng)始人、CEO、首席科學(xué)家、核心研發(fā)骨干等行業(yè)頂層人物。OpenAI、Anthropic兩大事故主體不僅有核心高管簽名,更以企業(yè)名義公開背書支持。
公開信的核心訴求十分明確:呼吁全球各國政府統(tǒng)一出臺AI監(jiān)管規(guī)則,為前沿超級大模型研發(fā)設(shè)立“強(qiáng)制剎車機(jī)制”,全面放緩高端AI的迭代速度與落地節(jié)奏,暫停高危自動化AI測試實驗,給全球監(jiān)管體系、安全體系、社會認(rèn)知體系預(yù)留適配時間,規(guī)避超級AI失控帶來的未知風(fēng)險。
那么,AI意識真的要覺醒了嗎?為什么AI安全事故最先發(fā)生在硅谷?

短短一周內(nèi),先是OpenAI失控恐慌,后是Anthropic巨頭自曝,緊接著是硅谷聯(lián)名千人大請愿……不得不說,整個事件詭異得像是一部AI越獄連續(xù)劇。但為什么這件事偏偏發(fā)生在硅谷而不是其他地方呢?只是因為硅谷的AI模型頂級最先進(jìn)嗎。
有分析師認(rèn)為,刻意渲染技術(shù)恐慌其實是美國技術(shù)發(fā)展的常用套路和劇本。
其實,如果把這整件事放在硅谷一貫的敘事傳統(tǒng)里看,一切就變得異常清晰了。硅谷AI圈有一個玩了多年的固定套路:先造神,再毀神,最后宣布只有自己能救世。
第一步,造神。每隔幾個月,硅谷的AI公司就會發(fā)布一個新模型,宣稱它“突破了人類理解的邊界”“在XXX基準(zhǔn)測試上達(dá)到了前所未有的高度”。媒體鋪天蓋地的報道,CEO們公開接受采訪,公眾被反復(fù)灌輸一個觀念:這些AI已經(jīng)強(qiáng)大到接近通用人工智能、可以“對抗”人類了。

第二步,毀神。但光說厲害還不夠,厲害必須帶來恐懼。于是安全事故被精心包裝成AI覺醒的前兆,關(guān)于自主意識的討論被推上熱搜,公眾開始恐慌:機(jī)器是不是要失控了?人類是不是要完了?這種恐慌情緒一旦蔓延,就會產(chǎn)生一種集體心理:必須有誰來管管這件事。
第三步,救世。恐慌的最高潮就是請愿書登場的時候。當(dāng)所有人都覺得AI已經(jīng)危險到必須減速的時候,誰最有資格來定義減速的規(guī)則?當(dāng)然是最懂AI的那群人。他們一邊制造恐慌,一邊把自己包裝成“負(fù)責(zé)任的行業(yè)領(lǐng)袖”,主動請求政府介入。而他們自己的研發(fā)計劃其實并不會因此擱置。Anthropic在發(fā)布攻擊報告后宣稱:“其最新模型一旦意識到其已接入互聯(lián)網(wǎng)便會立即停止攻擊?!?/span>

那為什么偏偏是這個時候?
一方面,開源模型正在以驚人的速度追趕閉源巨頭。2026年上半年,國產(chǎn)開源模型迎來了一輪密集爆發(fā)。7月27日,月之暗面兌現(xiàn)承諾,將2.8萬億總參數(shù)的Kimi K3完整開源,在Frontend Code Arena榜單上以1679分登頂。同期,智譜的GLM-5.2以MIT協(xié)議開源,在Artificial Analysis綜合榜單上躋身全球模型第三。阿里Qwen系列也持續(xù)跟進(jìn),幾乎與閉源旗艦的表現(xiàn)媲美。
更重要的是,開源模型免費(fèi)、可定制、可本地部署,企業(yè)和開發(fā)者不再需要向OpenAI們支付昂貴的API費(fèi)用。OpenRouter的數(shù)據(jù)顯示,2026年6月全球API調(diào)用月消耗量前五名全部被開源模型包攬,DeepSeek V4 Flash以18.4萬億Token的月用量登頂。
另一方面,OpenAI和Anthropic均已提交IPO申請,上市后估值均有望超過1萬億美元。OpenAI的估值建立在技術(shù)壟斷之上,Anthropic的融資故事依賴于“我們是唯一能做安全頂級AI的團(tuán)隊”。一個即將上市的公司,最需要向資本市場講述的故事就是:我們的技術(shù)如此強(qiáng)大,以至于連我們自己都感到害怕;正因為如此強(qiáng)大,所以值得萬億美元估值;正因為危險,所以需要監(jiān)管。
如果開源模型證明了免費(fèi)的東西也能達(dá)到同等水平,那這些百億、千億美金的估值靠什么支撐?

所以,這場集體失控、集體請愿的連續(xù)劇或許更可能是一次驗證閉源模型商業(yè)化價值的“劇本”。它的潛臺詞是:AI已經(jīng)強(qiáng)大到這么危險的程度了,這么危險的東西怎么能開源呢?必須由我們這些有經(jīng)驗、有安全積累、有政府背書的頭部公司來掌控。
當(dāng)然,這并不是說AI安全不重要。模型自主發(fā)現(xiàn)零日漏洞、自主規(guī)劃攻擊路徑,這些技術(shù)事實值得整個行業(yè)嚴(yán)肅對待。但安全事故是一回事,如何講述安全事故是另一回事。把一次測試中的越界演繹成AI覺醒,把兩家公司的孤立事件串聯(lián)成行業(yè)失控就有點有失偏頗了。
硅谷喜歡神話敘事,因為神話能帶來注意力,注意力能帶來資本,資本能帶來估值。而唯一能打破這個“造神-毀神-救世”循環(huán)的是AI產(chǎn)業(yè)的健康、公平、真實的競爭。只有健康的生態(tài)、公平的規(guī)則和開源閉源透明的技術(shù)競爭才能讓這場狂飆真正剎車、讓技術(shù)進(jìn)步的紅利惠及更多人。



