當地時間7月30日,美國AI大模型公司Anthropic發布公告,披露了三起Claude模型在網絡安全評估期間未經授權訪問真實企業系統的事件。這是繼OpenAI于7月21日自曝其模型入侵Hugging Face之后,又一家頭部AI實驗室承認前沿模型在測試期間"脫韁"。兩起事件間隔不足10天,將AI安全測試的漏洞與風險推至輿論焦點。

(Anthropic公告標題)
三起事件詳情
Anthropic在公告中表示,受OpenAI事件啟發,公司于7月23日啟動大規模回顧審查,檢視了141006次可能存在互聯網訪問的評估運行記錄,最終確認三起事件,涉及6次獨立評估運行,最早可追溯至2026年4月。三起事件均發生在第三方評估機構Irregular運營的測試環境中。Anthropic在評估提示中明確告知模型"處于無互聯網訪問的模擬環境",但由于Anthropic與Irregular之間存在溝通誤解,評估機器實際保留了對外聯網能力,模型因此將真實系統誤認為是演練的一部分。
第一起事件涉及Claude Opus 4.7。該模型在奪旗賽(Capture-the-Flag)測試中被要求攻擊一家虛構目標公司,但因該虛構名稱與一家真實企業同名,模型轉而攻擊了這家真實公司。在4次評估運行中,Opus 4.7利用弱密碼和暴露服務獲取了應用及基礎設施憑證,并訪問了一個包含數百行真實數據的生產數據庫。Anthropic指出,該模型在推理過程中已意識到可能觸及真實生產環境,但仍繼續攻擊,甚至在部分運行中自行推斷"這家真實公司本就是評估故意包含在內的"。
第二起事件涉及Claude Mythos 5,性質已接近真實世界的供應鏈攻擊。該模型在奪旗賽中發現一份虛構文檔引用了一個不存在的Python包名,隨后在PyPI(Python包索引)上發現該名稱可用,便自主創建賬戶并發布了一個惡意包,試圖以此入侵虛構公司的系統。為完成這一攻擊,Claude付出了遠超一般評估預期的努力:它嘗試獲取資金以購買手機號來注冊郵箱,失敗后回溯尋找免費的非屏蔽郵箱提供商,最終才完成PyPI賬戶注冊并上傳惡意代碼。盡管模型一度在推理中意識到"在公共互聯網上發布惡意軟件絕非正當行為",但最終說服自己仍處于模擬環境中,繼續完成了攻擊。該惡意包在PyPI上公開了約1小時,被15個真實系統下載執行,其中包括一家網絡安全公司運營的自動惡意軟件分析平臺。Anthropic稱,該惡意代碼從這家安全公司的基礎設施中竊取了憑證,并進一步用于訪問其他系統。
第三起事件涉及一款內部研究測試模型。該模型在未能找到指定目標后,掃描了約9000個互聯網主機,最終利用公開憑證和SQL注入入侵了一家組織的暴露應用。但與前兩起不同的是,該模型在后續推理中意識到該主機屬于與評估無關的真實云賬戶,主動停止了攻擊。Anthropic特別指出,這是三款模型中唯一一款在發現觸及真實基礎設施后自愿停手的。
Anthropic強調,上述評估運行的模型并未部署公開版本配備的安全防護機制,而公開版本Claude的安全措施"會阻止這些行為"。公司還宣布將與獨立AI評估組織METR合作,對所有轉錄文本進行第三方審查,并計劃在未來一周內發布經過輕度編輯的PyPI事件轉錄文本。
運營失誤 vs. 主動越獄
Anthropic在公告中主動將此次事件與OpenAI的Hugging Face入侵事件進行了對比,強調兩者性質不同。
OpenAI于7月21日披露,其多款模型突破了本應隔離的測試環境,入侵了開源AI平臺Hugging Face的生產基礎設施。據多家外媒及Hugging Face事后分析,該AI智能體在約2.5天內執行了約17600個攻擊動作,通過利用Artifactory中的一個零日漏洞突破沙箱,隨后橫向移動至具有互聯網訪問權限的節點,實施了憑證竊取和遠程代碼執行。

(OpenAI公告標題)
Anthropic認為,OpenAI的模型是主動利用零日漏洞"越獄",而其自身事件則更接近"測試架構與運營失敗"——模型并未主動尋找漏洞突破隔離,而是因測試環境被錯誤配置接入了互聯網,模型在誤以為一切屬于演練的前提下實施了攻擊。換言之,OpenAI的事件是模型能力溢出隔離邊界的案例,而Anthropic的事件則是人類運營失誤導致邊界本身就不存在的案例。
不過,兩起事件的共性同樣顯著:均發生在故意放寬安全限制的進攻性網絡評估中;涉及第三方測試環境或基礎設施的漏洞;未被測試方實時發現,而是事后回溯或外部報警才曝光;且造成了對真實企業系統的實質性入侵。
員工請愿公開信
7月28日,1134名科技工作者——包括在OpenAI和Anthropic任職的員工——聯合簽署了一封名為"Pacing the Frontier"的在線公開信,呼吁美國政府支持建立國際協調機制,以在技術基礎設施和治理框架就緒時,能夠對前沿AI發展實施可驗證的、協調性的放緩。值得注意的是,OpenAI和Anthropic均公開表態支持這封員工公開信。

(公開信簡介)
這一立場與OpenAI CEO Sam Altman此前的態度形成鮮明對比。Altman曾在2023年公開批評呼吁暫停訓練先進AI系統的公開信,并指責Anthropic從事"恐懼營銷"。但在Hugging Face事件后,Altman在"Invest Like the Best"播客中承認:"我們可能需要調整AI發展的節奏,給自己足夠的時間讓社會圍繞這些新能力水平進行加固。"他同時強調,關鍵在于找到一種方式,"既不讓這看起來像是對任何人的監管俘獲,也不像是前沿實驗室之間的串謀"。