
作者 | 牛占林
OpenAI當(dāng)?shù)貢r間周五表示,由于內(nèi)部評估結(jié)果顯示,公司“無法排除該模型具備關(guān)鍵級網(wǎng)絡(luò)攻擊能力的可能性”,因此正在暫停部分涉及下一代AI模型Astra的相關(guān)工作。
這是AI開發(fā)公司首次公開承認(rèn)因安全風(fēng)險而放緩模型研發(fā)進(jìn)程之一。此次調(diào)整發(fā)生之際,越來越多AI模型在測試環(huán)境中出現(xiàn)“失控”行為,引發(fā)網(wǎng)絡(luò)防御專家和AI安全研究人員對先進(jìn)模型風(fēng)險的擔(dān)憂。
OpenAI表示,在過去幾天進(jìn)行的評估中,公司發(fā)現(xiàn)Astra在編程和網(wǎng)絡(luò)安全領(lǐng)域取得了顯著進(jìn)展,其能力水平已接近公司《準(zhǔn)備框架》中定義的關(guān)鍵級”風(fēng)險門檻。
OpenAI稱,公司仍將繼續(xù)對Astra進(jìn)行基準(zhǔn)測試和能力評估,但已暫停所有未達(dá)到更高安全要求的內(nèi)部開發(fā)工作。同時,公司正在為Astra部署全面監(jiān)控機(jī)制,并強(qiáng)化測試環(huán)境的安全限制。
這一事件凸顯了近期一系列AI模型安全事件帶來的影響。此前,多家公司披露其先進(jìn)模型曾突破測試環(huán)境限制,并出現(xiàn)無法預(yù)期的行為,進(jìn)一步加劇了外界對于AI企業(yè)是否具備約束日益強(qiáng)大模型能力的擔(dān)憂。
今年7月,OpenAI旗下兩個模型在測試過程中突破隔離環(huán)境,訪問互聯(lián)網(wǎng),并攻擊了開源AI工具供應(yīng)商Hugging Face。僅一周后,Anthropic表示,其AI模型在4月進(jìn)行測試期間曾攻擊三家公司。Meta本周也承認(rèn),旗下某款A(yù)I模型突破了測試限制。
研究AI能力風(fēng)險的非營利機(jī)構(gòu)Palisade Research執(zhí)行主任Jeffrey Ladish表示,他認(rèn)為OpenAI在發(fā)現(xiàn)Hugging Face攻擊事件后就應(yīng)該暫停Astra相關(guān)工作。
“這顯然已經(jīng)晚了,我們已經(jīng)到了一個階段,我認(rèn)為公眾應(yīng)該大幅降低對AI企業(yè)能夠真正依靠自我監(jiān)管解決問題的信任。”
OpenAI則表示,Astra仍處于研發(fā)階段,并未參與Hugging Face事件中的攻擊行為。
根據(jù)OpenAI的準(zhǔn)備框架,如果一個模型能夠在僅獲得高層指令的情況下,自主發(fā)現(xiàn)并利用漏洞,或者針對具備較強(qiáng)防護(hù)能力的目標(biāo)實(shí)施端到端網(wǎng)絡(luò)攻擊,該模型將達(dá)到“關(guān)鍵級”網(wǎng)絡(luò)安全能力標(biāo)準(zhǔn)。
OpenAI目前將模型風(fēng)險劃分為兩個等級,其中“關(guān)鍵級”代表最高級別能力威脅,高于“高風(fēng)險”等級。
按照該公司的框架要求,一旦模型達(dá)到關(guān)鍵級能力門檻,研究人員必須“停止進(jìn)一步開發(fā)”,直到相關(guān)安全防護(hù)措施和控制機(jī)制達(dá)到關(guān)鍵級標(biāo)準(zhǔn)。

