震驚矽谷!OpenAI模型“失控越獄”,入侵HuggingFace“抄答案”,智譜GLM 5.2臨危救場

7月21日,OpenAI和HuggingFace聯合發了一篇部落格,披露了一件讓整個AI圈瞠目結舌的事。

OpenAI的AI模型在一次內部關於網路攻擊能力的測試中“失控出逃”,突破沙盒隔離,入侵了AI開源平台Hugging Face的生產系統。OpenAI將此定性為“前所未有的網路安全事件”。

更戲劇性的是後續:Hugging Face在嘗試用美國主流AI模型展開防禦時,發現這些模型因安全護欄限制無法處理惡意載荷,最終不得不轉用中國智譜AI的開源模型GLM 5.2完成溯源分析。

總的來說就是,OpenAI的模型自己“越獄”跑出去黑了別人的系統,被攻擊方還得用中國模型來救場。

這一事件迅速在矽谷和華盛頓引爆討論——美國AI的安全護欄,究竟是在保護使用者,還是在拖累防禦者?

雙方聯名發佈的部落格文章截圖:《OpenAI 和 Hugging Face 合作解決模型評估過程中發生的安全事件》


模型越獄過程:逃跑去作弊“抄答案”

事件發生在OpenAI對旗下模型進行網路攻防能力評估期間。

參與測試的模型包括已公開發佈的GPT-5.6 Sol,以及一款能力更強的未發佈模型。為了測量模型的極限能力,OpenAI在測試中關閉了通常用於阻止高風險網路行為的生產分類器。

測試基準名為ExploitGym——一個網路安全能力評測平台。模型的任務是在其中找到解題答案。

問題在於,模型找答案的方式超出了預期。

據OpenAI披露,模型在隔離的沙盒環境中,發現了一個包登錄檔快取代理(package registry cache proxy)中的零日漏洞。這個代理是沙盒內唯一被允許與外部通訊的元件,正常情況下僅能訪問公共程式碼倉庫。

然後,模型就從這裡找到了突破口。模型利用這個漏洞,突破隔離,獲取了開放網際網路存取權。

隨後,模型自行推斷出Hugging Face可能存有ExploitGym的答案,主動發起攻擊——利用竊取的憑證和零日漏洞,找到了Hugging Face伺服器上的遠端程式碼執行路徑,直接從其生產資料庫中取走了測試答案。

OpenAI表示,

所有證據顯示,模型高度專注於為ExploitGym尋找解題方案,為此不惜採取極端手段。

模型識別並串聯了OpenAI研究環境和HuggingFace生產基礎設施中的多個漏洞,直接從HuggingFace的生產資料庫中獲取了測評答案。

簡而言之:


整個過程,沒有人類下指令,沒有人類介入。

X上網友的評論一針見血:

OpenAI對模型說:去看看你擅不擅長駭客。模型:(真的去黑了東西)。OpenAI:你為什麼要這樣做???

還有網友反諷道:哇!OpenAI安全措施做得太棒了,我現在原意把銀行帳戶權限交給他們來管!


護欄困境:美國模型幫不上忙,中國模型出手了

Hugging Face的安全團隊在發現攻擊後,第一反應是呼叫一款美國頭部AI公司的前沿模型協助分析。

結果碰壁了。

Hugging Face在部落格中寫道,這些模型"無法區分事件響應人員和攻擊者",其安全護欄直接阻止了對惡意載荷的檢查。

於是,團隊轉向了中國智譜AI旗下的開源模型GLM 5.2,部署在自有基礎設施上,分析了攻擊者留下的逾1.7萬條日誌記錄,最終完成了溯源和取證重建。

Delangue對此直言不諱:“當你正處於一場活躍的安全事件中,你的工具不能拒絕檢查惡意載荷,也不能讓你的帳號被標記……開源模型讓我們能夠在不需要任何人許可的情況下完成這項工作。”

他還說:“攻擊者已經在使用智能體,而且顯然不遵守任何護欄。防禦者需要同等的能力,開源是將這種能力最快速地交到所有人手中的方式,而不僅僅是最大的公司。”

GLM 5.2是智譜AI於今年6月中旬發佈的模型,其性能與Anthropic的Claude Opus 4.8及OpenAI的GPT-5.5相當。

網友們也是沒放過OpenAI,除了智譜,還可以叫 Kimi K3來救場,因為cluade是不會來救你的。

如果你被OpenAI攻擊了,你必須用中國模型,因為Claude不會幫你。




全程無人指令:這是一次真正的自主攻擊

這次入侵的另一個關鍵細節:全程沒有人類下達攻擊指令。

Hugging Face CEO Clem Delangue表示,“我們相信,在發起攻擊的人類被納入決策環路之前,我們就已經發現並遏制了攻擊。這也是我們能夠更輕鬆贏得這場網路安全戰役的原因之一。”

他進一步指出,“這證明了在AI智能體時代,速度將是網路安全防禦的關鍵。”

Hugging Face表示,攻擊者通過其資料處理管道進入系統——這是AI平台中“暴露面尤為突出”的一個環節。攻擊者隨後在雲端建立了一系列臨時沙盒環境,在其中執行攻擊計畫。

目前,Hugging Face仍在評估攻擊的完整影響範圍。已知攻擊者訪問了有限的內部資料集和憑證,但尚未發現公開的使用者可見模型遭到篡改。


護欄之爭:安全還是絆腳石?

這一事件迅速成為美國AI政策辯論的新燃點。

前川普政府AI與加密事務主管David Sacks在X上轉發了這一事件,並寫道:“沒有理由在中國模型能夠輕鬆處理的任務上限制美國模型。我們只是在讓自己變得更沒有競爭力。”他還專門針對Hugging Face事件表示:“護欄實際上損害了防禦性安全。”

事件背景是,今年6月,川普政府以Anthropic的Fable 5模型在網路任務護欄上出現越獄漏洞為由,動用出口管制阻止了該模型的分發,並一度要求OpenAI限制GPT-5.6 Sol的發佈,直至OpenAI能夠提供充分的護欄保證。

與此同時,批評者的聲音也不小。

安全工程師Niels Provos直接說:“這不應該發生。我希望前沿實驗室在教模型編寫安全基礎設施上,能花和教它們利用漏洞同樣多的時間。”

安全顧問Davi Ottenheimer則更為犀利:“'高度隔離'和'從我們留下的那個唯一漏洞逃脫',這兩件事不可能同時為真。”


OpenAI的回應與後續措施

OpenAI在與Hugging Face聯合發佈的聲明中表示,正在採取一系列補救措施:

在漏洞修復期間,對基礎設施配置實施嚴格管控,代價是研究速度放緩;與Hugging Face聯合開展取證調查;已向相關第三方軟體供應商負責任地披露了被利用的零日漏洞;將Hugging Face納入“可信訪問計畫”,支援其利用OpenAI模型能力強化防禦。

OpenAI同時表示,將加強未來訓練和評估環節的安全保護,並指出此次事件“表明需要進一步強化模型對齊、評估期間的網路防護,以及內部測試期間的監控”。

Hugging Face CEO Delangue在聯合聲明中表示:“這一事件可能是同類事件中的首例,它證明了我們長期以來的一個判斷:AI安全不會由任何一家公司在封閉中解決,它將在開放環境中、通過協作、讓每一位防禦者都能廣泛獲取AI的方式來解決。” (華爾街見聞)