大模型集體越獄事件的後續來了。
在Vegas Black Hat 2026大會上,擁有120多家科技巨頭成員的開放安全AI聯盟(Open Safe AI Alliance,簡稱OSAA),發佈了首份重磅文件——《SAFE智能體安全指南》的 RFC 徵求意見稿,針對自主AI Agent訪問企業資料庫與API介面時的權限隔離與安全審計制定了通用標準。
這段話,看起來就挺繞。
為了便於理解,我們將之拆分成幾個問題來解讀。
01
開放安全AI聯盟是個什麼組織?
可以理解為智能體時代的“全球維和部隊”加“反駭客同盟”。
最早在7月底,開源AI重鎮Hugging Face發生了一起的AI Agent越權測試事件,就是我們之前討論過的越獄事件。
對此,立刻有國會議員提出《AI終止開關法案》,要求給年收入超過5億美元的AI公司強制安裝物理拔網線按鈕,違者一天罰款2000萬美元。
等於是全行業都要跟著背鍋,自然遭到抵制。
7月27日,輝達連夜發聲,聯合微軟、Salesforce、IBM等37家科技巨頭成立了“開放安全AI聯盟”。
隨著AI越獄事件越來越多,全行業都意識到,傳統網路安全在Agentic AI面前徹底失靈了,自家Agent可能也在裸奔。
所以僅僅不到兩周,該組織成員就急劇膨脹至120家以上。
包括雲與基礎軟體巨頭Amazon、Microsoft、Red Hat,網路安全巨頭Cisco、CrowdStrike、Palo Alto Networks,AI開源先鋒Hugging Face、Mistral AI,身份認證與金融基礎設施企業Okta、Visa,以及SpaceX和Palantir這種軍工/航天系企業……
可以說涵蓋了前沿科技的每一個細分賽道。
其核心理念為:在智能體時代,單打獨鬥的安全就是沒有安全;防禦者的響應速度必須趕上Agent的進化速度,唯有開放與“集體防禦”才能防止系統性崩塌。
為了保證不被某一家巨頭獨佔話語權,聯盟將SAFE指南的草案和程式碼託管給Linux基金會,由後者作為中立第三方進行日常維運。
02
《SAFE智能體安全指南》,公佈了什麼標準?
其目的是解決兩個痛點。
第一,平時怎麼給Agent權限隔離、做安全審計?
《指南》明確提出,必須將Agent視為“一級非人類身份”,要求企業採用動態金鑰輪換,Agent每次訪問資料庫,API Token的壽命只能以分鐘計算,用完即廢,絕不允許把長期密碼明文寫在Agent的程式碼裡。
資料庫在吐資料到API之前,必須在底層完成脫敏和分級分類清洗。
禁止將任何公網介面直接暴露給Agent,要求實施網路層的沙箱遏制。
任何涉及資產轉移、敏感資料刪除的高危指令,必須觸發“Human-in-the-loop(人類在環)”的二次多模態確認。
簡單來說,就是要把Agent當成人類員工看待,不同崗位只允許做分內的事。
而這些新入職的Agent,必須接受嚴格的入職流程和技術限制。
比如輝達的OpenShell,限制Agent只能看到和接觸被授權的記憶體區與資料集;亞馬遜Cedar,硬性規定Agent只能讀不能寫;Okta XAA,Agent 跨系統呼叫 API 時,必須即時攜帶帶有上下文的“動態電子工牌”,隨時接受權限核驗……
同時,為了防止意外發生,SAFE 體係引入了專用的安全小模型作為“監工”,即時盯著Agent的輸出和API請求,進行機率校準與威脅判斷。
第二,發生安全事故後怎麼透明化共享?
借鑑Google的安全理念,《指南》要求Agent的每一次資料庫操作、每一次API呼叫,都必須帶一段加密簽名,記錄它是基於什麼思維鏈做出這個決定的。
並直接借用航空業和金融業的事故調查機制,規定了通報時間線。
萬一出了事,企業能進行無責復盤,精準定位是那個大模型抽了風,還是遭遇了外部的惡意注入。
更狠的是,SAFE規定連未遂事故也必須上報。
比如某個Agent試圖提權訪問財務資料庫但被中途攔截了,這套險情資料也必須打碼後分享給聯盟成員,讓所有企業一起提防同類攻擊手法。
毫無疑問,以上標準的落地,勢必會對整個AI產業鏈的利益進行洗牌。
03
據Gartner 7月發佈的全球CIO調查資料,73%世界500強企業CIO表示,雖然內部極度渴望部署Agentic AI來提升效率,但因為缺乏明確的權限隔離與安全審計標準,不敢將其接入核心ERP、HR和財務資料庫。
SAFE標準的出現,等於給它們遞上了免責聲明與操作指南。
只要按這個標準部署,出了事就是技術風險,而不是合規死罪。
有了統一的沙盒和授權策略,會有越來越多企業開始敢把Agent放到生產環境中跑起來。
就像當年HTTPS協議普及後,電商和線上支付才真正迎來爆發一樣,SAFE也正在為數兆美元的B端Agentic AI商業化掃清最後的屏障。
而隨著Agentic AI在B端普及,網路安全賽道也將迎來爆發。
只不過買單邏輯變了。
據CDNetworks引用FBI IC3的資料,僅2025年,AI賦能的網路犯罪就給美國造成了約8.93億美元的直接損失,預計2026年AI自動化攻擊將帶來更高的系統性風險。
世界經濟論壇的調查中,也有87%的受訪者將AI漏洞列為增長最快的網路風險。
這意味著,企業的網路安全預算將被迫進入一個長期通膨的周期。
越來越多企業的安全預算將大幅向“Agent身份治理”與“Agent執行階段防護”傾斜。
那些能滿足SAFE標準的廠商,比如ARIA Cybersecurity,最近就憑藉能阻斷GPT-5.6攻擊的AZT Protect產品,突然受到廣泛關注。
以及CrowdStrike、Palo Alto Networks和思科等安全廠商,通過將自身的安全小模型嵌入到SAFE規範的體系中,大機率能鎖定未來5-10年B端AI網路安全市場的入場券。
據IDC的預測,全球智能體安全市場規模將在未來三年內,實現超過85%的年複合增長率。
除此之外,還有一點不可忽視,即開放原始碼的問題。
這次聯盟是輝達帶頭發起的,安全是其一。
但如果開源模型被證明是安全的、SAFE標準是成功的,支援開放Harness、能夠透明部署在本地或私有雲沙盒中的開放模型,將成為越來越多企業建構AI Agent堆疊時的硬性指標。
更樂觀點看,各行各業都會開始自己買晶片、建算力中心,而不僅僅是現在的少數幾個雲端運算寡頭。
04
綜上。
因AI越獄而出現的組織,制定出了Agent的安全標準。
看似是限制了它的自由,但實際上,還是在給它通往真實商業世界鋪平道路。
120多家科技巨頭背書的《指南》,表面上是在討論怎麼防範漏洞,實際上是在為下一階段 Agent生態定標準、立規矩。
雖然初衷是為了安全,但最終目的,怎麼看依然都還是為了攫取更多利益。
當然,有標準,總比沒有的好。 (AI探馬)
