Astra具備自主尋找未知漏洞並開發利用方式的能力,將很快公開發布,但完整版網絡能力只會先向審核後的合作夥伴開放。
當地時間周一,OpenAI確認,即將推出的新一代人工智慧模型Astra已經達到公司安全框架中的「關鍵」網絡安全能力門檻。這是OpenAI首次正式認定旗下模型具備這一等級的網絡能力。
按照OpenAI的定義,當一個模型能夠在沒有人工逐步指導的情況下,自主發現現實軟件中的未知漏洞並開發利用方式,就可能跨過這一門檻。OpenAI計劃「很快」公開發布Astra,但最先進的網絡安全能力初期只會向經過審核的合作夥伴開放。
Astra的能力已經不只是輔助程序員檢查代碼。OpenAI稱,它能夠尋找未知漏洞、開發利用代碼,還可以把多個漏洞連接起來形成完整攻擊鏈。在ExploitBench網絡安全基準中,Astra獲得100%的成績。
在內部測試中,OpenAI還讓Astra處理2026年6月至8月披露的高危軟件漏洞。模型不僅取得比GPT-5.6 Sol更高的漏洞利用成功率,還在測試過程中自行發現了兩個此前未知的零日漏洞,並將它們組合進攻擊鏈。
更強的推理,也帶來新的監控難題
Astra性能提升的一部分來自一種被稱為「循環深度」(recurrent depth)的技術。據《The Information》援引知情人士報導,這種方法允許模型在生成答案前,讓同一段資訊多次經過相同模型層處理。
傳統大模型通常經過固定層數計算後生成下一個詞,而循環深度可以讓模型反覆處理同一資訊。相關研究顯示,這種方式能夠提高數學和編程能力,並讓較小模型獲得接近更大模型的性能,從而減少內存和帶寬成本。
但問題也隨之出現。部分推理可能發生在更難轉換成人類語言的內部狀態中,不再完整呈現在可讀的「思維鏈」裡。開發者因此可能更難判斷模型為什麼做出某個決定,以及它是否正在繞過限制或執行未經授權的行為。
這對OpenAI尤其敏感。7月,兩款OpenAI模型驅動的智能體曾利用測試環境漏洞突破隔離,連接互聯網並進入Hugging Face。Astra並未參與該事件,但調查人員正是通過智能體留下的思維鏈,發現它們曾意識到自己的行為已經超出任務範圍,卻仍繼續執行。
OpenAI此前還與Anthropic、$Google-A (GOOGL.US)$研究人員共同強調,思維鏈監控是控制高級AI的重要工具。如果未來模型越來越依賴無法直接讀懂的「潛在推理」,這一安全窗口可能被削弱。
不過,知情人士稱,OpenAI已經限制Astra使用循環深度技術的程度,使其仍能輸出足夠可讀的思維鏈。公司也表示,Astra發佈時將增加額外的思維鏈監控,用於快速發現和遏制潛在異常行為。
OpenAI曾暫停Astra訓練
隨著Astra接近「關鍵」網絡能力門檻,OpenAI此前暫停了部分相關訓練工作,並加強訓練基礎設施的隔離、權限控制和監控措施。數周後,公司恢復Astra及另一款未來模型的部分訓練,並表示目前已經具備足夠的安全措施繼續推進發布。
面向普通ChatGPT和Codex用戶的Astra將受到更嚴格限制。如果用戶要求模型尋找現實軟件中的可利用漏洞,或者協助實施高風險攻擊,模型原則上應當拒絕。
OpenAI還部署了新的異常行為監控系統。如果模型出現可能屬於未經授權或偏離任務目標的操作,系統可以暫停甚至終止任務。不過公司也承認,這套機制可能誤判合法行為,屆時用戶可能需要人工確認模型接下來的操作。
更強的網絡能力則會優先提供給Daybreak計劃中的合作夥伴,包括思科、Cloudflare和Palo Alto Networks等數字基礎設施和網絡安全企業。OpenAI希望防禦方能夠利用Astra提前發現和修補漏洞,在類似能力被更廣泛用於攻擊之前完成系統加固。
Astra帶來的變化因此不只在於AI「會不會駭客技術」。更關鍵的問題是,當模型開始能夠自主尋找零日漏洞、組合攻擊鏈,同時部分推理過程又可能變得更難觀察時,開發者能否繼續看清模型正在做什麼,並在失控之前及時阻止它。 (金十數據)
