Fortune雜誌─OpenAI最新模型,加速走向失控的算力怪獸?

AI速讀
OpenAI 正式推出 GPT-6 Astra,透過「電腦使用」功能實現從對話到自動化執行的跨越,並在 ARC-AGI-3 等高難度測試中展現壓倒性優勢。該模型在德州 Stargate 資料中心使用逾 10 萬塊 GPU 訓練,標誌著 AGI 時代的逐步到來。然而,其引入的「循環深度」技術雖提升效率,卻使 AI 的推理過程(思維鏈)對人類而言變得不透明,引發安全專家警告 AI 可能走向失控。目前 Astra 僅限部分企業客戶優先使用,高級安全功能受嚴格管制。

OpenAI最新發佈的旗艦模型GPT-6 Astra,標誌著AI正從“陪你聊天”徹底跨越到“替你打工”,它不僅能以“超人”速度跑表格、搞自動化,更在複雜推理上超越前代模型。然而,在這場動用十萬塊GPU的算力豪賭背後,新架構帶來的“黑盒效應”也讓人類面臨失去監控AI推理過程的失控風險。

當頂尖AI開始具備無人監督就能尋找網路漏洞的能力,我們究竟是迎來了生產力爆炸的黃金時代,還是正一步步邁向無法控制的算力怪獸?本文將拆解Astra帶來的技術突破、安全爭議及其背後的商業考量。

當地時間9月3日,OpenAI發佈新一代旗艦模型GPT-6 Astra,其標誌性功能之一名為“電腦使用”,旨在像人類一樣操作電腦。

圖片來源:Matt RAMEY—AFP/Getty Images

在OpenAI展示的一段視訊中,一個人坐在椅子上,用語音指揮電腦,儘管有事先編排的痕跡,但整個過程的互動較為流暢自然。

OpenAI表示,這只是其眾多全新高級功能之一,其他功能還包括數學運算能力、軟體工程和網路安全防禦。OpenAI聯合創始人兼總裁格雷格·布羅克曼對記者表示,“電腦使用能力是這些新功能中尤為重要的部分。”他說,Astra能夠以“超人”的速度處理電子表格、填寫表單、瀏覽網頁。

OpenAI將 Astra稱為“目前全球最智能、且對齊程度最高的模型”,其發佈的基準測試結果顯示,Astra在廣泛任務上均超越其此前表現最佳的模型GPT-5.6 Sol,以及Anthropic的最強模型Claude Fable 5.1。在一項難度較高的基準測試ARC-AGI-3中,Astra得分98.6%,而GPT-5.6 Sol僅得7.8%,Anthropic的Claude Opus 5得分為30%,該測試旨在衡量模型對未見情境的推理能力。在高難度的網路安全挑戰ExploitBench中,Astra獲得了滿分,遠超GPT-5.6 Sol的78.5%。

OpenAI並非首個推出可操控電腦的AI智能體的公司。2024年,Anthropic率先推出測試版程序;今年2月,Perplexity也建構了一個能夠操控虛擬電腦完成使用者任務的系統。

布羅克曼表示,自2015年加入OpenAI以來,他就在思考如何讓AI像人類一樣使用電腦。在他看來,電腦使用功能可被視為“AGI時代”的開端。AGI即通用人工智慧,這一術語的確切定義至今仍然存在爭議,人工智慧研究人員對此看法不一。OpenAI曾將AGI定義為“能夠在所有具有經濟價值的工作中,達到或超越人類水平的自動化系統”。

“如果有人認為,我們當下已身處AGI時代,這種感受有一定的道理。如果你想說Astra是第一個AGI,那也是合理的。”布羅克曼指出,AGI的實現並非如他最初預測的那樣一蹴而就,而是逐步積累的結果。

對多數人來說,這種操作方式仍未成為日常使用電腦工作的主流,電腦使用功能也不會一夜之間出現在所有辦公室。OpenAI將 Astra 的發佈範圍限制在部分企業客戶,包括其專注於網路安全的“Daybreak”項目的客戶。OpenAI表示,Astra將在“未來幾天內”向所有Plus、Pro和Enterprise使用者開放,使用者也可以通過 OpenAI API和AWS使用。該公司稱,提供給這些客戶的版本將無法執行“高級網路安全任務”。

OpenAI的發言人告訴《財富》雜誌,Astra是“一個非常大的模型”,發佈初期限制使用範圍是為了擴展其計算能力。OpenAI研究副總裁艾丹·克拉克稱,Astra的開發還涉及該公司“迄今為止最大規模”的訓練,“這是我們首次在德克薩斯州Stargate資料中心使用超過10萬塊GPU進行預訓練。”

OpenAI表示已增加更多網路安全保障措施

在7月Hugging Face遭智能體入侵事件後,OpenAI推遲了Astra的發佈,以增加額外保障措施。此後,OpenAI加強了監控,並進一步隔離了訓練環境,儘管有觀點認為其新增的監控措施不夠充分。

根據美國人工智慧安全框架的條款,OpenAI在發佈前將Astra提交美國政府審查。該框架是科技公司與川普政府之間的自願協議,其細節尚未公開,並非正式的公開流程。

布羅克曼表示,OpenAI與政府進行了“標準測試流程”,當被追問流程細節時,布羅克曼透露更多。“我只是不想做出錯誤的表述,因為流程的具體運作方式存在細微差別。”

Astra也是OpenAI首個達到其“關鍵網路安全能力閾值”的模型,該閾值是根據OpenAI的“準備框架”制定的一項內部政策,規定了公司將根據模型存在的風險採取的安全防範措施。這意味著在合適的條件下,Astra能夠在無人監督的情況下發現並利用此前未知的安全漏洞。

本周早些時候,OpenAI宣佈,僅向部分合作夥伴開放Astra最先進的網路安全功能。提供給其Daybreak客戶版本允許獲批客戶使用該模型執行常見的網路防禦任務,但不得用於開發漏洞利用程序,或執行可能用於發起網路攻擊的任務。

安全專家警告:Astra或使未來AI智能體更難監控

人工智慧安全專家對OpenAI建構Astra的方式表示擔憂,他們認為這可能加速人類失去監控AI智能體推理過程的能力。

在模型的內部架構中,OpenAI部分採用了一種被稱為“循環深度”或“循環Transformer”的方法,能夠顯著提高人工智慧模型的效率,因為它可以減少處理每個指令所需的計算能力。在眾多企業抱怨使用最先進的AI模型成本高昂之時,這是一項寶貴的優勢。

然而,新流程也意味著AI模型“思維鏈”(即其推理步驟)不再以自然語言表達,人類更難監控模型的行為及其動機。目前,思維鏈監控是確保AI智能體未採取意外行動或未經授權行動的方法之一。

OpenAI首席科學家雅庫布·帕喬基表示,OpenAI限制了循環Transformer架構的使用範圍,從而保證了模型推理過程的可讀性。

帕喬基在X平台上寫道,OpenAI深切關注思維鏈監控問題,並且“自我們最初的推理模型問世以來,OpenAI始終致力於維護和利用思維鏈監控”。帕喬基表示,OpenAI未來將分享更多關於Astra架構的細節。

帕喬基認為,思維鏈監控未來可能會變得更具挑戰性,但這並非源於架構的改變,“我們可以採取措施來加強它,這是我們當前研究項目的核心目標之一,”他寫道。

一些推動制定人工智慧安全標準的組織同樣表達了擔憂。在帕喬基發聲前,曾任OpenAI安全研究員、現任非營利組織Guidelight AI Standards負責人的史蒂芬·阿德勒在X上寫道,“OpenAI似乎正在違反AI行業中為數不多的紅線之一。”

總部位於華盛頓特區的智庫AI政策網路政策總監彼得·威爾德福德告訴《財富》雜誌,OpenAI使用循環深度技術“可能非常令人擔憂而且不計後果”。

他指出,在7月Hugging Face遭智能體入侵事件中,OpenAI和外部AI評估公司能夠拼湊出事情經過的幾種方法之一,就是讀取模型的思維鏈。OpenAI還表示,未來將投入大量資源進行即時思維鏈監控,以防止未來發生類似的失控人工智慧事件。“如果OpenAI真的要放棄這種方法,那將是錯誤的方向,”他說。

一些AI安全專家對OpenAI在Astra中使用循環Transformer感到擔憂,他們擔心OpenAI此舉將使這項技術常態化,開創先例,其他人工智慧公司很可能會效仿並加以擴展,最終導致人工智慧模型的推理過程對人類完全不透明。

前OpenAI治理研究員丹尼爾·科科塔伊洛回應帕喬基稱,“即使OpenAI不進一步採用(使模型思維鏈更難理解的架構),其他公司也可能會這樣做。”

科科塔伊洛敦促帕喬基牽頭制定行業範圍內的思維鏈可監控性標準,“要麼阻止其走向衰落,要麼更進一步,引領行業走向巔峰。我認為這不僅需要政治意願,還需要深思熟慮的技術規範。”(財富FORTUNE)