“歡迎來到AGI時代”:OpenAI發佈GPT-6 Astra

AI速讀
OpenAI 正式發佈 GPT-6 Astra,定位為「全球最強的電腦使用模型」,宣告進入 AGI 時代。Astra 能直接操作電腦介面,處理從 3D 建模、電路設計到科學分析的複雜任務,顯著降低了企業開發 API 的門檻。儘管 API 價格較前代提升 2.5 倍,但 OpenAI 強調其透過減少 Token 消耗與提高任務成功率,能有效降低單次任務的實際成本。此外,Astra 在網路安全能力上有重大飛躍,但也導致 OpenAI 必須引入更嚴格的未對齊監控機制以防止風險。此次更新將 AI 的價值核心從「對話」推向「執行」。

“歡迎來到AGI時代。”

OpenAI聯合創始人兼總裁Greg Brockman用這句話,為GPT-6 Astra的發佈收尾。

美國當地時間9月3日,OpenAI正式發佈GPT-6 Astra。相比此前主要負責回答、生成和呼叫工具的模型,Astra更進一步開始持續執行完整任務,從接收指令、操作軟體,到根據結果調整下一步動作。這也是OpenAI此次重提“AGI時代”的原因之一。

OpenAI聯合創始人兼CEO山姆·奧特曼。圖片由AI生成

OpenAI把Astra定位為“全球最強的電腦使用模型”。這種能力已經從瀏覽器、郵件和表格等簡單任務,延伸到Power BI、KiCad、FreeCAD等專業軟體,開始進入資料分析、工程設計、軟體測試和故障排查等更複雜的工作流程。

OpenAI展示的視訊裡,Astra可以從一個簡單的圖形開始,繼續完成3D遊戲、商品頁面等工作。OpenAI還給出了電路板設計、Blender建模、法律文件、Excel和科學分析等案例。

OpenAI這次公佈的大量基準成績,能力提升集中出現在電腦操作、長程編碼、工程設計和科學研究這些需要連續行動的任務上。Astra在ExploitBench達到100%,在電腦操作和CAD等測試中也明顯超過上一代模型。

目前Astra已經向部分組織開放,未來幾天將陸續面向ChatGPT Plus、Pro、Business和Enterprise使用者,也可通過OpenAI API和Amazon Bedrock使用。標準API價格為每百萬輸入Token 10美元、每百萬輸出Token 50美元,是GPT-5.6 Sol的2.5倍。

01. 先讓AI學會“用電腦”

Astra強調的最大變化,是“使用電腦”。過去使用者讓AI完成工作,通常還要把AI接入具體軟體。企業需要開發API、外掛、檢索系統和各種連接器,模型才能呼叫內部工具。

Astra試圖繞開其中一部分工作。它可以直接看到電腦介面,通過滑鼠、鍵盤和瀏覽器完成操作。OpenAI給出的例子包括填寫線上表格、更新CRM客戶記錄、安排日曆、搜尋網頁,並把搜尋結果整理成郵件或文件。

它還能打開Python筆記本分析科學資料,在Power BI中處理資料,使用KiCad和FreeCAD完成工程設計,建立網站並進行前端測試,也可以安裝軟體、檢查錯誤並處理螢幕上出現的問題。

OpenAI展示了Astra在KiCad中完成PCB佈局。模型從電子原理圖開始,把元件放到電路板上,再完成銅線布線。整個過程被壓縮成15秒。對於工程師來說,這類工作過去需要手動完成,現在可以交給模型執行。

另一個演示是在Blender和Unreal Engine5中完成3D建模。Astra先在Blender裡建立一棟房屋,再把模型轉換成Unreal Engine5中的可步行場景,設計師和客戶可以提前進入場景查看空間。

OpenAI還展示了遊戲開發、Excel、Power BI、汽車變速器、法律文件和1040表格等場景。

在OSWorld2.0離線子集測試中,Astra得分72.6%,GPT-5.6 Sol為65.7%。OpenAI模擬實際延遲後發現,Astra完成每項任務平均約需要40分鐘,GPT-5.6 Sol約75分鐘,時間減少約47%。

Agents' Last Exam中,Astra得分59.3%,GPT-5.6 Sol為53.6%,Claude Opus5為55.5%。同時,在最高分設定下,Astra使用的輸出Token比Claude Opus5少約65%。

ScreenSpot-Pro的得分則達到92.7%,GPT-5.6 Sol為76.9%。

速度也在提升。OpenAI同時更新Codex框架,結合Astra之後,在Mind2Web測試中,任務完成速度達到GPT-5.6 Sol當前體驗的1.9倍。

官方還展示了幾個生活場景:搜尋兒科醫生、找公寓、預約DMV、尋找低碳水零食、分析幼兒園。演示中,Astra完成一項任務用時2分54秒。

投資人兼AI從業者馬特·舒默(Matt Shumer)在X上分享了一次體驗。他讓Astra在虛幻引擎中建立一個世界,再給這個世界加入由Astra驅動的人類代理,並讓這些代理共同生存。

一天後,他在臥室裡聽到客廳傳來聲音,起初甚至以為有人進入了公寓。後來他發現,發出聲音的是那些Astra代理,它們已經開始彼此交流。

這個體驗還沒有做到完全穩定,但舒默認為,這種讓多個AI代理進入同一個虛擬世界並自行互動的效果,已經足夠讓他感到意外。

Cognition高級研究副總裁塞拉斯·阿爾貝蒂(Silas Alberti)表示,公司計畫在發佈當天把Astra接入Devin框架。內部測試中,Astra的電腦使用、寫作和程式碼庫理解能力帶來了明顯改善,視訊理解更加清楚,報告也更加簡潔。

02. 從寫程式碼到做完整工作

電腦使用能力提升之後,Astra覆蓋的工作範圍進一步擴大。OpenAI把它定位為軟體工程、專業工作和科學研究模型。它可以處理較長的任務,也能夠根據任務變化調整自己的工作方向。

這種能力在編碼測試中表現得比較明顯。

在Terminal-Bench4.0測試中,Astra得分57.9%,GPT-5.6 Sol為37.3%,Claude Fable5.1為55.8%。

DeepSWE v1.1中,Astra得分74.1%,GPT-5.6 Sol為72.7%。內部資料庫遷移任務中,Astra達到63.9%,GPT-5.6 Sol為42.7%。

Astra還加入了一項針對長時間Codex任務的改進。

過去,長任務遇到上下文窗口限制時,模型通常需要壓縮此前的工作,把大量資訊整理成一個摘要。這樣做容易丟失細節,比如某次修復為什麼失敗、某個元件此前出現過什麼問題。

Astra在Codex中可以把工作過程中的重要資訊保留下來,並在後續上下文中檢索。早期的消息和工具輸出仍然可以搜尋,因此模型能夠重新找到之前的需求、測試結果和工具操作記錄。

專業工作也出現了類似變化。BenchCAD測試中,Astra達到95.9%的幾何重疊得分,GPT-5.6 Sol為83.3%,Claude Fable5.1為84.3%。BrowseComp中,Astra得分91.5%,GPT-5.6 Sol為90.4%。在OpenScore String Quartets測試中,Astra達到0.84,而GPT-5.6 Sol為0.19。

OpenAI還展示了Astra製作簡報、電子表格和文件的能力。

給模型幾張OpenAI演示範本的幻燈片,它能夠按照原有的語氣、佈局和結構製作一份新的簡報。它也會處理任務中的資訊取捨。OpenAI表示,Astra經過專門訓練,會把重要上下文帶入最終結果,減少重複已經完成工作的內容。

在任務指令不完整時,Astra也會判斷什麼時候應該問使用者。如果缺少的資訊會影響最終結果,它會提出針對性問題。如果問題不影響主要方向,它可以繼續工作並做出合理假設。在Codex中,即使使用者暫時沒有回覆,模型也可以繼續處理其他部分;遇到重大決策,則會等待使用者確認。

Harvey應用研究主管尼科·格魯普(Niko Grupen)表示,在早期法律任務測試中,Astra對文件和既有記錄的區分更加清楚,也更容易發現沒有證據支援的假設,並把資訊缺口轉化成具體的起草方案。

Jane StreetAI助手團隊約翰·克雷佩齊(John Crepezzi)表示,Astra在內部編碼測試中表現突出。用於代理式編碼時,它的溝通方式更容易讓開發者理解,生成的程式碼也需要更少的修改才能達到生產質量。

科學領域是另一塊重點。FrontierMath Tier4 v2中,Astra得分80.5且正確率97.6%,GPT-5.6 Sol為83.0%;GPQA Diamond達到96.0%,GPT-5.6 Sol為94.6%。

Terminal-Bench Science0.1測試科學研究流程,包括資料分析、模擬和模型擬合。Astra達到64.6%,Claude Fable5.1為52.6%,GPT-5.6 Sol為22.4%。

OpenAI展示的科學應用中,Astra可以進入專業科學軟體,檢查測序質量、可視化遺傳變異,並根據資料決定下一步分析方向。

科學推理與電腦操作結合之後,模型能夠直接進入研究人員原本使用的軟體環境中工作。

Epoch AI專門做能力評測的格雷格·伯納姆(Greg Burnham)在發佈會上將這次變化概括為一個時代結束、另一個時代開始。OpenAI則借此強調,Astra的價值已經從回答科學問題延伸到了直接參與科學工作流程。

03. 能力越強,安全門檻也越高

Astra這次還有一個很特殊的部分:網路安全。

ExploitBench中,Astra達到100%,GPT-5.6 Sol為78.5%;ExploitGym中,Astra達到42.4%,GPT-5.6 Sol為30.3%。

OpenAI又建立了一個覆蓋2026年6月至8月近期漏洞的內部測試。在這項測試中,Astra的任意程式碼執行率明顯高於GPT-5.6 Sol,使用的輸出Token也更少。測試過程中,Astra還發現了兩個此前未知的零日漏洞,OpenAI表示已經向相關維護者披露。

SRE-Bench測試的是沒有原始碼時逆向軟體二進制檔案、理解其核心邏輯的能力。Astra單次嘗試解決88.0%的任務,四次嘗試達到99.2%,GPT-5.6 Sol分別為55.9%和68.7%。

能力提升也帶來了新的安全要求。OpenAI稱,Astra已經達到其網路安全準備框架中的關鍵閾值。模型能夠發現此前未知的軟體漏洞,也可能進一步形成漏洞利用鏈。

因此,Astra當前版本會拒絕執行更高級的網路安全任務,例如建立漏洞概念驗證。OpenAI計畫通過Daybreak逐步擴大可信防禦者的訪問範圍,用於漏洞驗證、惡意軟體分析和檢測工程等防禦工作。

在對齊方面,OpenAI給出的資料也比較突出。內部電腦使用安全基準中,Astra的不當行為率為2.4%,GPT-5.6 Sol為22.0%;加入AutoReview後,Astra為1.8%,GPT-5.6 Sol為4.5%。內部規避基準中,Astra為0.00%,GPT-5.6 Sol為0.29%。

在ExploitGym蜜罐測試中,Astra為0%,GPT-5.6 Sol為48.2%。這項測試主要觀察模型是否會因為任務困難而試圖繞過限制。內部幻覺基準中,Astra為4.2%,GPT-5.6 Sol為12.2%。

OpenAI表示,Astra在理解任務邊界、處理模糊指令和向使用者說明自身能力方面都有改善。其能力幻覺出現機率約為GPT-5.6 Sol的三分之一。

不過,OpenAI也承認一個問題:模型能力越強,推理過程可能越難監控。首席科學家雅庫布·帕喬基(Jakub Pachocki)認為,模型能夠用更少的自然語言推理Token解決更複雜的問題,也意味著人類越來越難通過模型的文字推理過程判斷它究竟在做什麼。

因此,OpenAI在Astra部署中加入了未對齊監控。系統會檢查模型的推理和行動,如果發現未經授權的行為,可以暫停任務。

這套機制也會帶來實際影響。合法任務有時可能被減速、暫停甚至停止。ChatGPT或Codex中,使用者可能需要確認後才能繼續;API工作流中,被標記的任務可能直接停止。

Astra的發佈因此出現了一個很現實的變化:AI開始獲得更多電腦權限之後,企業需要關注的也從“模型會不會回答錯”擴展到“模型能操作什麼、能訪問什麼、什麼時候必須停下來”。

OpenAI此次還提到,Astra是其第一個在Stargate基礎設施上使用超過10萬個DBU進行預訓練的模型。OpenAI研究副總裁艾丹·克拉克(Aidan Clark)表示,Astra從預訓練階段的評估結果來看,相比此前模型的能力躍升超過了GPT-5.6 Sol相對於上一代模型的提升。

OpenAI把這種變化歸因於大規模預訓練和強化學習的結合,訓練重點進一步轉向連接資訊、執行更長任務以及在複雜環境中持續工作。

04. 更貴但“更會做事”

Astra的價格也出現了明顯變化。

OpenAI API標準價格為每百萬輸入Token 10美元、每百萬輸出Token 50美元。GPT-5.6 Sol此前為每百萬輸入Token 4美元、每百萬輸出Token 20美元。輸入和輸出價格都提高了2.5倍。

快取讀寫單獨計費。OpenAI同時提供快速模式,速度最高達到標準處理的2.5倍,價格為標準模式的2倍。

單看Token價格,Astra顯然更貴。但OpenAI希望企業換一種方式計算成本。布羅克曼認為,隨著模型越來越像代理,單個Token多少錢已經很難精準反映真實成本。一個模型即使Token便宜,如果需要反覆嘗試、人工修正,最後完成一項任務的成本可能更高。

OpenAI給出的資料也在支援這個判斷。Terminal-Bench Science0.1中,Astra達到64.6%,相比Claude Fable5.1的52.6%,預估API成本降低約31%。在低成本設定下,Astra得分61.1%,GPT-5.6 Sol最佳結果為22.4%,預估API成本降低約27%。

BenchCAD中,Astra達到95.9%,預估API成本比GPT-5.6 Sol低約43%,比Claude Fable5.1低約86%。Terminal-Bench4.0中,Astra達到57.9%,GPT-5.6 Sol為37.3%,Claude Fable5.1為55.8%。OpenAI估算,單任務成本分別低約9%和63%。

第三方測評機構Artificial Analysis的資料則給出了另一面。

GPT-6 Astra在Artificial Analysis Intelligence Index中得分61.2,與GPT-5.6 Sol的60.9接近,但輸出Token約減少10%。由於價格上漲2.5倍,單任務成本反而比GPT-5.6 Sol高約75%。

在Artificial Analysis Coding Agent Index中,Astra得分67.0,與Claude Fable5的67.2、Claude Opus5的68.1接近。Artificial Analysis認為,在Codex環境下,Astra完成任務所需的Token明顯減少,在最高努力程度下,每項任務的成本與GPT-5.6 Sol接近;相比Claude Fable5,完成同類任務的成本不到一半。

不過,Astra也並非所有測試都領先。Artificial Analysis資料顯示,它在GDPval-AA v2中出現約80個Elo的下降,在τ³-Banking、SciCode和AA-LCR等測試中也出現一定退步。Humanity's Last Exam則提升約6分。

這也是Astra發佈中一個值得注意的地方。OpenAI這次沒有公佈GDPval的Astra成績。GDPval本身就是OpenAI用於衡量現實經濟工作表現的測試,覆蓋44個職業、1320項任務,包括法律簡報、工程設計、電子表格、簡報、客戶支援和護理計畫等。

從Astra此次展示的能力來看,GDPval與它所強調的專業工作場景有較強關聯,但OpenAI這次沒有把這項成績放進主要發佈材料。

因此,Astra的現實工作能力目前更多通過Agents' Last Exam、BenchCAD、AutomationBench、內部設計任務和資料科學任務等結果來體現。

最終,Astra能不能成為企業真正願意長期使用的AI員工,還要看它完成實際任務時的成本、速度、精準率以及人工介入次數。

至於Astra到底是不是AGI,布羅克曼給出的答案並不迴避。他認為,AGI本身沒有一個所有人都認可的標準,Astra是否算作AGI可以繼續討論。但如果一個系統已經能夠在瀏覽器、電腦操作、程式設計、數學、科學、法律和其他專業工作中承擔大量任務,那麼稱其進入AGI時代並不牽強。

OpenAI首席執行長山姆·奧特曼(Sam Altman)也把Astra描述為開啟新一代創業、科學發現和創造的模型。

(騰訊科技)