GPT-6 Astra來了,OpenAI還要追Anthropic。
9月3日凌晨,預熱已久的GPT-6 Astra正式發佈。
發佈前半個月,OpenAI一直在為這款模型的發佈釋放訊號。8月18日,在判斷Astra可能達到“Critical”網路安全能力閾值後,公司放慢部分前沿模型訓練,並暫停兩周面向部署模型的強化學習訓練,用來加強監控、對齊和研究環境安全。9月1日,OpenAI進一步披露Astra的安全評估情況。幾輪資訊提前放出之後,GPT-6 Astra在正式發佈前已經積累了不少關注。
但發佈之後,大部分使用者暫時還用不了。目前,GPT-6 Astra只向少量機構開放,Plus、Pro、Business等付費使用者將在未來幾天陸續獲得存取權,API也會逐步開放。面對使用者的等待,OpenAI很快給出了一套補償方案。Codex負責人Tibo表示,付費使用者每有一天無法使用Astra,就會獲得一次可以留到之後使用的額度重設。這也緩解了部分使用者對延遲開放的不滿。
回到模型本身,這次更新最值得關注的變化主要有兩個:模型更能直接操作電腦,也更擅長完成複雜任務。OpenAI稱GPT-6 Astra是目前最智能的模型,相比GPT-5.6 Sol,它在軟體工程、科研、網路安全和專業工作等方向都有提升,電腦操作進步尤其明顯。
API的價格也提高了。GPT-6 Astra的API價格為每百萬Token輸入10美元、輸出50美元,是GPT-5.6 Sol的2.5倍,與Anthropic最新旗艦Claude Fable 5.1處在同一價格水平。OpenAI還提供Fast Mode,生成速度可以提高至約2倍,但價格也會翻倍。
OpenAI對這次升級的定調也比以往更高。在發佈前的媒體溝通會上,公司總裁Greg Brockman表示,“歡迎來到AGI時代”,並認為幾年後回頭看,人們可能會把GPT-6 Astra視為AGI時代開始的一個節點。
關注度有了,能力也確實更強了。此外,OpenAI與Anthropic也都進入了上市籌備階段。GPT-6 Astra足以支撐OpenAI口中的AGI時代了嗎?又能不能幫OpenAI在新一輪競爭中佔據主動?
01. 跑分接近上限,長任務進步更明顯
先來看最直觀的跑分成績。我們主要關注兩類,一類是成績已經接近測試上限的,另一類是相比上一代提升明顯的。
先看第一類。在OpenAI公佈的基準測試中,GPT-6 Astra在ARC-AGI-3上的得分達到99.9%,ExploitBench達到100%;FrontierMath Tier 4 v2的正確率也達到97.6%。
這三項測試考察的能力各不相同。ARC-AGI-3考察模型能不能在陌生環境摸索出規則並遷移到更難的關卡,測的是對新環境的理解和適應;FrontierMath Tier 4 v2考察高難度數學推理;ExploitBench則要求模型針對已知漏洞,構造出可以運行的漏洞利用程序。
這說明,GPT-6 Astra在研究級推理、陌生環境適應和複雜網路安全任務上已經表現出很強的能力。尤其是ARC-AGI-3,今年3月剛推出時,前沿模型得分還不到1%。GPT-6 Astra如今接近滿分,說明這類過去能夠明顯拉開前沿模型差距的陌生環境推理任務,已經很難再成為它的瓶頸。
不過,第三方綜合測試給出的成績沒有這麼突出。在Artificial Analysis最新智能指數中,GPT-6 Astra最高推理檔拿到61分,與GPT-5.6 Sol持平,排名第5,低於Claude Fable 5.1最高檔的66分。從綜合成績來看,GPT-6 Astra並沒有和上一代拉開明顯差距,它的進步更多集中在部分能力上。
接下來,我們再看相比上一代提升明顯的部分。
這主要集中在操作電腦、呼叫工具、連續執行步驟以及處理更長任務這些Agent能力上。其中,科研工作流測試Terminal-Bench Science 0.1的變化最大,GPT-6 Astra從GPT-5.6 Sol的22.4%提高到64.6%,接近上一代的三倍。其他長程Agent和自動化任務測試也普遍提高了20個百分點左右。
電腦操作的成績也有明顯的進步。ScreenSpot-Pro從76.9%提高到92.7%,意味著GPT-6 Astra在看懂介面、找準操作位置這件事上更加實用了。OSWorld 2.0則達到72.6%,分數隻增加了6.9個百分點,但完成一項任務的模擬平均時間從約75分鐘縮短到40分鐘,耗時減少了接近一半。
這些變化,也能從第一批拿到GPT-6 Astra的使用者實測中看到。
一位網友讓GPT-6 Astra在Unreal Engine(虛幻引擎,3D創作工具)裡搭建曼哈頓的虛擬場景,整個任務持續了一周。他提到,GPT-6 Astra可以沿著街道逐步補充建築和環境細節,持續運行多天後,仍能繼續此前的進度完善場景。不過效率仍然有限,他提到,按照目前的速度,如果要把整個紐約做完仍需要數月。
另一位網友做了包括生成3D模型和動畫、製作遊戲等六組測試。他認為,這一代模型的能力提升比此前更明顯,尤其是在長時間運行中表現穩定。實測期間,他同時運行了數百個Agent,也沒有遇到明顯問題。
Codex團隊的Thomas Ricouard則重點測試了GPT-6 Astra的3D建模能力。他讓模型根據一棟房屋的平面圖完成3D場景的搭建,GPT-6 Astra先在Blender中完成建模,再把場景轉到Unreal Engine,最終生成一個可以即時“行走”的3D空間。除了最開始幾次提示詞,後續的天空盒、電影化燈光、鏡頭角度等都由GPT-6 Astra完成。Ricouard認為,GPT-6 Astra非常擅長3D建模,它對材質、紋理和視覺效果的處理比較到位。
這些實測還只是早期樣本,但它們和官方跑分呈現出的方向基本一致。GPT-6 Astra明顯的增量,集中在長時間執行、專業軟體操作,以及把多種能力連續串進一項複雜任務。
02. 模型開始吃掉Agent?
GPT-6 Astra有兩個變化值得單獨展開。一個是Computer Use(電腦操作能力),模型可以直接讀取電腦介面,在軟體裡完成操作;另一個是Judgment(判斷力),模型會自己處理一些不影響方向的小問題,只在真正需要使用者拍板時停下來詢問。一個解決怎麼動手,一個解決什麼時候該自己做主。
先來看Computer Use。簡單來說,就是讓模型像人一樣看著螢幕幹活。它通過截圖理解當前介面,根據使用者目標判斷下一步該做什麼,再把計畫轉成點選、輸入等實際操作。執行完成後重新讀取頁面,繼續下一步,形成一個循環。
它提供的是一條更通用的軟體操作路徑。很多Agent要接入外部系統,通常需要開發者提前接好API、MCP或者專用工具。Computer Use則讓模型直接操作原本為人設計的圖形介面,在沒有現成介面的情況下,也可以繼續完成任務。
這項能力此前已有過嘗試。2024年,Anthropic就已經在Claude上開放了Computer Use,微軟、OpenAI也陸續跟進。2025年,OpenAI推出Operator,背後的Computer-Using Agent同樣可以通過截圖理解網頁,再用滑鼠和鍵盤完成操作。之後,這類能力又被整合進ChatGPT Agent產品。
早期的Computer Use並不算好用。大模型研究員姚宇航告訴「AIX財經」,OpenAI此前推出的AI瀏覽器Atlas也是讓模型直接控制網頁,但延遲很長,效果並不理想。在他看來,這類能力未來一兩年仍有很大提升空間。不過從這次官方展示的幾組專業軟體操作Demo來看,GPT-6 Astra對圖形化介面的理解和軟體操作已經出現明顯進步。
Computer Use的價值,在於補上API、CLI和MCP覆蓋不到的部分。有現成介面時,Agent仍然可以選擇更快、更穩定的方式;沒有介面時,模型仍能通過GUI直接操作這些軟體。
模型能夠自己讀網頁並完成操作,也表明一部分原本由Agent承擔的執行能力正在被底層模型接過去。姚宇航認為,未來Agent層會越來越薄。看螢幕、呼叫常見工具這些通用能力,會不斷沉進基礎模型。但Agent仍然有價值。進入金融、法律、醫療等專業場景後,還需要領域知識、業務流程、權限管理以及責任邊界。垂直Agent可以依靠這些專業能力保留更高的附加價值。
GPT-6 Astra另一個值得關注的變化,是OpenAI專門強調的Judgment。
Judgment解決的是協作問題。Agent面對資訊缺失時,經常需要在兩個選擇之間取捨。如果頻繁停下來確認,自動化流程又會變成反覆的人機溝通;如果完全自行決定,也可能直到任務後期才發現方向出了偏差。
GPT-6 Astra的做法是先判斷缺失資訊的重要程度。不影響最終方向的小問題,依據上下文自己判斷;可能改變結果的決策,再交給使用者拍板。Judgment降低的其實是使用Agent時的監督成本。使用者需要確認的節點減少,Agent才能真正接下更長、更複雜的任務。
03. OpenAI不想掉隊
GPT-6 Astra發佈的時間點,正趕上前沿模型最密集的一輪更新。
9月1日,Anthropic發佈Claude Fable 5.1;9月2日,Google推出Gemini 3.8 Flash,Meta也在同一天更新Muse Spark 1.3。幾家公司擠在同一周更新模型,前沿能力的領先窗口期還在繼續縮短。
但對OpenAI來說,這次發佈的壓力不只來自競爭對手。GPT-6 Astra發佈前,OpenAI創始人Sam Altman在接受《時代》採訪時復盤了OpenAI過去一年的表現。他承認,公司在產品方向和模型預訓練上都沒有達到預期。過去一年,OpenAI同時鋪開Sora、Atlas瀏覽器等多條產品線。今年以來,公司開始重新收縮,把更多資源拉回底層模型和Codex等核心項目。
OpenAI需要重新證明,它不僅能做出“最強”模型,也能把模型能力轉化為收入。
消費端依然是OpenAI最明顯的優勢。截至8月底,ChatGPT周活使用者已經超過10億,付費訂閱使用者超過5000萬,使用者規模遠高於Claude。
但在B端市場,這種優勢就沒那麼明顯了。Anthropic更早抓住了AI Coding和Agent的商業化機會,Claude Code逐漸成為企業高頻使用的產品。
而眼下,B端業務對OpenAI越來越重要。今年4月,OpenAI披露企業業務收入佔比超過40%。7月,企業收入已經首次超過消費者收入。此外,OpenAI服務的企業和機構數量超過200萬,是一年前的兩倍。B端市場從增量業務變成越來越重要的收入基本盤。
Anthropic也給它帶來了更大的壓力。今年二季度,OpenAI收入增長到67億美元,環比增長18%,但經營虧損擴大到123億美元。Anthropic同期收入則超過115億美元,環比增長超過一倍,並實現小幅營運盈利,這也是Anthropic季度收入首次超過OpenAI。
7月底,Anthropic披露的年化收入(run rate)已經超過650億美元,OpenAI約為400億美元。需要說明的是,兩家公司公佈的年化收入數字統計方式存在差異,不能直接比較高低。但至少能夠看出,Anthropic帶給OpenAI的壓力從模型能力延伸到了企業增長和盈利效率。
兩家公司已經先後秘密遞交IPO申請,企業增長和盈利效率也會成為資本市場衡量兩家公司商業化能力的重要指標。
OpenAI也看到了企業客戶使用習慣的變化。截至今年6月,在企業客戶產生的Codex和ChatGPT輸出Token中,Codex已經佔到64%。這說明企業端的AI使用正在從問答轉向更長、更複雜的Agent任務。放到這個背景下,GPT-6 Astra這一輪的升級實際上都服務於擴大模型能夠獨立承接的工作範圍。對於OpenAI來說,新模型的一項重要任務就是把更強的模型能力繼續導向Codex和企業Agent場景。
價格拉平之後,兩家在企業客戶面前的競爭也更直接。GPT-6 Astra的API價格已經與Claude Fable 5.1持平。OpenAI需要證明,更高的價格能夠換來足夠明顯的任務完成率和使用價值。
OpenAI還要承擔越來越高的算力投入。今年OpenAI的計算支出預計約500億美元,未來幾年還要繼續投入資料中心、晶片等基礎設施。投入越大,公司就越需要讓前沿模型能力轉化成持續增長的企業收入。
擁有10億級消費使用者之後,OpenAI下一階段的任務是追上Anthropic已經領先的B端市場。 (定焦One)
