GPT-6 Astra 貴了 2.5 倍,但我卻沒看到期待中的提升

AI速讀
OpenAI 正式推出 GPT-6 Astra,在電腦任務自動化速度提升近 50%,並在數學與網路安全漏洞挖掘能力上取得顯著領先。然而,在程式設計與第三方綜合評分上,Astra 與 Claude Fable 5.1 仍處於激烈競爭,並非全面壓倒。儘管 token 使用量大幅降低,但因 API 單價漲至 2.5 倍,實際成本反而增加。作者指出,雖然官方提及 AGI 時代,但根據系統卡(System Card)標準,其自我改進能力尚未達高門檻,整體進步幅度雖大,但未如預期般產生斷層式領先。

國產模型捲了大半年,這一周終於輪到海外幾家擠在一起發新模型。

前腳 Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3 剛發完,今天最後輪到 OpenAI,GPT-6 Astra 來了。

這一輪看下來,Astra 在電腦操作和任務自動化上重新超過了 Anthropic,數學和網路安全也往前走了一截。

程式設計只領先一點,第三方綜合榜甚至還排在 Claude Fable 5.1 後面。價格倒是先漲上去了,是 GPT-5.6 Sol 的2.5 倍。(但有一說一,AA 這個榜單越來越離譜了,要說比不過 Fable 5.1 有可能,居然還會比 Muse 差?所以這個榜單參考價值似乎也不大了)

01. 電腦任務耗時少了近一半

OSWorld 測的是模型能不能像人一樣看螢幕、點按鈕、切軟體,把一件事從頭做到尾。Astra 的成績比 GPT-5.6 Sol 高 10.5%。

我更在意速度。Sol 平均要做 75 分鐘的任務,Astra 縮到 40 分鐘,少了47%

以前模型能跑完不少電腦任務,可速度慢到你寧可自己動手。40 分鐘依然不短,但已經能放到後台跑了。

官方給的 3D 案例很直觀。Astra 先在 Blender 裡做好房屋模型,再轉進 Unreal Engine 5,變成一個可以走進去查看的場景。

建模、匯出、匯入遊戲引擎,這段跨軟體流程開始可以交給模型處理。

▲ 圖:Astra 生成的可探索房屋場景。演示視訊有剪輯,只能看出產品打算怎麼用,不能拿來判斷成功率。來源:OpenAI 官方案例、案例視訊。

Astra 也補了長任務記憶。這個功能目前在 Codex 裡需要手動開啟,接下來幾周才會成為 Astra 的默認設定。

上下文用完後,它會保存工作筆記,還能搜尋前面的消息和工具結果。任務跑久了,模型忘掉早期要求、重複踩坑的情況會少一些。

02. 自動化拉開了,程式設計沒有

AutomationBench 測多步驟辦公任務,比如整理資料、操作表格,再把結果填進另一個系統。

Astra 的成績是 Sol 的2.3 倍,比 Claude Fable 5.1 高 32%。提升最大的是 ARC-AGI-3:模型要在無說明的環境中試錯、找規則並完成任務。Astra 得分 99.9%,約為 Sol 的 12.8 倍。但測試採用 OpenAI 自有框架,不能直接等同於實現 AGI。。

到了程式設計,差距就小多了。

Terminal-Bench 4.0 用真實的命令列任務考模型,Astra 比 Sol 高 55%,但只比 Claude Fable 5.1 高 3.4%。

OpenAI 在這一項超過了 Claude,談不上拉開距離。

早期測試者Peter Steinberger提到一個例子。Astra 偵錯 Objective-C 項目時,一路追到上游依賴,找出問題後直接打了補丁。

它沒有停在使用者給的程式碼裡,繼續順著依賴找原因。

數學也贏了。FrontierMath Tier 4 的題接近研究難度,Astra 比 Sol 高 18%,比 Claude Fable 5.1 高 11%。

現在這個刷分也是明目張膽了,默認跑法成績不好看,就換套跑法。ARC-AGI-3 的 99.9% 讓很多人喊“AGI 來了”,但腳註顯示 OpenAI 改了測試框架,同樣改動曾讓 Sol 提升近 3 倍。這個成績不能直接橫向比較。

▲ 圖:五項核心測試的當前資料。Astra 領先,綜合指數仍由 Fable 5.1 領先。來源:OpenAI 官方發佈;AI范兒整理。

03. 網路安全這塊,有點麻煩

ExploitBench 測模型能不能把已知漏洞寫成可以運行的攻擊程式碼。Astra 做完了全部測試,比 Sol 高 27%。

OpenAI 還拿最近三個月公開的新漏洞測了一輪,儘量避開模型背過舊題的情況。Astra 的成功率是 Sol 的7.1 倍,測試期間還找出兩個沒有公開過的零日漏洞。

OpenAI 用 Preparedness Framework 給前沿模型劃風險等級。Astra 是 OpenAI 第一個達到網路安全 Critical 門檻的模型。

配合相應的工具和權限,它可以自己尋找未知漏洞,並為防護較強的系統設計新的利用方式,不需要人一步步帶著做。

因此,公開版本會拒絕高級漏洞利用任務。OpenAI 計畫通過 Daybreak,在接下來的幾周逐步向防禦團隊開放更多能力。

攻擊能力之外,System Card還寫了監控問題。可監控性說的是,人能不能從模型留下的推理過程裡看出它在越權。

在明確要求 Astra 躲開監控的壓力測試裡,它有時會故意答差而不被發現,部分破壞任務也更難被監控識別。

但在需要複雜推理的任務裡,報告沒有觀察到成功的全程規避。

不過,在 54,218 個內部 Codex 任務模擬裡,Astra 收到的高嚴重度行為標記只有 Sol 的一半左右。

把兩組結果放在一起看,會有點彆扭。平時越權少了,真讓它藏,監控又更難抓到。

▲ 圖:Astra 的網路安全能力、風險等級和監控結果。來源:OpenAI 官方發佈與System Card;AI范兒整理。

04. 第三方總榜沒那麼誇張

Artificial Analysis Intelligence Index 把知識、數學、程式設計、長文字等測試合成一個總分,可以粗略看一個模型的綜合水平。

Astra 在這張榜上跟 Sol 基本持平,比 Claude Fable 5.1 低約 8%。它當然在第一梯隊,但不是總榜第一。

專門看程式設計智能體的 Coding Agent Index,Astra 比 Sol 高約 3%,跟 Claude Fable 5 持平,比榜首 Fable 5.1 低約 4%。

所以如果說“OpenAI 全面壓倒 Anthropic”這句話就過頭了。電腦操作和自動化贏得比較清楚,綜合能力與程式設計總榜還沒有。

▲ 圖:綜合智能指數和程式設計智能體指數。來源:Artificial Analysis。

05. token 省了,帳單未必

Token 可以先理解成模型讀寫內容時使用的計費單位。完成同一個任務,用得越少,一般越快,也越省錢。

在程式設計智能體測試裡,Astra 使用最高推理強度時,token 用量比 Sol 少69%。這個進步不小。

問題是單價漲了 2.5 倍。Astra 每百萬輸入 token 收 10 美元,輸出 token 收 50 美元。

第三方跑完整套綜合測試後,單項成本還是比 Sol 高 75%。token 確實省了,漲價把節省的大部分又吃了回去。

▲ 圖:Astra 在不同推理強度下的 token 用量。來源:Artificial Analysis。

06. 它現在排在那兒

單看電腦操作和任務自動化,Astra 已經站到最前面。數學和網路安全也是目前最高的一檔。

程式設計跟 Claude 的旗艦模型咬得很緊,但沒有甩開;第三方綜合能力總榜仍由 Fable 5.1 領先。

Astra 目前先向少數機構開放,Plus、Pro、Business 和 Enterprise 使用者將在接下來的幾天分批拿到。API 型號是gpt-6-astra

這次漲價換來的主要是任務執行速度、跨軟體操作和長任務能力。聊天與綜合推理的總榜成績,沒有跟著拉開同樣大的差距。

Greg Brockman 把這次發佈叫作“AGI 時代”,但這個詞最近真的用爛了🌚。

OpenAI 自己的 System Card 裡,Astra 的 AI 自我改進能力還沒達到 High 門檻。這裡說的自我改進,是讓模型偵錯 AI 研究實驗、最佳化訓練過程和計算核心。

至少按 OpenAI 這套標準,Astra 還不能用來證明 AGI 已經到了。

訓練規模倒是很大。Astra 的訓練動用了超過10 萬張 GPU,是 OpenAI 目前規模最大的一次。上一代模型也參與了訓練監督。

我自己的感受有點複雜。模型現在幾乎每天都在更新,benchmark 也越堆越多,但實際怎麼樣,還得自己去用了才算數。

GPT-6 原本是我這段時間最期待的一次發佈,因為最近一直在用 Codex,但從目前的第三方排名看,Astra 跟 Sol 的差距沒有想像中那麼大,也沒有把 Claude 甩開。 (AI范兒)