國產模型捲了大半年,這一周終於輪到海外幾家擠在一起發新模型。
前腳 Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3 剛發完,今天最後輪到 OpenAI,GPT-6 Astra 來了。
這一輪看下來,Astra 在電腦操作和任務自動化上重新超過了 Anthropic,數學和網路安全也往前走了一截。
程式設計只領先一點,第三方綜合榜甚至還排在 Claude Fable 5.1 後面。價格倒是先漲上去了,是 GPT-5.6 Sol 的2.5 倍。(但有一說一,AA 這個榜單越來越離譜了,要說比不過 Fable 5.1 有可能,居然還會比 Muse 差?所以這個榜單參考價值似乎也不大了)
01. 電腦任務耗時少了近一半
OSWorld 測的是模型能不能像人一樣看螢幕、點按鈕、切軟體,把一件事從頭做到尾。Astra 的成績比 GPT-5.6 Sol 高 10.5%。
我更在意速度。Sol 平均要做 75 分鐘的任務,Astra 縮到 40 分鐘,少了47%。
以前模型能跑完不少電腦任務,可速度慢到你寧可自己動手。40 分鐘依然不短,但已經能放到後台跑了。
官方給的 3D 案例很直觀。Astra 先在 Blender 裡做好房屋模型,再轉進 Unreal Engine 5,變成一個可以走進去查看的場景。
建模、匯出、匯入遊戲引擎,這段跨軟體流程開始可以交給模型處理。
Astra 也補了長任務記憶。這個功能目前在 Codex 裡需要手動開啟,接下來幾周才會成為 Astra 的默認設定。
上下文用完後,它會保存工作筆記,還能搜尋前面的消息和工具結果。任務跑久了,模型忘掉早期要求、重複踩坑的情況會少一些。
02. 自動化拉開了,程式設計沒有
AutomationBench 測多步驟辦公任務,比如整理資料、操作表格,再把結果填進另一個系統。
Astra 的成績是 Sol 的2.3 倍,比 Claude Fable 5.1 高 32%。提升最大的是 ARC-AGI-3:模型要在無說明的環境中試錯、找規則並完成任務。Astra 得分 99.9%,約為 Sol 的 12.8 倍。但測試採用 OpenAI 自有框架,不能直接等同於實現 AGI。。
到了程式設計,差距就小多了。
Terminal-Bench 4.0 用真實的命令列任務考模型,Astra 比 Sol 高 55%,但只比 Claude Fable 5.1 高 3.4%。
OpenAI 在這一項超過了 Claude,談不上拉開距離。
早期測試者Peter Steinberger提到一個例子。Astra 偵錯 Objective-C 項目時,一路追到上游依賴,找出問題後直接打了補丁。
它沒有停在使用者給的程式碼裡,繼續順著依賴找原因。
數學也贏了。FrontierMath Tier 4 的題接近研究難度,Astra 比 Sol 高 18%,比 Claude Fable 5.1 高 11%。
現在這個刷分也是明目張膽了,默認跑法成績不好看,就換套跑法。ARC-AGI-3 的 99.9% 讓很多人喊“AGI 來了”,但腳註顯示 OpenAI 改了測試框架,同樣改動曾讓 Sol 提升近 3 倍。這個成績不能直接橫向比較。
03. 網路安全這塊,有點麻煩
ExploitBench 測模型能不能把已知漏洞寫成可以運行的攻擊程式碼。Astra 做完了全部測試,比 Sol 高 27%。
OpenAI 還拿最近三個月公開的新漏洞測了一輪,儘量避開模型背過舊題的情況。Astra 的成功率是 Sol 的7.1 倍,測試期間還找出兩個沒有公開過的零日漏洞。
OpenAI 用 Preparedness Framework 給前沿模型劃風險等級。Astra 是 OpenAI 第一個達到網路安全 Critical 門檻的模型。
配合相應的工具和權限,它可以自己尋找未知漏洞,並為防護較強的系統設計新的利用方式,不需要人一步步帶著做。
因此,公開版本會拒絕高級漏洞利用任務。OpenAI 計畫通過 Daybreak,在接下來的幾周逐步向防禦團隊開放更多能力。
攻擊能力之外,System Card還寫了監控問題。可監控性說的是,人能不能從模型留下的推理過程裡看出它在越權。
在明確要求 Astra 躲開監控的壓力測試裡,它有時會故意答差而不被發現,部分破壞任務也更難被監控識別。
但在需要複雜推理的任務裡,報告沒有觀察到成功的全程規避。
不過,在 54,218 個內部 Codex 任務模擬裡,Astra 收到的高嚴重度行為標記只有 Sol 的一半左右。
把兩組結果放在一起看,會有點彆扭。平時越權少了,真讓它藏,監控又更難抓到。
04. 第三方總榜沒那麼誇張
Artificial Analysis Intelligence Index 把知識、數學、程式設計、長文字等測試合成一個總分,可以粗略看一個模型的綜合水平。
Astra 在這張榜上跟 Sol 基本持平,比 Claude Fable 5.1 低約 8%。它當然在第一梯隊,但不是總榜第一。
專門看程式設計智能體的 Coding Agent Index,Astra 比 Sol 高約 3%,跟 Claude Fable 5 持平,比榜首 Fable 5.1 低約 4%。
所以如果說“OpenAI 全面壓倒 Anthropic”這句話就過頭了。電腦操作和自動化贏得比較清楚,綜合能力與程式設計總榜還沒有。
05. token 省了,帳單未必
Token 可以先理解成模型讀寫內容時使用的計費單位。完成同一個任務,用得越少,一般越快,也越省錢。
在程式設計智能體測試裡,Astra 使用最高推理強度時,token 用量比 Sol 少69%。這個進步不小。
問題是單價漲了 2.5 倍。Astra 每百萬輸入 token 收 10 美元,輸出 token 收 50 美元。
第三方跑完整套綜合測試後,單項成本還是比 Sol 高 75%。token 確實省了,漲價把節省的大部分又吃了回去。
06. 它現在排在那兒
單看電腦操作和任務自動化,Astra 已經站到最前面。數學和網路安全也是目前最高的一檔。
程式設計跟 Claude 的旗艦模型咬得很緊,但沒有甩開;第三方綜合能力總榜仍由 Fable 5.1 領先。
Astra 目前先向少數機構開放,Plus、Pro、Business 和 Enterprise 使用者將在接下來的幾天分批拿到。API 型號是gpt-6-astra。
這次漲價換來的主要是任務執行速度、跨軟體操作和長任務能力。聊天與綜合推理的總榜成績,沒有跟著拉開同樣大的差距。
Greg Brockman 把這次發佈叫作“AGI 時代”,但這個詞最近真的用爛了🌚。
OpenAI 自己的 System Card 裡,Astra 的 AI 自我改進能力還沒達到 High 門檻。這裡說的自我改進,是讓模型偵錯 AI 研究實驗、最佳化訓練過程和計算核心。
至少按 OpenAI 這套標準,Astra 還不能用來證明 AGI 已經到了。
訓練規模倒是很大。Astra 的訓練動用了超過10 萬張 GPU,是 OpenAI 目前規模最大的一次。上一代模型也參與了訓練監督。
我自己的感受有點複雜。模型現在幾乎每天都在更新,benchmark 也越堆越多,但實際怎麼樣,還得自己去用了才算數。
GPT-6 原本是我這段時間最期待的一次發佈,因為最近一直在用 Codex,但從目前的第三方排名看,Astra 跟 Sol 的差距沒有想像中那麼大,也沒有把 Claude 甩開。 (AI范兒)
