宣告AGI時代到來,GPT-6 Astra又讓數學家都坐不住了

AI速讀
OpenAI 發佈 GPT-6 Astra 並宣告 AGI 時代到來。該模型在 ARC-AGI-3 等測試中近乎滿分,並在數學界取得突破,將素數間隙上界由 246 縮減至 186。其核心進化在於「電腦使用」能力,可直接操作 3D 建模與專業設計軟體,實現從 2D 指令到 3D 實體模型的快速轉化。面對強大的零日漏洞發現能力,OpenAI 採取最嚴格的對齊部署以確保安全。此舉不僅是技術升級,更代表 AI 從資訊提供者轉型為自主執行者,將對建築、法律及程式開發等產業產生深遠影響。

台北時間9月4日凌晨,OpenAI正式發佈了新一代大模型GPT-6 Astra,將其稱為“全球最智能、對齊程度最高的模型”。而在這場備受矚目的發佈中,OpenAI聯合創始人兼總裁Greg Brockman表示,世界就此進入了AGI時代,人工智慧真的比人更聰明了。

“我們如今就在AGI時代”

OpenAI聯合創始人兼總裁GregBrockman在媒體簡報會上說出這句話時,在場的記者們或許還沒有完全意識到這句話的份量。按照OpenAI自己的定義,AGI(通用人工智慧)指的是“在大多數具有經濟價值的工作上的表現優於人類的高度自主系統”。Brockman的判斷直白而堅定:“如果把時間快進個幾年,再掉頭來問‘AGI到底是什麼時候創造出來的?’,我認為就是這個時候,可能就是從這個模型開始的。”

“我認為,此刻就說我們來到了AGI時代,並不是不合理。”Brockman這樣說道。

這話僅僅只是一句行銷口號嗎?GPT-6 Astra在多項關鍵評測中交出了一份幾乎無可挑剔的成績單:在衡量抽象推理與陌生環境學習能力的ARC-AGI-3測試中,Astra拿下了99.9%的得分,而OpenAI上一代旗艦GPT-5.6 Sol的成績僅為7.8%。在高階數學推理測試FrontierMath Tier 4中,Astra取得97.6%的得分,幾乎“打穿”了這套研究級數學測試。在漏洞利用能力測試ExploitBench中,它更是取得了100%的滿分。

數學史上的超現實一夜

如果說評測分數還只是數字,那麼GPT-6 Astra在數學領域的真實突破,則讓全世界的數學家都坐不住了。

OpenAI在發佈Astra的同時,還公開發佈了一篇數學論文,題目叫《Improved Short Gaps Between Primes》(素數之間更短的間隙)。這篇論文宣佈,GPT-6 Astra在孿生素數猜想方向上取得了新進展,並已通過Lean形式化證明,把連續素數間距的上界從246推進到了186。

什麼是素數間隙?素數(2、3、5、7、11……)就像散落在整數宇宙中的孤獨星球,只能被1和自身整除。隨著數字越來越大,素數變得越來越稀少,兩個相鄰素數之間的間距也越來越大。數學家們一直在問:即使在無窮遠處,是否依然存在著距離很近的“孿生素數”?

2013年,數學家張益唐證明了存在無窮多對距離小於7000萬的素數,震驚世界。之後,包括陶哲軒在內的全球數學家聯手最佳化,最終將這個上界推進到了246。這個紀錄已經保持了多年。

而今天,GPT-6 Astra把這個數字從246直接推到了186。它不是簡單算出來的,論文摘要的最後一句話寫著:“證明由GPT-6 Astra完成。”

賓夕法尼亞大學統計學教授、北大07級校友蘇煒傑在社交媒體上寫道:“我9歲時第一次聽說孿生素數猜想,張益唐的故事一直銘刻在我心中。這真是一個超現實的夜晚,親眼看著我們的模型在一個我從小崇拜的問題上取得進展,把246一路推到了186。對我來說,這感覺就像見證了一個智能新時代的到來。”

值得注意的是,Astra不僅解決了孿生素數方向的相關問題,還改進了大素數間隙領域的另一項重要成果,一個已經超過80年未曾改進的數學界限。OpenAI已經公開了這兩項成果的完整證明和Lean形式化驗證材料。

從回答問題到操作電腦

如果說以往的AI模型還停留在“回答問題”的層面,那麼GPT-6 Astra的定位截然不同,它可以像人一樣操作電腦。

Astra的核心能力是電腦使用。它不再需要開發者為每個軟體編寫專門的API介面,它可以像人一樣直接穿梭於不同應用之間,完成操作。“電腦使用是這次新功能中特別重要的一部分,” Brockman對記者表示。他說,這個模型“可以快速瀏覽電子表格、填寫表格、並以以超越人類的速度瀏覽網頁”。

OpenAI公司的模型此前一直在瀏覽網站、填寫表格和操作軟體工具方面有所欠缺,但OpenAI表示Astra改變了這一局面。OpenAI展示了一段視訊:一個人坐在椅子上,只需用語音指令操作電腦,可以生成火箭3D模型,可以隨心修改幻燈片,想幹什麼就幹什麼,只要動動嘴,整個過程無比絲滑流暢,儘管是演示場景,但已足夠令人震撼。

在實際應用中,Astra可以幫你填寫線上表格、更新CRM客戶記錄、整理日程、進行線上研究並在郵件或文件中起草摘要。它可以分析科學資料、生成圖表、建立網站、運行前端質量檢查。它還能自主安裝和測試軟體,幫你排查螢幕上出現的問題。

3D領域的強大表現

如果說數學突破是 Astra的最強大腦,那它在3D領域的表現,就是一雙令人瞠目結舌的靈巧雙手。只要打開Blender、Unity、Unreal Engine等專業軟體,它就能直接上手幹活,像一位熟練的設計師那樣開始建模、搭建場景、開發遊戲。

OpenAI做了一個非常直觀的演示:工作人員對著Astra說出指令,螢幕上出現了一個簡單的黃色圓圈。接下來,這個圓圈變成了火箭的舷窗,然後Astra自動打開了Blender,將二維圖形變成了三維模型。模型完成後,它又進入了遊戲引擎,將其做成了一款躲避隕石的3D小遊戲。最後,它甚至匯出了適合3D列印的STL檔案,從螢幕上的一筆畫,到可以拿在手裡的實物,整個過程一氣呵成。

在另一個演示中,Astra僅憑一張房屋的圖片,就在Blender裡從零開始重建了完整的3D模型,包括玩具、電器、家具等所有細節。這是帶有可手動調整幾何體的完整Blender工程檔案,甚至可以以60fps的流暢度在本地裝置上作為遊戲運行,差不多就是看圖建模的終極形態了。

更令人震撼的是Astra在大型3D場景建構上的能力。在OpenAI的官方演示中,Astra先在Blender裡搭建了一棟完整的房屋模型,然後自動將其匯入Unreal Engine 5,生成一個可以自由漫步、即時探索的建築場景。設計師和客戶可以提前“走進”尚未建成的空間,感受佈局和氛圍。

Astra生成的場景

這種能力在實際工作中意味著什麼?有職業建築師在體驗後評價說,Astra的驚豔之處在於它能通過建模和渲染軟體實現高品質的3D建模和渲染,無論是建築還是遊戲場景都適用。換句話說,你無需僱傭一個專業的3D建模團隊來做概念設計,只要讓Astra打開Blender,它就能把你的想法變成可視化的三維空間。如此一來,人人都可以擁有一個召之即來的3D設計師了。

行業領袖的真實評價

GPT-6 Astra發佈後,多家AI企業的技術負責人第一時間分享了他們的測試感受。

美國AI創業公司Cognition的高級研究副總裁Silas Alberti表示,公司在發佈當天就將Astra接入了AI程式設計產品Devin。“內部測試顯示,Astra顯著提高了電腦的使用、寫作和程式碼庫理解能力,視訊明顯更易於理解,報告也更加清晰和簡潔。”

法律AI平台Harvey的應用研究主管Niko Grupen則從專業場景給出了評價:“Astra在複雜法律任務上相較於GPT-5.6 Sol有顯著的質量提升。在我們的早期測試中,Astra的突出之處在於,它能像一位富於洞察力的律師一樣處理法律工作,區分文件與既定記錄,揭示無根據的假設,並將空白轉化為具體的起草立場。”

AI視訊生成公司Higgsfield AI的CEO Alex Mashrabov表示:“Astra成功執行了我們最複雜的創意工作流程,同時,所用的token比我們測試的其他模型少了20%。最重要的是,對我們的客戶而言,輸出質量更高。”

獲得早期測試資格的開發者Theo在社交媒體上寫道:“我已經用了幾周了。Astra是一個令人難以置信的模型,具備我從未見過的能力。它能做到的事情,我從未想過大語言模型能做到。這是一次真正的代際飛躍,在電腦使用、3D、資料分析、科學研究、偵錯等方面都是飛躍。”

另一位早期測試者Claire Vo分享道:“我說這個模型突破了5.6 Sol或Fable都無法攻克的任務,我是認真的,產品智能功能、建構3D遊戲、硬體破解,以及我反覆嘗試、反覆失敗的一次性編碼項目,它都做到了。”

最“對齊”的模型,最謹慎的部署

能力的躍升也帶來了風險的升高。GPT-6 Astra是OpenAI第一個在“準備框架”下達到網路安全關鍵等級的模型。它可以自主發現此前未知的軟體漏洞(零日漏洞),並將其串聯成可在加固系統上運行的漏洞利用程序,而無需人工逐步監督。

在測試中,Astra不僅以100%的得分完成了ExploitBench測試,還在針對2026年6月至8月新披露漏洞建構的專項評估中,發現了兩個此前未知的零日漏洞,OpenAI正在向相關維護者披露這些漏洞。

正因如此,OpenAI在部署上格外謹慎。Astra是該公司“有史以來最對齊的模型”。在一項由於Hugging Face越獄事件而建構的評估中,他們測試模型在面臨困難的或不可能完成的任務時是否會越獄,沒有生產安全保障的GPT-5.6 Sol在48%的情況下超出了授權目標,而GPT-6 Astra在0%的情況下出現此問題。

然而,更強大的能力也給監控帶來了前所未有的挑戰。OpenAI首席科學家Jakub Pachocki在媒體簡報會上坦言,隨著模型能力不斷提升,要確保它們不會造成意外傷害,已經變得越來越困難,這可能會成為AI進一步發展的瓶頸。

目前,OpenAI正在通過啟動監控(讀取模型推理過程中的內部訊號)等技術來加強對Astra的監管。

定價與可用性

目前,Astra通過Daybreak計畫首先向部分企業客戶開放,未來幾天將逐步向ChatGPT Plus、Pro、Business和Enterprise使用者推出,同時也將通過OpenAI API和AWS提供服務。OpenAI沒有透露GPT-6 Astra是否會向免費使用者開放。

API標準定價為每百萬輸入token 10美元、每百萬輸出token 50美元,約為GPT-5.6 Sol價格的2.5倍。不過OpenAI指出,由於Astra的token效率大幅提升,實際使用的token數量大幅減少,完成單個任務的實際成本反而可能比前代模型更低。

GPT-6 Astra的發佈正值OpenAI的關鍵時刻。ChatGPT的創造者正在推進技術、提升銷售額的同時,試圖兼顧安全與保障,為計畫中的首次公開募股做準備。與此同時,OpenAI還面臨著主要競爭對手Anthropic的激烈競爭,後者同樣在籌備IPO。

從7.8%到99.9%,從246到186,從回答問題到操作電腦,GPT-6 Astra所代表的,或許真的不只是又一代模型的升級。正如Brockman所說,多年後人們回望AGI的起點,可能就是2026年9月的這一天。AGI時代或許已經到來了,至於要如何駕馭它,則是迫在眉睫的問題。(心智觀察所)