最強版本的GPT來了。
OpenAI 公開發佈了他們有史以來最強的一代大模型 GPT-5.6,為什麼老狐要說“公開發佈”呢,因為前段時間 OpenAI 就應美國政府的要求,在“一小群值得信賴的合作夥伴”範圍內發佈了這款模型。
OpenAI 在捂著 GPT-5.6 兩個星期後,終於面向全球公佈了。
這一次,OpenAI 引進了新的命名體系,把 GPT 分為了三個版本,代號分別是 GPT-5.6 Sol、GPT-5.6 Terra,以及 GPT-5.6 Luna。
根據官方的解釋,Sol 代表的是太陽,Terra 代表地球,Luna 代表月亮,這三者關係也反映了 GPT-5.6 三個版本能力的強弱關係。
以太陽命名的 GPT-5.6 Sol 是旗艦模型,也是 OpenAI 迄今為止最強的模型;而 Terra 更適合日常使用,成本更友好,性能與 GPT-5.5 相近;而 Luna 則是以低成本供使用者使用,主打一個性價比。
事實上,為了便於全球使用者理解, 我認為 OpenAI 應該借鑑 iPhone 的命名方式,分別命名為Pro Max、Pro 以及標準版,未來還可以在此基礎上增加 Ultra 版,Air 版,se 版……
即便看起來很複雜,但大家閉眼都知道那個版本性能更強,那個版本更有性價比,沒毛病吧。
這樣以“代際+能力層級”的命名方式,在未來也許會成為大模型產品的常態,依據產品性能對大模型的產品線進行分級,以應對不同的使用者人群,降低了使用者的選擇門檻。
能力提升方面,OpenAI 官方提到 GPT-5.6 Sol 在程式設計、知識工作、網路安全和科研四個領域取得了最新的成果。
但這不是重點,OpenAI 這次把 GPT-5.6 的經濟效益放在了首位。
OpenAI 首先放出了 Agent's Last Exam 基準測試結果,Agent's Last Exam(ALE)是一項新的基準測試,測試的不是程式碼編寫或理論性能,它衡量的是 AI 能不能真正像職場員工一樣,獨立、端到端地完成具有實際經濟價值的數位化工作。
ALE 基準測試涵蓋了 55 個行業,收集了 1500 多個任務,大模型要在測試中去完成給定的所有任務。
GPT-5.6 Sol 創下了 56.3 的最高分,比 Claude Fable 5(自適應推理)高出 13.1 分。而且 GPT-5.6 Sol 即使在中等推理水平下,它也比 Fable 5 高出 11.4 分,成本卻只有 Fable 的四分之一。
而且在更小的模型上,OpenAI 宣稱 GPT-5.6 Terra 和 GPT-5.6 Luna 的性能優於 Fable 5,而成本約為其十六分之一。
可以說是殺人誅心。
而在衡量 AI 在數學、科學、程式設計和推理能力的 Artificial Analysis Intelligence Index 上,GPT-5.6 Sol 得分僅僅比 Fable 低 1 分,但是完成任務的時間少了 61%,而且成本只有一半。
簡而言之,這些基準測試衡量的,就是大模型能不能像真正的職場牛馬一樣,活既要幹得好,幹得快,成本還要少。
在GPT-5.6 上,OpenAI 給產品引入了兩項新的推理模式,一個被命名為“Max”推理,也就是讓模型投入更多的時間進行深度推理,在面對像是數學證明、複雜規劃、科研分析等問題時,可以投入更多計算資源進行更長時間的思考,提高複雜任務的完成率。
另一項則是 Ultra 模式,能夠平行協調四個子智能體,讓多個子智能體分別處理不同的任務,超越單個智能體的能力,更接近真實的團隊協作模式。在處理高要求任務時,消耗更高的 token 以換取更優的結果和更快的響應速度。
比如 Terminal-Bench 2.1 基準測試,這是為了衡量 AI 在項目中完成真實工作綜合能力的基準測試,GPT-5.6 Sol 四個智能體就要比單個智能體效率更高。
除此之外,在各個場景上,GPT-5.6 在設計上有質的提升,包括遊戲頁面設計、室內方案展示、前端網頁動畫設計等方面,大模型能夠自我檢查,在視覺和功能上去最佳化方案。
辦公層面 GPT-5.6 的能力也有了進一步提升,根據官方描述,GPT-5.6 能生成更精美、更準確的 PPT、Word 和 Excel 表格,如果有參考範本,GPT-5.6 生成的內容會更接近原版。
同時,GPT-5.6 消耗的 token 還更低,在多個體現辦公場景的基準測試裡,GPT-5.6 系列模型在成本上都有明顯的優勢。
而網路安全是 GPT-5.6 的重點,尤其是在預覽更新說明中,OpenAI 用了將近一半的篇幅來介紹 GPT-5.6 在網路安全方面的進步。
在發掘漏洞和利用漏洞攻擊能力的基準測試中,GPT-5.6 系列產品在與競品(主要是 Anthropic)的對比中,能在消耗更少 token 的情形下,達到與對手相同的得分。
此外,在真實生物學、生命科學研究的工作流以及化學等科學研究領域,GPT-5.6 Sol 在成本和速度上都有明顯的優勢。
除了 GPT-5.6 面向全球開放,OpenAI 還發佈了 ChatGPT-Work,它由 GPT-5.6 驅動,把 Chat、Work 和 Codex 整合在一起。
這相當於字節把豆包、TRAE 和即夢都整合在一起,與之相應的是,OpenAI 將 Codex 下線,這會不會是未來大模型行業的趨勢呢?
國外已經有不少網友用上了 GPT-5.6,並拿來跟 Fable 5 進行比較,有不少使用者反映,在前端的動畫設計上,GPT-5.6 對比 GPT-5.5 有明顯提升,但是還是不如 Fable 5。
在 token 消耗上,GPT-5.6 對比 Fable 5 有優勢,而且生成成本已經成為許多使用者不得不關注的點。
整個發佈內容,OpenAI 都在突出 GPT-5.6 的 token 消耗量更低,使用起來更有性價比。
CEO 薩姆·奧特曼也在 X 上發推表示,OpenAI 已經意識到了企業對 AI 成本的擔憂,而 GPT-5.6 正是在使用成本上有了巨大的進步。
沒錯,在全球 token 消耗量暴漲的今天,大模型如何為使用者降低 token消耗,節省使用成本,已經成為產品競爭力的重要部分。
老狐在使用 Agent 桌面端的這段時間裡,最大的感受就是,在成本和模型性能之間做好權衡很重要。
GPT-5.6三個版本(每百萬 token )的價格分別為:Sol 為輸入 5 美元/輸出 30 美元;Terra 為輸入 2.50 美元/輸出 15 美元;Luna 為輸入 1 美元/輸出 6 美元。
作為對比,Fable 5的價格是輸入10 美元/輸出 50 美元,由此可見,GPT-5.6 更有性價比。
但坦白講,這些價格在 DeepSeek、智譜清言、豆包等國產大模型面前,堪稱奢侈。
以 DeepSeek V4 為例,每百萬 token 輸入價格是 3 元(0.44 美元),輸出價格是 6 元(0.88 美元),豆包 2.1 Pro,輸入價格是 6 元,輸出價格 30 元。
最新發佈 Grok 4.5,也主打一個低成本,每百萬輸入價格 2 美元,輸出價格 6 美元。
就像馬斯克反覆強調的,能力、更快的速度以及更低使用成本,三者結合才是大模型真正的產品力。
在未來,這場 AI 大模型混戰最終勝者不是最聰明的那個,而是誰能讓大多數人低成本地解決那些真實的需求。
顯然,OpenAI 試圖在 GPT-5.6 產品中體現了這一點,但他面對的還有東大的 DeepSeek 們。 (科技狐)
