GPT-6 Sol斬殺5.6全系!Astra的1/5價格,Luna比梁文谷還便宜,周二Codex重設

RexAA
•
AI速讀
OpenAI 正式推出 GPT-6 Sol 與 Luna 模型,採取激進的定價策略,API 價格較 5.6 系列降低 50%,部分輸出成本甚至低於 DeepSeek。在效能方面,新模型在程式設計與長週期任務中展現強大競爭力,能以極低成本達到甚至超越 Claude Opus 5 的水平。技術更新包含優化快取機制(命中可享 90% 折扣)、精簡對話風格以減少冗餘資訊,並強化對齊測試以降低誤導性聲明。OpenAI 旨在透過降低成本推動 Coding Agent 的大規模應用,預計週二將重設使用額度。

GPT-6 Sol、Luna深夜上線,API價格直接砍半!

Astra改進的訓練方法這兩款也都用上了,所以也繼承了Astra在電腦使用等方面的提升。

那還有啥好說的,等於5.6系列直接被斬殺了唄。

現在系列裡Astra負責當以前的Sol,Sol負責當以前的Terra,Luna還是以前的Luna。

Terra生態位直接被擠沒了。

與5.6系列相比,6系列的API定價直接砍50%,其中Luna的輸出砍得比50%還多一點。

而且Luna的輸入價格比DeepSeek-V4.1 Flash的梁文谷價格($0.15)還便宜一點了,就是不知道快取命中率有沒有的比。

為何升級還便宜了?

OpenAI稱這得益於快取和推理環節的效率提升,省下來的成本直接讓利給使用者和開發者。

這不得尊奧特曼一聲奧特之王(限時24小時)。

用一成價格,盯著Fable打

整個發佈公告看下來,我先學會一招,用GPT-6 Sol最好別開Max。

效果提升有限,價格提升很大,就不如直接開Astra了,還有個別榜單跑分Max比xHigh掉分。

什麼你不知道怎麼在Codex裡開Max?

在設定裡可以選,默認是沒打開的,這下知道為什麼沒打開了。

按照AutomationBench這個榜,GPT-6 Sol的high和xhigh兩個檔位已經摸到了Astra的light和medium的水平。

AutomationBench測的是AI在銷售、行銷、營運、客服、財務和人力資源六大領域47個工具上執行端到端業務流程的能力。

作為對比,Claude Opus 5在max effort下得分和GPT-6 Sol的medium差不多,但單任務成本是Sol的11.1倍。

Claude Fable 5.1,成本是Sol的8.9倍以上,而且這還沒算上約40%任務觸發Opus 5回退產生的額外開銷。

為測試GPT-6 Sol的電腦使用能力,我讓它在圖表中把隔壁新發的Opus5.5成績也畫上去。

這下可以直觀看出,Opus5.5的Max檔達到了GPT-6 Astra水平,價格也達到了Astra水平。

換Agents' Last Exam,這次考長周期任務,覆蓋55個子行業。

GPT-6 Sol在max effort下得分56.4%,超過Claude Opus 5在該測試中的最高分,成本還低了60%。

程式設計是這次重點展示的方向。

OpenAI透露了一組內部資料:公司內部的Coding Agent使用量呈指數級增長,按API價格折算,中位數研究員每天的token消耗已超過600美元,90分位的研究員超過7000美元。

隨著程式設計agent承擔的任務越來越長、越來越複雜,持續使用的成本變得更加關鍵,這正是Sol和Luna要解決的問題。

在DeepSWE v1.1(測試AI在真實程式碼庫中解決複雜軟體工程任務)上,GPT-6 Sol其實並沒有比5.6 Sol更好,但確實便宜不少。

GPT-6 Luna在max effort下得分66.6%,與Claude Opus 5和Fable 5在medium effort下水平相當,成本分別低了93%和96%。

在Cognition推出的FrontierCode(評估AI編寫的程式碼是否達到可合併進真實程式碼庫的標準)上,GPT-6 Sol相比GPT-5.6 Sol同樣有明顯提升,能以更低成本匹配Claude Fable 5.1 xhigh的表現。

這個榜隔壁Claude的檔位又亂了起來。

電腦操作,這塊還是Astra比較權威。

GPT-6 Sol也僅僅是比5.6 Sol便宜了,high檔位以上水平其實沒超過5.6多少。

GPT-6 Luna在max effort下超過了GPT-5.6 Sol在medium effort下的表現,成本僅為後者的十分之一。

事實精準性方面,OpenAI用一組從真實ChatGPT對話中提取的、使用者曾標記過事實錯誤的案例進行了測試。

結果是GPT-6 Sol的錯誤率大約是上一代的一半,接近Astra的水平。GPT-6 Luna在較高effort下能匹配GPT-5.6 Sol的精準度,而成本只有百分之一。

快取命中率提升,重設馬上來

模型能力之外,OpenAI對GPT-6的基礎設施也做了幾項改進。

首先是提示詞快取。

改進後的快取機制默認提供更高的命中率,快取命中的輸入token可享受90%的價格折扣。

OpenAI還上線了快取監控面板和診斷工具,開發者可以查看快取使用情況、定位未命中的原因並針對性最佳化。

還有這樣一個實用的改動:調整推理effort等級或開關工具時,不再會打斷之前的快取上下文。

GitHub已經在用這套方案。據OpenAI披露,過去幾個月裡這些最佳化讓GitHub Copilot需要重新處理的提示token比例下降了超過50%,涉及數十億次請求。

終於能在任務的不同任務靈活切換組態了。

之前看已經有人做出來,搭配Jev可以在任務中途毫秒級切換。

然後是對話風格。

OpenAI把Astra上改進過的溝通方式帶到了Sol和Luna上,在技術和程式設計對話中感知會尤為明顯,表現為更清晰、更少術語、更少無效細節、回覆整體更簡短但不丟失關鍵資訊。

OpenAI在部落格中展示了同一個網頁開發任務下GPT-5.6 Sol和GPT-6 Sol的對比回覆。

5.6會主動複述使用者已知的資訊並使用含糊措辭,6則更直接,會說明自己檢查了什麼、沒檢查什麼。

對齊方面,Sol和Luna在測試中優於GPT-5.6同級模型,包括在程式設計任務中做出誤導性聲明的比率更低。OpenAI強調,這些對齊測試專門挑選了容易誘發不誠實行為的場景,正常使用中出現此類問題的機率遠低於測試資料。

最後,關於額度重設。

總之是周二,具體時間未定,醒來的朋友們可以開蹬了。

(量子位)