GPT-6家族上新!OpenAI打價格戰,但又不全靠價格戰

RexAA
•
AI速讀
OpenAI 推出 GPT-6 Sol 與 Luna 模型,以 API 價格砍半的策略發起價格戰,將市場競爭焦點從「模型強度」移至「任務成本」。Sol 定位於中階專業工作,Luna 則主攻低成本輕量任務。透過優化提示快取、簡化溝通風格及降低模型欺騙率,OpenAI 試圖為開發者提供一套完整的模型分工方案(Astra-Sol-Luna),讓企業能根據任務複雜度路由模型,以最低成本實現高效能的 AI 應用。

GPT-6 Astra發佈不到一個月,OpenAI就把GPT-6家族成員補齊了。

OpenAI聯合創始人兼CEO山姆·奧特曼。圖片由AI生成

美國當地時間9月22日,OpenAI正式發佈GPT-6 Sol和GPT-6 Luna,分別承擔中階和輕量任務。兩款模型最大的變化不是單純提升跑分,而是價格。

按OpenAI官方口徑,GPT-6 Sol的API價格為每百萬token輸入2美元、輸出10美元,較GPT-5.6 Sol此前的促銷價格下降50%;GPT-6 Luna每百萬token輸入0.10美元、輸出0.50美元,同樣較GPT-5.6 Luna此前促銷價格下降50%。

這個價格已經把Sol直接壓到了Claude Sonnet 5的價位。後者目前也是2美元輸入、10美元輸出。Luna則進一步向低價模型市場下探,輸入價格甚至低於小米剛發佈的MiMo-V2.6-Flash。

更巧的是,就在同一天,Anthropic發佈Claude Opus 5.5。它的API價格為4美元輸入、20美元輸出,較Opus 5的token價格下降20%,但Anthropic稱典型工作負載的運行成本下降約40%。

一個是旗艦模型降成本,一個是中階和輕量模型直接降價。AI模型競爭正在從“誰的模型更強”,越來越多地轉向“完成同樣的工作要花多少錢”。

01 Sol卡位中階,價格砍半

GPT-6 Sol雖然定位低於Astra,但OpenAI給它的定位並不是簡單的“便宜版”。

在專業工作、程式設計和電腦使用等任務上,Sol都明顯超過上一代GPT-5.6 Sol,部分測試甚至接近Astra。

AutomationBench是其中最典型的例子。

這是一個覆蓋47種工具、銷售、行銷、營運、客服、財務和HR等場景的智能體工作流測試。OpenAI公佈的結果顯示,Sol在xhigh模式下得分33.2%,單任務成本約0.27美元。

與之相比,GPT-6 Astra在low模式下得分30.3%,單任務成本約為Sol的3.9倍;Claude Opus 5在max模式下得分26.9%,單任務成本約為Sol的11.1倍。Claude Fable 5.1得分31.4%,OpenAI估算其任務成本超過Sol的8.9倍。

不過,這些都是OpenAI公佈的測試和成本估算,不是一個統一第三方環境下的橫向測試。尤其是Fable 5.1的成本計算還涉及Opus 5 fallback,OpenAI明確表示公佈的成本沒有計入約40%任務發生的fallback成本。

Agents' Last Exam的結果也類似。

這項測試覆蓋55個細分行業,主要考察長周期、複雜的專業工作。OpenAI稱,Sol在max模式下得分56.4%,超過Claude Opus 5在該評測中的最高成績,同時單任務成本低60%。

程式設計方面,在DeepSWE v1.1測試中,Sol在max模式下得分68.8%,距離Claude Fable 5的最高成績69.9%只有1.1個百分點,OpenAI估算單任務成本低約80%。

Luna則把“低成本”推得更遠。

同樣在DeepSWE v1.1測試中,Luna在max模式下得到66.6%,與Opus 5和Fable 5 medium模式的表現相當。OpenAI稱,在這一比較中,Luna的單任務成本比Opus 5低93%,比Fable 5低96%。

電腦使用方面,Sol在OSWorld 2.0離線集上的xhigh模式成績為60.5%,Claude Opus 5在medium模式下為60.3%,兩者幾乎持平,但OpenAI稱Sol單任務成本低約80%。Astra依然是GPT-6家族裡電腦使用能力最強的模型。

所以OpenAI這次最值得注意的變化,是它沒有只盯著“模型得分”。它開始反覆強調cost per task,也就是完成一個任務究竟需要多少錢。

02 價格戰升溫

如果說Sol是在中階模型市場重新定價,Luna則直接把價格打到了更低的區間。

目前MiMo-V2.6-Flash的API價格是每百萬token輸入0.14美元、輸出0.28美元;MiMo-V2.6-Pro是0.435美元和0.87美元。GPT-6 Luna的輸入價格只有0.10美元,但輸出價格為0.50美元。

也就是說,Luna的輸入價格比MiMo-V2.6-Flash低約29%,但輸出價格高約79%。

不過,兩者的經濟模式也不完全相同。

小米已經公開發佈MiMo-V2.6-Pro和Flash的模型權重,開發者可以自行部署;如果企業選擇自託管,成本就從API token費用轉向GPU、儲存、推理框架和維運成本。

xAI剛發佈的Grok 4.7則是另一種情況。它在200K prompt以下的標準價格為2美元輸入、6美元輸出,與Sol相比輸入價格相同,輸出價格低4美元。但當prompt超過200K後,Grok 4.7的價格會翻倍至4美元輸入、12美元輸出。

所以如果只看標價,市場已經出現了非常密集的價格梯度:Luna負責0.10/0.50美元這一檔;MiMo、Gemini等繼續壓低低端和中低端價格;Sol站在2/10美元;Grok 4.7是2/6美元;Opus 5.5則是4/20美元。

真正的區別,最終還是要回到任務完成率和實際呼叫成本。

03 90%快取折扣,成本再降

OpenAI這次同步改進了GPT-6的提示快取。同時,開發者可以通過儀表盤和診斷工具觀察快取效果,也可以調整推理努力等級和工具可用性而不破壞已有快取,還可以通過顯式breakpoint控制哪些prompt前綴進入快取。

GitHub提供了一個比較直觀的案例。OpenAI稱,過去幾個月的快取改進,讓GitHub Copilot數十億次請求中需要重新處理的prompt token比例下降超過50%,同時幫助提高響應速度。

Anthropic也在強調類似的邏輯。Sonnet 5目前價格為2美元輸入、10美元輸出,並提供最高90%的prompt caching成本節省。

小米的MiMo-V2.6則把快取價格進一步壓低,Flash快取命中輸入價格為每百萬token 0.0028美元,Pro為0.0036美元。

這意味著,未來企業真正需要計算的可能已經不是簡單的“token單價”,而是完整的單位任務成本:輸入token、輸出token、快取命中率、工具呼叫次數、推理輪數、延遲以及失敗後的重試成本。

除了token和快取成本,OpenAI還在降低另一種“隱性成本”:溝通時間。

GPT-6 Sol和Luna繼承了Astra改進後的溝通風格,在技術和程式設計對話中減少術語、奇怪措辭和低價值細節,回答更清晰,也更簡潔。

OpenAI給出的網頁設計案例,要求把網站改成Bento Box風格並增加頁面滑動切換,GPT-5.6 Sol花了不少篇幅解釋“不需要React”,還主動分享頁面數量、實現細節和圖片工具提示詞。GPT-6 Sol則直接說明修改方案,完成後交代結果,並補充檢查了桌面端、移動端和瀏覽器返回操作,同時明確網站無需React。

這種變化雖然不直接體現在API賬單上,卻會影響實際使用效率。

對於長期運行的程式設計和工作型智能體來說,少一點廢話、少一次確認,也意味著更低的時間成本。

04 欺騙率大降,邊界仍在

GPT-6 Sol和Luna還有一個容易被價格新聞蓋住的變化,就是對齊表現。

OpenAI公佈的內部測試顯示,在專門誘導模型不誠實的coding deception測試中,Sol的欺騙率從GPT-5.6 Sol的10.4%降至1.3%,Luna從9.5%降至2.8%。

在另一項“搜尋工具已經損壞”的測試裡,模型需要判斷工具失效並主動說明,而不是繼續猜答案。Sol沒有告知工具損壞的比例從77.8%降至5.4%,Luna則從78.3%降至30.2%。

Codex測試中,Sol沒有觀察到繞過自動安全審查的行為;Luna的繞過嘗試率從3.5%降至0.3%,且沒有一次成功。

不過,這組資料不能簡單理解為“模型日常使用中的錯誤率”。OpenAI解釋稱,這些測試是刻意設計出來的對抗場景,並不代表正常產品使用中的失敗機率。

而且,模型仍然存在明顯的邊界問題。

例如面對“訪問被拒絕”這樣的明確警告,Sol在測試中仍有64.4%的運行嘗試繞過限制,GPT-5.6 Sol為68.2%;Luna則從76.5%下降到42.4%。這說明模型在極端場景下的行為雖然有所改善,但距離“完全按照邊界行動”還有距離。

對於無人值守運行的企業智能體,這類指標的重要性甚至可能高於某個通用benchmark多提高幾個百分點。

05 GPT-6開始變成一套“模型分工”

目前,GPT-6家族的三檔定位已經比較清晰。

Astra繼續承擔最複雜的任務。OpenAI把它定位為GPT-6家族能力最高的模型,適合多步驟、多模態、科學和數學等高難度工作。

Sol則承擔大量複雜但高頻的工作,例如建構功能、程式碼審查、偵錯和資料分析。Luna進一步向大規模輕量任務下沉,包括摘要、提取和簡單問答。

這套分層最大的變化,是開發者沒有必要再讓所有任務都經過同一個旗艦模型。

OpenAI表示,Sol和Luna的新價格是長期價格,並非一個即將結束的短期促銷。這對企業尤其重要——價格長期維持,使用者可以直接把模型路由、快取策略和任務分層寫進生產系統。

這個角度來看,GPT-6 Sol和Luna真正改變的,也許不是某一個benchmark的排名。過去,模型競爭主要看誰能把能力再往上推一點。現在則是同樣一項工作,誰能用更少的錢、更少的token和更少的重試完成。(騰訊科技)