就在剛剛,GPT-6.1 Sol突襲上線!
現在,Codex裡已經可用了。
在OpenAI開發者大會上,GPT-6.1 Sol就這麼水靈靈地被發佈了。
有趣的是,據說,因為對齊回歸的問題,原定的GPT-6.1被緊急暫停。
但誰也沒想到,OpenAI反手掏出了一個「幹活特化版」的 GPT-6.1 Sol,直接殺進了 Codex 和 ChatGPT Work。
官方給出的口號非常誘人:“以五分之一的價格,獲得接近 Astra 的智能水平。」
性能逼近地表最強GPT-6 Astra,但價格大縮水?
聽起來,跟昨天發佈的Sonnet 5.5異曲同工了。
看來,ASI雙雄都在力押同一賽道——對整個AI應用層、尤其是Agent賽道發起降維打擊。
有人評論:6.1 Sol 在基準測試上和 Astra 一樣好,而且便宜 5 倍!OpenAI 在不到一周的時間裡徹底殺回來了
價格打穿底線,Agent 終於用得起了!
GPT-6.1 Sol的價格,首先就非常驚喜。
它的API標準價定格在:
輸入: 2美元 / 每百萬 Token
輸出: 10美元 / 每百萬 Token
作為對比,GPT-6 Astra 的價格是輸入 10美元、輸出 50美元。也就是說,GPT-6.1 Sol 剛好是 Astra 價格的 20%。
不過,最讓開發者們驚喜的,是它的「快取讀取價格」。
快取輸入: 僅僅 0.10美元 / 每百萬 Token!
快取寫入: 2.50美元 / 每百萬 Token
0.1美元的快取讀取價,比標準輸入直接便宜了 95%!因此,用它運行Computer Use、程式碼生成 Agent時,價格簡直跌穿地心。
官方紙面資料:「小杯」的價格,「超大杯」的表現
上周才發佈的 GPT-6 Sol 因為表現不佳被不少人吐槽,今天OpenAI用 GPT-6.1 Sol 算是狠狠地挽回了顏面。
在程式設計能力(DeepSWE v1.1)上:它以五分之一的成本打平旗艦 Astra,比舊版 6 Sol 提高了 6.4個百分點。
在電腦操作(OSWorld 2.0)上,距離王者 Astra 僅僅相差 2.1分,單任務成本約為其七分之一。
在專業辦公(AutomationBench)上,中等推理強度下,它得分比Opus 5.5 高出 2.2 個百分點,成本只有其三分之一!
複雜的專業 PDF 文件處理GDP.pdf 上,在所測試的各檔推理設定下,GPT‑6.1 Sol 的得分均高於帶回退機制的 Opus 5.5,而單任務成本不到其一半。它還以約五分之一的單任務成本,接近 GPT‑6 Astra 的性能。
在科學研究(Terminal-Bench Science)上,它的得分是舊版的兩倍,單任務成本僅為 $5.47,而 Astra 和 Opus 5.5 都要 23美元以上,性價比簡直爆炸。
在內部對齊評估中,GPT-6.1 Sol相較GPT-6 Sol改進重大,更接近GPT-6 Astra。
它在自身侷限性方面更加透明,在尊重使用者意圖和安全約束方面也更加可靠。
官方系統卡洩露:實錘「最強循環模型」
與此同時, 45 頁 GPT-6.1 Sol 系統卡也曝光了,其中有不少亮點。
在系統卡的第 8 節「可監控性」中,OpenAI 官方披露了一組驚人資料。
測試顯示:與 6-Sol 和 5.6 Sol 相比,GPT-6.1-Sol 的思維鏈可控性強得離譜!
資料指出,在生成 750 到 1250 個 Token 長度的思維鏈時,GPT-6.1 Sol 能夠成功遵循格式和控制指令的比例高達 44.8%,而上一代的 GPT-5.6 Sol 只有可憐的 16.1%。GPT-6.1 Sol 能夠完美在大小寫字母間交替輸出,而不去破壞底層的邏輯鏈條。
大V@scaling01 在看到這份系統卡後,直接驚呼:
GPT-6.1-Sol 擁有極其瘋狂的思維鏈可控性……這基本證實了它就是他們那個更小的循環模型!
什麼是循環模型?
這意味著它不是為了像聊天機器人那樣「一問一答」而設計的,它是專門為了在後台自我反思、自我糾錯、不斷循環思考而生的。
極高的思維鏈可控性,加上白菜價的上下文快取費,GPT-6.1 Sol 天生就是為了跑大批次、長時間 Agent工作流而完美打造。
此外,系統卡還披露了其在網路安全上的恐怖實力。
GPT-6.1 Sol 被 OpenAI 內部評定為「Critical(危急)」等級。
在內部零日漏洞開發測試(Internal Port)中,它的任意程式碼執行成功率達到 21.5%,直接碾壓了 GPT-6 Sol 的 5.5%,僅次於最強王者 Astra(31.5%)。
全網極限實測GPT-6.1 Sol
現在,X上已經被GPT-6.1 Sol的實測刷屏了。
看起來,有著神級性價比的6.1 Sol,簡直贏麻了。
@notjazii 用同一個高難度提示詞,把模型開到最高推理強度,拉表對比了四家:
GPT-6.1 Sol: 耗時 10分鐘,花費 $1.50
Claude Sonnet 5.5: 耗時 50分鐘,花費 $9.21
GPT-6 Astra: 耗時 25分鐘,花費 $11.00
Claude Opus 5.5: 耗時 45分鐘,花費 $13.50
他的結論是:“6.1 Sol 的輸出結果甚至比 Astra 還要好,只花了零頭的錢!
雖然整體還達不到 Opus 5.5 的天花板等級,但在價格和速度上,6.1 Sol 絕對是贏家。
他還做了一個 SVG 快速測試,6.1 Sol 明顯比上周的 6 Sol 更快更好。
3D 初創團隊 Higgsfield 讓 6.1 Sol 和 Astra 做同一個 3D 遊戲原型。
結果,GPT-6.1 Sol 以 1/5 的成本,用快了 4 倍的速度完成了相同的工作流。
大V Bindu Reddy這樣評價:「GPT-6.1-Sol 漂亮地轉移了『智能 vs 成本』的前沿陣地。如果你在乎『每美元能買到多少智能』,6.1 Sol 絕對值得一看;如果你只想要無視成本的最高智商,Opus 5.5 依然領先。」
⚔️ 第二回合:邏輯、跑分與 CoT 控制力
@AiBattle_ 與 @LuminaBench 的跑分對決
在知名的 AA Intelligence Index 測試中,GPT-6.1 Sol (Medium檔) 拿到了 48 分,直接追平了上一代 GPT-6-Sol 的 Max 檔。
而 GPT-6.1 Sol (Max檔) 拿到了 52 分,距離老大哥 Astra (Max檔) 的 53 分,僅差 1 分!
LuminaBench 測試了 3D Colosseum 提示詞(與 Gemini 4 Pro 對比),表示:「Astra 和新的 Sol 感覺簡直一模一樣,但它們依然被 Anthropic 的 Opus 和 Sonnet 碾壓,如果下周 Haiku 超過它我都不意外。」
@kickingkeys 的 JS 視訊生成他對比了 GPT-6.1 Sol 與 GPT-Astra 使用 JavaScript 建立視訊的能力,從他放出的示例來看,兩者在程式碼執行和最終效果上幾乎不相上下。
所以,該如何定位GPT-6.1 Sol?
透露了 OpenAI 一個極其核心的戰略轉變:從「先發最強」變成了「先發最能幹活」。
原定的 GPT-6.1 因對齊問題被按下,但 OpenAI 立刻把 Sol 版搶先塞進了 Codex 和 ChatGPT Work。注意!它目前只對 Plus 及以上付費使用者開放,普通 Chat 里根本用不了!
正如網友 @TokenGremlin所總結:「GPT-6.1 Sol 基本上就是窮人版的 Astra。好好享受吧。說實話,這個版本出人意料地好。我真的很喜歡它,而且他們能把成本壓到這麼低,同時智能水平又如此接近 Astra,這確實讓我印象深刻。」
即日起,所有 Plus、Pro、Business、Enterprise 和 Edu 使用者均可在 ChatGPT 工作區和 Codex 中使用。開發者可以通過 API 呼叫 gpt-6.1-sol。同時,OpenAI 還推出了最高提速 8 倍的 Ultrafast 版本,專供高階開發者。
在前端和畫圖上,GPT-6.1 Sol 暫時打不過Sonnet 5.5 和 Opus 5.5,但在企業最在乎的「多步驟邏輯」、「大規模程式碼Agent」和「成本控制」上,它直接掀翻了桌子。(新智元)
