GPT-6、Gemini、Muse密集迭代,大模型王座不再穩固

AI速讀
近日 AI 領域爆發新一輪軍備競賽,OpenAI、Google 與 Meta 在 48 小時內接連推出新模型,導致前沿模型的保鮮期縮短至小時級。分析顯示,頂尖模型的智能表現已高度趨同,導致基準測試分數僅具修辭意義。目前業界競爭焦點已轉移至「成本戰」與「垂直化」:Meta 與 Google 透過降低單任務成本侵蝕高價閉源模型市場;而 Google 更透過推出僅限特定機構使用的安全專用模型 Cyber,試圖建立新的護城河。此外,Meta 旗艦模型轉向閉源,標誌著生態優先已讓位於成本與節奏的精確掌控。AI 智能正逐漸成為像水電一樣的基礎商品。

OpenAI在發佈說明裡點明,這次上線是一整套全新系統首次在真實生產環境中整體運轉,為此團隊正在調集大批計算資源、擴充推理能力。


兩天之內,三場前沿發佈,最快的一次反超只用了五小時。

9月4日,OpenAI宣佈開始分批次發佈GPT-6 Astra,優先向全部Plus使用者開放,官方口徑是穩妥與速度並重,整個發佈預計數天內完成。而就在兩天前,9月2日,Google與Meta同日各放一款新模型。Google端出Gemini 3.8 Flash,這是它六周內第三款Flash;Meta端出Muse Spark 1.3,這是它五個月內第四款Spark。Meta新模型上線數小時後,即在Artificial Analysis智能指數上反超Google同日新品。兩場發佈之間,只隔了四十八小時。

放在兩年前,一款旗艦發佈足以佔據一周頭條。如今,前沿模型的保鮮期被壓縮到以小時計。這並非某一家公司的困境,而是一個更冷的訊號。大模型智能本身,正在變成一種可以被快速複製、快速刷新的商品。誰先發佈、誰更便宜、誰更垂直,正在取代“誰最強”,成為更值錢的三個問題。

兩條路線,同榜撞車

先看Google。Gemini 3.8 Flash每百萬token輸入0.75美元、輸出3.75美元,與三周前的3.7 Flash持平。但TestingCatalog的日報標註得更準確,這是12月31日前的入門價,不是永久定價。Google沒有把低價當成長期承諾,而是當成換取市場份額的限時籌碼。

按Google官方自測表,3.8 Flash在每一項都壓過3.7 Flash。長周期軟體工程測試DeepSWE v1.1從65.3%升至73.7%,終端基準Terminal-bench 2.1從85.8%升至89.4%,OSWorld-2.0從50.6%跳到59.0%,金融智能體基準Vals Finance Agent v2從59.0%升至61.4%,HLE-Verified從53.6%升至54.9%。單看這一串數字,這是一次標準而全方位的分數抬升。

更具參照價值的是它同旗艦級模型的對比。Google自測表裡,3.8 Flash在DeepSWE v1.1上拿到73.7%,距Claude Opus 5的74.0%僅差0.3個百分點;HLE-Verified的54.9%,壓過Opus 5的54.4%和GPT-5.6 Sol的54.5%。而Opus 5每百萬token輸出價25美元,是3.8 Flash的近七倍。一款Flash檔模型,在數個硬核基準上逼近甚至追平售價25美元輸出價的旗艦,這才是這條新聞真正的份量。

再看Meta。Muse Spark 1.3在Artificial Analysis智能指數上拿到62分,僅次於Claude Fable 5.1(66分)與Claude Opus 5(63分),位居全場第三。這個62分來自其max變體,目前僅對Meta的合作夥伴限量開放;真正現在就能用的xhigh變體拿61分,與GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)並列。相比一個月前1.2的57分漲了4分,相比7月1.1的53分漲了8分。Meta將曾被視為“跟跑”的Spark系列,一舉推入第一梯隊。

兩條路線在此分岔。Google打“高頻小步”,以六周三款的節奏打磨快船,價格釘死在入門檔,靠節奏換空間;Meta打“單點爆發”,五個月放出四款,每一款都試圖在指數榜上直接衝擊前三。9月2日,兩條路線在同榜撞車,幾個小時後Meta贏了。而四十八小時後,OpenAI帶著新款旗艦入場,這場勝負還沒來得及被市場消化,就變成了舊聞。

OpenAI的第三條路線:規模壓頂

如果說Google賭的是節奏,Meta賭的是高度,OpenAI賭的則是規模。

9月4日開始的GPT-6 Astra發佈,把這場競賽從開發者社區拉向大眾市場。它不再只對Pro、Business和Enterprise開放,而是向全部Plus使用者鋪開,官方口徑是“以儘可能謹慎且快速的方式推進”,發佈本身需要數天滾動完成。一句話,OpenAI對這款模型的信心,足以支撐它在最大範圍的使用者群上首日開跑。

規模之外,是算力的大舉投入。OpenAI在發佈說明裡點明,這次上線的不是單個模型,而是一整套全新系統首次在真實生產環境中整體運轉,為此團隊正在調集大批計算資源、擴充推理能力,確保全部Plus使用者都能順暢用上。翻譯成行業語言,GPT-6 Astra不是一次參數微調,而是一次基礎設施的大規模擴容。

但規模路線也有軟肋,分數開始變得曖昧。ARC Prize的分析顯示,GPT-6 Astra在ARC-AGI-3上以62.7%的Standard框架分數居首,換用新的Provider Adapter框架後卻升至99.9%,並在96%的關卡上超過人類表現。同一個模型,兩種測量框架,差出37個百分點。62.7%說明它還沒擺脫智能體的笨拙,99.9%又像是宣告ARC-AGI-3已被打穿。這種分裂恰恰印證了行業的共識,當測量框架本身開始影響結論,所謂的“登頂”就只剩下修辭意義。

如果只看分數,這些發佈似乎都在宣告“又變強了”。但把分數攤開看,一個更令人不安的事實浮出水面。最前沿的幾家實驗室,智能水平正在不可逆地趨同,而測量分數的尺子本身,也開始鬆動。

HLE-Verified是最能說明問題的數字。Gemini 3.8 Flash為54.9%,Claude Opus 5為54.4%,GPT-5.6 Sol為54.5%。三家實驗室,分數緊咬在小數點後一位。DeepSWE v1.1同樣如此,73.7%對74.0%,差距不足一個百分點。當幾款模型在“人類最後一場考試”這種終極難度基準上只差0.5個百分點時,“碾壓”“吊打”的敘事已失去依據。

這種分裂在GPT-6 Astra身上被放大到極致,同一模型在ARC-AGI-3上,標準框架只有62.7%,換用Provider Adapter框架卻衝到99.9%。分數可以因尺子而大幅擺動時,所謂“登頂”就只剩下修辭意義。ARC-AGI-3接近飽和,某種意義上不是模型的勝利,而是測量框架的勝利。

Google在發佈中承認,3.8 Flash“工作得更努力”,即執行了更多推理步驟與工具呼叫,在高思考檔下可能消耗更多token。翻譯過來,分數上漲的代價不是“更聰明”,而是“更用力”,用更多計算與更多輪次堆出零點幾個百分點的提升。OpenAI那邊是同一個邏輯,GPT-6 Astra的發佈說明裡寫著“多個全新系統將首次大規模運行,團隊正帶來大量算力”。當智能提升從“範式突破”退化為“算力堆疊”,前沿模型的軍備競賽便淪為邊際收益遞減的內卷。0.3個百分點的DeepSWE提升,背後是多少額外token、多少額外推理時間,帳面上無法精確核算。智能正在從“稀缺品”變為“耐用品”,稀缺性快速蒸發。

單位智能成本,才是新的度量衡

如果智能趨同,下一場戰爭的勝負手便落在“每一分智能要花多少錢”上。一個指標正在取代傳統benchmark排名,成為投資人、開發者與雲廠商真正緊盯的數字,是cost per task,即單任務成本。

Artificial Analysis給Muse Spark 1.3 xhigh算出的單任務成本是0.55美元,而同處61分檔的Grok 4.6要0.94美元,GPT-5.6 Sol要0.95美元,Claude Opus 5要1.23美元。也就是說,Meta僅以對手45%到59%的成本,便購得同檔智能。再往下看,Gemini 3.8 Flash單任務成本0.58美元,指數分59,緊貼Meta。整個行業的性價比前沿正被這兩家重新刻畫,而Anthropic旗艦則據守在智能更高、成本也更貴的另一端。

價格崩塌是全域性的。就在幾個月前,DeepSeek將V4-Pro價格永久下調75%,輸出價砍到每百萬token約0.87美元,快取命中的輸入價低至每百萬token約0.0036美元。現在連Google都開始用12月31日到期的入門價鎖定客戶。當巨頭把限時降價當成獲客手段,“高價閉源”這套商業模式的根基便開始晃動。

這裡藏著一個反直覺的轉折。通常我們說“便宜沒好貨”,但在這條賽道里,最便宜的那批模型恰恰在侵蝕最貴那批的地盤。Gemini 3.8 Flash用3.75美元的輸出價,去對標Opus 5賣25美元的同一個基準;Meta用0.55美元的單任務成本,去對標對手0.94美元甚至更高的同樣分數。價格戰打到這個階段,比的已不是誰能賺錢,而是誰能在“智能趨同”前提下,把單位成本壓到讓對手的定價失去合理性。

當通用智能的邊際收益越來越薄,前沿實驗室開始把差異化押在“專用”上。Google這次最被低估的動作,不是3.8 Flash本身,而是隨它一起發佈的Gemini 3.8 Flash Cyber,一款網路安全專用模型。

它與普通版最大的區別不在架構,而在“誰有資格用”。Cyber僅通過Google的Fairwind計畫開放,面向受信政府機構、關鍵基礎設施營運方與軟體維護者,普通開發者拿不到。這是前沿實驗室第一次把“防守專用”做成一條有准入門檻的產品線。Google內部基準裡,Cyber在漏洞發現基準上成功率達71.0%,在CWE-Bench補丁修復上的pass@1為47.2%,逼近Claude Fable 5的47.8%;它修復Chrome漏洞的正確補丁數量是最大商用模型的2.6倍,在Wiz滲透測試基準上召回率高7.5到9.7個百分點、成本低2.3到5.2倍。

這個動作的份量,不在那47.2%的分數,而在於它把“安全”從一句宣傳口號,變成一個可以收費、可以圈地、可以設定准入門檻的垂直市場。網路安全是天然的賣方市場。漏洞在增長,攻擊在自動化,能看懂程式碼又懂攻防的工程師永遠短缺。把一個Flash檔模型微調成“只服務防守方”的專用工具,Google實際上是在通用智能趨同的泥潭之外,開闢一塊別人短期進不來的高地。安全,成為智能商品化時代裡最不易商品化的生意。

誰會贏,誰危險

Meta這邊,藏著一個更微妙的反轉。過去幾年,Meta在大模型世界一直扮演“開源旗手”,Llama系列是開源權重陣營的精神圖騰,Epoch AI的研究還專門量化過“開源模型普遍落後閉源約一年”這一規律。然而Muse Spark,這個如今替Meta在指數榜上搶下第三的旗艦,恰恰是一款閉源模型。它是Meta在2026年4月推出的第一款專有閉源模型,從誕生那天起就鎖著權重。

這意味著什麼?曾經高舉“開源普惠”大旗、靠開源權重撬動生態與人才的Meta,如今在最能打的旗艦上選擇了閉源。這不能簡單理解為“背叛”。更接近真相的解釋是,當智能趨同、價格崩塌,開源策略能換來生態,卻換不來前沿榜上的座次,也換不來每任務0.55美元這種被精確計算的成本優勢。閉源給了Meta對推理成本與迭代節奏的完全掌控,而這兩樣,正是當下軍備競賽裡比“開放”更硬的貨幣。

這也讓整個行業格局變得前所未有的矛盾。最貴的Anthropic在高價閉源,最便宜的中國選手在極限降價,曾經的開源旗手在閉源,曾被詬病“只會刷版本”的Google在瘋狂刷版本,同時用一款門控的安全模型去挖垂直護城河。沒有誰還守著一條純粹的路,所有人都在“智能趨同、成本為王”的同一條賽道上,各自找一個還沒被踩爛的角落。

把這兩天三場發佈放回更大的棋盤,值得記住的判斷有三條。

榜單的時效性已短到失去參考價值。Muse Spark 1.3上線五小時反超Gemini 3.8 Flash,四十八小時後OpenAI又啟程一輪新發佈,而GPT-6 Astra的分數還隨測量框架在62.7%與99.9%之間擺動。在一個“發佈即落後”的市場裡,任何基於“某模型登頂”的長期押注都顯脆弱。投資人該看的不是誰今天第一,而是誰能把“低成本高頻迭代”這台機器持續轉下去。

高價閉源的帳越來越難算。當一款3.75美元輸出價的Flash模型,在DeepSWE和HLE上逼近25美元輸出價的旗艦,價格錨就被徹底打穿。但也要把話說全,Flash並非全面追平,在長周期通用智能體與電腦操作上仍被甩開。Terminal-bench 4.0隻有19.1%,Opus 5達51.8%;OSWorld-2.0為59.0%對75.4%。Anthropic和OpenAI並非沒有護城河,這些尚未被Flash攻下的山頭仍在,只是“我們更強所以賣更貴”的邏輯已經失效,剩下的只能是“我們更貴,但能辦成別人辦不成的事”。

垂直專用與准入壁壘,將成為下一階段的護城河。Gemini Cyber的Fairwind計畫是個樣本。用安全資質篩選客戶、用專用基準證明價值、用門控機制擋住平替。當通用智能平民化,真正值錢的就不再是“智能”本身,而是圍繞智能搭起的那套只能由特定人使用的門檻。

對開發者而言,最實際的建議只有一條。別再為“最新最強”支付溢價,改按cost per task與任務成功率做採購決策,同時警惕那些用“更多推理步驟”換分數、卻隱性推高token帳單的模型。你買的不是“智能”,而是單位成本下真正能落地的那一份。

兩天,三場發佈;五小時,一次反超;四十八小時後,新一輪發佈已經啟程。當模型發佈的速度終於快過人們讀完一篇評測的速度,這個行業真正被爭搶的,已不再是“誰最聰明”。聰明正在變成水電煤,真正值錢的,是閘門、管線,以及那張決定誰有資格開燈的門禁卡。(鈦媒體)