馬斯克掀桌子了

大廠神仙打架,凡人連夜吃瓜。

馬斯克和奧特曼,永遠是針鋒相對的。

在OpenAI迫不及待解禁GPT 5.6系列的同一天,SpaceX AI和Cursor聯合發佈了Grok 4.5,搶光了前者的風頭。

倒不是說Grok 4.5比GPT 5.6強,而是因為,它是很特別的那種……

在DeepSWE 1.1上,Grok 4.5得分53%,被Fable 5的70%、GPT-5.5的67%完爆。

在任何基準上,Grok 4.5都算不上最頂尖水平,但它依然可能是今年最“聰明”的大模型。

因為它選擇一個其他大廠都不太想競爭的領域:夠便宜,夠快。

馬斯克的原話是,“Grok 4.5大致只相當於Opus 4.7,但它很快,非常快!

在SWE-Bench Pro任務中,Grok 4.5平均每個任務只輸出15954個token。

作為對比,Opus 4.8輸出67020 個token,差了4.2 倍。

推理速度則飆到了80-100 TPS(Tokens Per Second),是Flash類模型才有的速度。

更關鍵的是價格,每百萬輸入token 2美元、每百萬輸出token 6美元。

同樣完成一個程式設計任務,用Opus要花 1 美元,用Grok 4.5可能只要0.1美元,差了一個數量級。

Grok 4.5憑什麼又快又便宜?

01

簡單點說,還是靠馬斯克的鈔能力。

好東西全買過來裝備上,怎麼會不強?

複雜點說:

首先還是大力出奇蹟那招。

xAI還在世的時候,其最大的特點就是壕,基礎設施底子太厚了。

Grok 4.5的底座是代號為V9的1.5兆參數巨型模型,動用了4.5萬塊GB300 GPU進行叢集訓練,是上一代的三倍。

但是,光有算力是不夠的,否則Grok早就是世界第一。

早在xAI併入SpaceXAI之前,根據《The Information》獲取的內部備忘錄資料,其模型浮點運算利用率(MFU,即GPU的“工作效率”)只有11%。

相比Meta的43%,Google的46%,甚至是很早前GPT-3的21-26%,都遠遠不如。

所以在SpaceXAI成立的同時,馬斯克還宣佈,把坐擁超過22萬張GPU的Colossus 1租給Anthropic。

這一舉動,當時來看,一是為了噁心OpenAI;二是為了測試算力租賃的商業模式、服務流程、定價策略,為未來的太空算力落地做準備。

先來來看,應該還有更重要的第三點,即學習對方的算力調度經驗,最佳化自己的算力叢集管理。

Grok 4.5價格、上下文和token效率

根據HuggingFace的拆解研報,Grok 4.5的MoE架構和舊版本完全不是一個物種。

1.5兆總參數被切分了256 個專家,每次推理只啟動其中的 4到6個。

其活躍參數量大概只有200億,極大地降低了計算延遲,單次前向傳播的計算量甚至低於百億規模的模型。

也就是馬斯克說的,“比Flash類模型還快”。

同時,以往大模型做強化學習,目標是“不計成本地提高正確率”,導致模型在思考時會產生嚴重的“思維反芻”。

SpaceXAI的科學家這次另闢蹊徑,不再追求極致的性能,而是在達到一定標準的前提下,用更少的步驟、更少資源解決問題。

最終的表現就是,在一定標準下,解決相同的問題,Grok 4.5消耗的token遠遠低於競品。

那又為什麼便宜呢?

主流模型SWE Bench Pro任務token消耗對比

第二個功臣是剛剛花600億美元收購的Cursor。

Grok 4.5被投喂了數以兆計的Cursor使用者真實互動資料。

靜態資料只能讓模型吸收知識,而這些動態資料,記錄了數以萬計開發者在IDE裡多輪編輯記錄、大程式碼庫上下文切換、錯誤恢復路徑、工具呼叫序列的等等行為。

使得模型知道在面對複雜的大型程式碼庫時,第一步該看那,第二步該連那個工具,從而省去了大量的無效嘗試。

根據TechCrunch曝光的架構圖,Grok 4.5全面拋棄了老舊的GQA(分組查詢注意力),採用了進階的 MLA(多頭潛在注意力),將龐大的KV向量通過低秩投影壓縮成緊湊的潛在向量。

這就使得Grok 4.5在處理128K上下文時,KV Cache的視訊記憶體佔用直接縮減了85%,硬體攤銷成本斷崖式下跌。

主流模型價格對比

總而言之,Grok 4.5雖然不是最強的大模型,但其競爭力不可謂不強。

它不再追求極致性能,而更側重效率和性價比。

換句話說,側重點不再是卷技術,而是卷價格,搶佔行業份額。

這是價格戰,但不同於一般意義上的價格戰。

02

過去幾年,AI行業的商業模式其實非常“貴族化”。

Anthropic和OpenAI維持著高昂的API價格,靠B端客戶的預算來補貼天文數字的研發成本。

大家都在講縮放定律的信仰,只要模型夠大夠強,有的是人乖乖掏錢。

但Grok 4.5這次把遮羞布扯下來了。

《紅杉資本2026年全球AI創投報告》中提到過一個概念:“模型即服務(MaaS)最終會退化為公用事業”

就像老馬在X上回覆的那樣,大部分任務、大部分人,根本不需要Fable 5那麼高的智能。

Anthropic在B端的成功,很難複製到C端,因為90%普通人實在沒比要花大價錢去用最強的模型。

Grok 4.5的定價策略就是典型的公用事業打法。

它與傳統價格戰的區別在於:不是給同類產品降價,而是用一個完全不同的成本結構重新定義“這個價位應該是什麼性能”。

過去18個月到現在的Grok 4.5,前沿模型的輸出成本從75美元/MTok跌到了6美元/MTok,降幅高達92%。

如果加上token效率的提高,實際任務成本跌了超過99%。

在這種情況下,跟著無腦卷價格是相當不明智的。

其它廠商會如何應對?

Anthropic,堅守B端市場。

Anthropic現在有點尷尬,Fable 5的智能雖然斷層領先,但中端主力Opus 4.8對Grok 4.5並沒有形成壓倒性優勢,成本還高得離譜。

所以Anthropic宣稱,將自主研發的Claude Code工具中的系統提示詞砍了80%。

官方解釋說是因為Fable 5太聰明了,“不需要那麼多廢話指導”。

但實際上,這明顯是在幫使用者省輸入Token成本,從而避險高昂的API單價。

OpenAI擁有全世界最大的使用者基數,是最靈活的。

GPT-5.6定價是Grok 4.5的5倍,後續很可能會立刻大幅下調GPT-4.5/5基礎版的價格,並推出真正意義上的“原生智能體作業系統”,把競爭從價格層面轉移到“工作流平台”。

Google,則幾乎可以不理會。

Grok再便宜,還是按Token收費。

依靠Google雲的龐大基建,Google完全可以把價格戰變成基礎設施的消耗戰。

更何況,早先Gemini 3.5flash發佈時,Google已經大幅降價過一次。

所以接下來的策略很可能是:不繼續降價,但擴大上下文窗口+強化多模態+免費額度佔領開發者入口。

至於其它小廠和開源社區,就比較慘了,幾乎只能通過純技術創新來省錢。

比如最近在Reddit的LocalLLaMA社區大火的開源工具pxpipe,利用PNG圖片的隱寫術,把原本冗長的程式碼上下文和文字隱藏進一張極小的PNG圖片裡,直接喂給支援多模態的 Claude Code或Fable 5,幫使用者砍掉70%的Token成本。

這種民間智慧的湧現,不僅印證了當下整個市場對控成本已經到了近乎變態的執念,也證明了AI產業的路線已經發生改變。

03

Grok 4.5明確做了一個行業表率:benchmark分數夠用就行,真實世界的生產力效益更重要。

除了夠快,夠便宜,Grok 4.5的另一大驚豔之處,是它與Cursor / Grok Build的深度融合。

過去,大模型和開發工具是割裂的。而現在,SpaceXAI完成了閉環。

這種“垂直整合”的威力,當年蘋果在硬體和軟體上玩過,特斯拉也在汽車和自動駕駛晶片上玩過。

一旦這個資料飛輪徹底轉起來,那些只有大模型底座、沒有核心高頻應用場景粘性的廠商,將會面臨老生常談的“管道化”危機。

在商業方面,不再具備任何競爭力。

大模型的整體價格必然繼續下降,等到明年,一個SWE-Bench Pro級任務的成本可能降到 0.01美元以下。

無論此時還是彼時,再去爭論那個最強已經失去意義,就像現在沒人會在意那個雲廠商的伺服器最強一樣。

唯一的競爭維度將變成:性價比。

就像現實中的實物商品一樣。

只有當矽基智慧被捲成了像水電一樣、幾塊錢一噸的基礎公共資源,那些曾經只存在於科幻裡的人工智慧概念,才真正有了飛入尋常百姓家的可能,有了投入應用市場的可能性。

這是每個人都應該享受到的時代紅利。(AI探馬)