Grok 4.7上線,全球第三!馬斯克:4.8也訓完了

RexAA
AI速讀
xAI 發佈 Grok 4.7,主打程式設計與知識工作,並聲稱性能位居全球第三。雖然單價低廉且速度極快,但分析指出其高分高度依賴自家 GrokBuild 框架,脫離框架後戰鬥力下降。此外,由於輸出 Token 量極大,實際使用成本優勢被削弱。此舉顯示 xAI 採取「低價快速度」策略切入第二梯隊,並揭示 AI 產業趨勢已演變為利用私有框架捆綁開發者的生態競爭。

就在剛剛,馬斯克SpaceXAI正式發佈,全新主力模型Grok 4.7!

核心賣點主打一個,同樣的價格和速度,超強的性能。



馬斯克第一時間喊話,「Grok 4.7把SpaceXAI送上了智能體程式設計的第三把交椅,僅次於Anthropic和OpenAI」。

速度又快,價格又低,Grok 4.7是個人搬磚幹活的首選。

SpaceXAI官博中,官方給出的定位:史上最強Grok,專為程式設計和知識工作而生。



具體來說,Grok 4.7在程式設計和知識工作基準上,成績幾乎蓋過了GPT-5.6 Sol Max,直追Fable 5.1 Max。

輸入每百萬Token 2美元,輸出6美元,和Grok 4.6一模一樣。

但底層模型徹底大換血,基座模型更大,強化學習訓練拉長,任務難度加權向「需要數小時才能完成的工作」傾斜。

讓Grok 4.7和Grok 4.6去搓個開放世界城市遊戲,差距真的是肉眼可見。

值得一提的是,下一代2.5T新模型Grok 4.8也訓完了。

馬斯克的拿手好戲,才剛剛開始。

Grok 4.7登場

程式設計追進第一梯隊

更能量化Grok 4.7這輪進步的,還是程式設計測試。

拆開AA的榜單,資料很有意思。

綜合智能指數上,Grok 4.7拿下46分,相比4.6隻寒磣地漲了2分。而第一梯隊的Fable 5.1和GPT-6 Astra全是53分。

按單模型算,它排在第16名;按實驗室排,剛好擠到了第四。



而真正讓馬斯克吹上天的程式設計榜,其實是兩張。

1. 套上GrokBuild框架,Grok 4.7飆到56分,排在Fable 5.1、GPT-6 Astra和Opus 5之後。馬斯克口中的「全球第三」,是偷偷把Anthropic的兩個模型並成了一家。

2. 換到統一基準的Terminal-Bench4.0後,Grok 4.7的通過率當場暴跌到26%~27%。作為對比,GPT-6 Astra是60%,Fable 5.1是55%。


不過,在評測機構ValsAI這裡,Grok 4.7不升反降,直接從第14名一路跌到第24名,比上一代4.6還倒掛了5分。



馬斯克為什麼要拚命給Build框架站台?答案就藏在官方公告的附註裡——

Grok4.7在預訓練階段,深度對齊了GrokBot框架的互動模式。

換句話說,它極度依賴自家工具的呼叫邏輯和任務拆解套路。一旦走出溫室,戰鬥力瞬間打折。

知識能力,也非常能打

這次升級的另一塊重點,便是離所有人更近的一個場景——辦公。

在長流程知識工作測試AA-Briefcase中,Grok 4.7拿到1657 Elo,比Grok 4.6的High檔增加111分。

在GDPval-AA上,它拿到1695 Elo,比上一代高出90分。

這些任務看重的,是AI到底能不能幫專業的人把活兒幹完、交出像樣的東西。

比如,整理材料、製作文件、完成分析與簡報,Grok 4.7明顯比上一代大幅提升。

此外,在電氣工程測試EEBench上,Grok 4.7拿下64.0%,在所列四款模型中最高。


全網首測

有驚喜也有翻車

Grok 4.7一上線,不少人早就摩拳擦掌,上手嘗鮮了。

最出圈的一個demo,來自開發者Tak。

他壓根沒給Grok 4.7具體要求,就留了一句「你10分鐘內能做啥就做啥」。

結果 Grok 自己跑去 Blender 裡搓了個黃銅渾天儀,上面的行星甚至還能轉,引全網25萬人圍觀。

Tak本人點評,「講真,一點也不差」。



然後是經典節目,鵜鶘騎自行車。

有人直接拉滿組態,開了xhigh加fast模式開跑,燒了整整18分鐘,3.16美元。

結果出片還真像那麼回事,白鵜鶘在海邊騎車,翅膀搭在車把上。


另一個人跑出來的就拉胯多了,生成的棕色鳥直接癱在自行車上。



產品博主Paweł Huryn拿了兩個真實程式碼庫、埋了105個bug測了三輪。

結果是,GPT-6 Astra能修好45個;Grok 4.7搞定了28.7個。戲劇性的是,上一代Grok 4.6也是28.7個。



還有人直接上了硬碰硬的對照試驗:把同一個晶片項目,同時甩給Grok Build和Cursor裡的Grok 4.7。

整整兩小時,測下來最直觀的感覺就是四個字:又快又省。

順帶還扒出個新彩蛋,Cursor 居然悄悄把Grok 4.7的上下文頂到了500K,要知道上一代4.6可只有256K。



做程式設計Agent的Factory也第一時間接進了自家的Droid,給的評價比較克制。

工程、偵錯、資料、基礎設施的活都能幹,找命令比4.6快,medium檔夠用,high檔在老程式碼上有加成。


定價便宜五倍

一算總賬卻遭背刺

這次,Grok 4.7官宣的另一大亮點,是價格是同類一半。



不得不說,她的單價確實誘人:輸入2美元、輸出6美元。

對比Astra和Fable動輒10刀輸入、50刀輸出的刺客價格,Grok單價便宜了5到8倍。

官方曬出的Cursor Bench 4.0性價比曲線上,Grok 4.7最高檔拿下46.3%,解一道題成本6.01美元;Fable 5.1中檔46.8%,一道題7.05美元。看上去像是一場平分秋色的精準狙擊。

但只要拿放大鏡掃一眼圖表底部的細節,這筆賬就全變味了。



Fable 5.1低檔跑出45.1%,單題成本只要5.44美元,比Grok的最高檔還要便宜;而上一代的GPT-5.6 Sol高檔拿下35.7%,單題只需2.85美元。

玄機依然在於那驚人的「話癆體質」。

8.1萬輸出token,幾乎是GPT-6 Astra的三倍。單價便宜5倍,但廢話多了3倍,實際賬單優勢被生生腰斬。


Hacker News上有開發者算清總賬後吐槽:Grok 4.7的快取讀取單價甚至反超了Sol。

Cursor社區更是直接破防:「這根本不是什麼劃時代的性價比怪物,花掉的token幾乎是4.6的兩倍,4.5時代那種極致廉價感徹底沒了。」



不過在純速度上,它確實快得凶殘。

AA實測每秒狂飆188個token,fast模式更是原地翻倍。

模型加框架,才是下一個戰場

如今再看Grok 4.7的戰術意圖,已經徹底明牌。

它不打算碰AGI的絕對王座,而是退守前沿第二梯隊,卡住最便宜、最快的高地,專打性價比。

但這場發佈暴露出的真正行業趨勢——單體模型的時代,正在過去。

Grok 4.7的高分,有一大半是靠著Grok Build的量身定製硬頂上去的;一旦脫離自家的腳手架,分數立馬露餡。



Anthropic用Claude Code鎖死長程任務,OpenAI用Codex把持生態,xAI也終於走上了用私有框架捆綁開發者的路子。

未來的第三方評測榜單將徹底失去純粹性,以後再看到所謂的跑分排名,第一句話必須先問:

你到底是用什麼框架測的? (新智元)