AI 圈沒有假期。
從 OpenAI、Anthropic 到 xAI,各家巨頭彷彿商量好了一樣,連夜趕考,集中搶位。假期還沒正式開始,基模決戰的氣氛就已經烘托到位了。
就在剛剛,SpaceXAI 正式發佈 Grok 4.7。
官方將其定位為目前最強的程式設計與知識工作模型。新模型已經進入 Cursor、Grok Build 和 Grok API,也將通過第三方程式設計工具、模型路由平台與雲服務提供。
Grok 4.7 的發佈比馬斯克最初預告的時間晚了不少。從 7 月下旬開始吹風,到改口「再等幾周」,接著壓縮到「十天之內」,最後又來了一句「模型還得再調校調校」……
一鴿再鴿後,Grok 4.7 的發佈重點因此顯得十分明確。SpaceXAI 沒有把主要篇幅放在聊天體驗或多模態展示上,而是集中強調長時間執行、自我檢查、專業知識工作,以及更有競爭力的價格性能比。
Grok 4.7,把長任務擺上檯面
按照官方介紹,Grok 4.7 使用了一個比 Grok 4.6 更大的全新基礎模型,強化學習時間更長,訓練任務也更難,其中相當一部分需要數小時才能完成。
模型同時加強了長上下文管理和結果核查能力,並針對 Grok Bot 的運行環境進行了原生訓練,以提升對話任務和通用知識工作的表現。
官方公佈的多項成績顯示,Grok 4.7 相比上一代有明顯進步。
在 CursorBench 4.0 中,Grok 4.7 xHigh 得分為 46.3%,高於 Grok 4.6 High 的 40.4%;DeepSWE v1.1 從 65.2% 提高到 71.0%;
Terminal Bench 4.0 則從 20.3% 升至 38.0%。電氣工程基準 EEBench 的成績從 53.0% 提高到 64.0%,面向長時間辦公任務的 AA Briefcase v1.1 也從 1546 分增至 1657 分。
橫向比較後,Grok 4.7 的優勢主要集中在價格和部分專業任務,綜合成績仍未全面領先。
在 CursorBench 4.0 和 Terminal Bench 4.0 上,它低於 Fable 5.1 Max;在 DeepSWE v1.1 上略低於 GPT 5.6 Sol Max;
但在 Harvey Legal Agent Benchmark 中取得 19.6%,明顯高於官方表格中的幾款對比模型。
Artificial Analysis 隨後給出 46 分的 Intelligence Index 成績,稱 Grok 4.7 讓 SpaceXAI 進入全球前四名 AI 實驗室,其 Coding Agent Index 表現也超過 GPT 5.6 Sol。
價格成為 Grok 4.7 最直接的競爭籌碼。其 API 定價與 Grok 4.6 相同,每百萬輸入 token 為 2 美元,每百萬輸出 token 為 6 美元。
SpaceXAI 還提供輸出速度翻倍的快速版本,價格也相應翻倍。
用馬斯克的話來說,Grok 4.7 Grok 4.7 是一款集智能、速度和低成本於一體的強大產品,SpaceXAI 官方則直接宣稱,它的速度可達到同類模型的兩倍,價格只有一半。
程式設計之外,SpaceXAI 開始爭奪專業工作。
官方專門強調文件和簡報能力,並引用 GDPval 與 AA Briefcase 等評測,試圖證明模型可以承擔律師、護士、金融分析師等專業人士的部分工作。
對應到產品方向上,Grok 4.7 想進入的是需要讀取大量材料、持續呼叫工具並反覆核對結果的長流程任務。
Box 展示的一項保險理賠案例更能說明這一方向。
Grok 4.7 在 Box Agent 中核對一筆價值 200 萬美元的索賠、保單與相關記錄,發現 8.2 萬美元重複發票和 6.4 萬美元遺漏的供應商抵扣,還識別出一個可能令計算結果相差 14.3 萬美元的免賠額問題。
系統最終生成了一份帶引用的審查報告,保險覆蓋範圍和付款決定仍由理賠人員完成。
安全能力也被列為此次升級的重要部分。
SpaceXAI 表示,Grok 4.7 使用了全新的安全防護體系,在 LatchBio 生物安全基準中取得 62.4%;在面向高風險網路安全任務的 HackerBench v0.3 中,只有 3.3% 的危險雙重用途提示通過,同時儘量減少對正常安全研究的誤拒。
部分網路安全合作夥伴還將獲得邀請制的紅隊能力,用於防禦研究。
網友玩瘋了,但口碑…
Grok 4.7 上線後的第一批測試主要集中在網頁、3D 場景和可視化程式設計,但口碑嘛,可以說是兩極分化的厲害。
Eric Zakariasson 展示了 Grok 4.6 與 4.7 製作《帝國時代 II》演示項目的對比。
Ashutosh Shrivastava 則讓模型根據平面圖搭建 Blender 結構,再匯出為互動式 Three.js 網站,上述測試都呈現了它處理多步驟視覺任務的能力。
在另一組測試中,開發者 Diego Cabezas 讓 Grok 4.7 xHigh 用 Python 模擬單行道交通燈和隨機駛入的車輛,並稱其細節是同類測試中最豐富的一次。
AI/ML API 使用四個獨立的 Three.js 太空場景比較 Grok 4.7 與 Claude Opus 5,稱前者完成測試約花費 0.20 美元,後者約為 2.05 美元,Grok 在其中三個場景中用時更短。
不過,開發者 Bhavy 則認為 Grok 4.7 在 3D 和前端任務上的表現低於預期,主要問題包括物理效果生硬、提示理解不穩定和 token 消耗過快。
Harshith 在 Grok Build 中生成 Airbus H145 直升機的 Three.js 模型,也認為 4.7 的結果遜於 4.6,並稱任務耗時約 45 分鐘。
另一項鵜鶘騎自行車的 SVG 網頁動畫測試中,Grok 4.7 對畫面結構和運動關係的處理同樣備受詬病。
也有開發者給出了更居中的判斷。Salio 認為 Grok 4.7 的實際表現高於預期,視覺質量略低於 Astra,但高於 Sol。
整體來看,Grok 4.7 在程式碼評測、專業工作和成本控制方面進步明確,複雜 3D、網頁視覺與物理效果卻並不穩定。
從產品定位看,Grok 4.7 更像是 SpaceXAI 對開發者市場的一次集中加碼。它不是一次讓所有人閉嘴的跨代更新,更像是 xAI 把 Grok 推向前沿模型混戰區的一次補位。
放在「基模決戰周」的大背景下,Grok 4.7 的意義也許不在於它是否已經全面追上最強模型,而在於 xAI 正在用更低價格和更快響應,爭奪開發者願意反覆呼叫的那部分日常任務。
而且 Grok 4.7 顯然只是 xAI 當前路線上的一站。
按照馬斯克公開透露的資訊,Grok 4.8 的參數規模約為 2.5 兆,並採用一套全新的 C++ 訓練棧。模型將在基礎訓練完成後進入強化學習階段,馬斯克稱其會帶來「明顯改進」,定位也是 Grok 4.7 之後更大幅度的一次升級。
更遠的路線圖裡,Grok 4.9 被馬斯克稱為可能達到 OpenAI Astra 和 Anthropic Fable 等級的模型,而終極大招 Grok 5,更是被老馬直接寄託了通往 AGI 的終極希望。
至於模型發佈時間嘛,如果能再準時點就更好了(doge)。
(APPSO)
