梁文鋒突襲馬斯克!DeepSeek V4 Pro對戰Grok 4.6,首測夯爆了

AI速讀
DeepSeek V4 Pro 與 Grok 4.6 同時發布,引發 AI 圈劇烈碰撞。數據顯示,DeepSeek V4 Pro 在多項 Agent 測試中領先或逼近頂尖模型,且輸出成本僅為對手的 1/30 至 1/50;Grok 4.6 則在法律任務與知識工作中表現強勁。實測證明兩者在前端開發與 3D 生成上均達高水準。此次更新核心在於「高能低價」,打破了頂尖智能的成本壁壘,將 AI 競爭推向新階段。

天,這一架太魔幻了!

一邊是梁文鋒,終於在凌晨放出了DeepSeek V4 Pro正式版

另一邊,馬斯克砸下了下一代旗艦Grok 4.6,主打一個成本低,性能強。

兩大巨頭,同一時間發佈,火藥味兒瞬間拉滿。

undefined

他們盯上的,幾乎是同一件事——

讓模型能在長任務裡持續呼叫工具、修改程式碼、驗證結果,最後交付一個真正能用的成品。

01. DeepSeek V4 Pro來了馬斯克Grok 4.6出戰

DeepSeek V4 Pro正式版最亮眼的成績,是在兩項評測中拿下絕對第一,直接反殺Fable 5。

網路安全智能體測試CyberGym拿到83.3分,超過Fable 5的83.1分、Opus 4.8的78.3分。自動化任務AutomationBench拿到31.8分,把Fable 5的29.1分和Opus 4.8的27.2分一起壓了下去。最「貼臉」的一次,則發生在Terminal-Bench 2.1

DeepSeek拿到87.9分,超過Opus 4.8的85.0分,距離Fable 5的88.0分,只差0.1。

其他幾項高難度Agent測試中,DeepSeek則實現了對Opus 4.8的絕對跨越。

帶工具的「人類最後考試」中拿到60.0分,反超Opus 4.8的57.9分,繼續逼近Fable 5的63.0分。

就連此前最薄弱的軟體工程智能體,DeepSWE也從預覽版的12.8分暴漲到62.7分,接近原來的4.9倍。

這個成績不僅超過Opus 4.8的58.0分,距離Fable 5的70.0分也只剩7.3分。

同一時間,馬斯克也把Fable 5和GPT-5.6 Sol架在了火上烤。

Grok 4.6先是在綜合能力上追平GPT-5.6,再在編碼測試中連續完成反超。

綜合智能指數上拿到61分,距離Fable 5的62分只差1分。CursorBench上拿到69.9%,超過GPT-5.6的67.2%,距離Fable 5的70.5%只有0.6個百分點。FrontierCode上拿到61.3%,也壓過GPT-5.6的60.6%,繼續緊追Fable 5的63.6%。到了更接近真實職場交付的知識工作中,Grok 4.6直接翻身反殺,在三項評測中全部拿下第一。

GDPval-AA v2中拿到1753 Elo,超過Fable 5的1741,也超過GPT-5.6的1728。AA-Briefcase上再拿1577 Elo,壓過Fable 5的1574和GPT-5.6的1502。專業法律任務Harvey LAB中拿到15.8%,Fable 5隻有11.3%,GPT-5.6更是只有2.5%。

更狠的是,DeepSeek V4 Pro和Grok 4.6不僅在性能上直逼OpenAI和Anthropic的頂尖模型,還一起把前沿智能的價格打了下來。

每百萬輸出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。

而DeepSeek只要0.87美元——

約為Grok 4.6的1/7、GPT-5.6 Sol的1/35、Claude Opus 5的1/29、Fable 5的1/57!

02. 全網首測DeepSeek大戰Grok

現在,第一批實測已經出爐。DeepSeek V4 Pro和Grok 4.6,也終於從跑分榜走進真實任務場。

第一輪,我們直接給DeepSeek上強度。

只用一條提示詞,它便在瀏覽器中從零搭出了一顆完整的3D互動式地球。

拖動、旋轉、縮放等基礎互動全部可用;全球資料流、動態航線和地理標記,也被完整鋪在地球表面。

再往細節看,大氣層散射、雲層渲染、晝夜光影乃至整套UI介面,同樣一應俱全。

接下來,直接把兩款模型拉進同一個擂台。

AI博主「向陽喬木」先用DeepSeek V4 Pro連跑三個小任務,隨後又把其中兩道題的相同提示詞交給Grok 4.6,直接對比最終成品。

第一個任務,是呼叫3個Skill開發並部署一個網站。

DeepSeek順利跑通了整套流程,從頁面設計和完成度來看,整體表現非常穩定。

第二個任務,是一次復刻60種設計風格,並生成一整套Bento卡片集中展示。

這一輪,DeepSeek在字型、配色和版式上做出了明顯區分,整體視覺效果相當不錯。

最後一個任務,則是從零生成一款3D打磚塊遊戲。

遊戲不僅可以直接上手,還加入了立體場景、背景音樂和動態音效,操作反饋和可玩性全部線上。

隨後,相同的提示詞被交給了Grok 4.6。

在3D打磚塊這一局中,兩款模型幾乎打成平手。

Grok生成的遊戲同樣質感線上,無論視覺效果、場景完整度還是可玩性,都與DeepSeek V4 Pro不相上下。

到了60種Bento設計這一局,Grok 4.6則扳回一分。

它生成的部分頁面,在排版、配色和視覺層次上更為成熟,最終效果也更加好看。

更激烈的對決,發生在Flappy Bird上。

開發者Jun Song給出完全相同的提示詞,讓DeepSeek V4 Pro和Grok 4.6分別從零「手搓」一款遊戲。

結果,兩款模型走出了截然不同的路線。

DeepSeek V4 Pro消耗超過2萬Token,成本僅為0.019美元;Grok 4.6隻使用約5000 Token,成本卻達到0.03美元。

但從最終成品來看,這一局DeepSeek明顯更勝一籌。

遊戲中不僅有山脈遠景和層疊雲朵,水管也帶有漸變與體積感。角色穿過水管時,畫面甚至會彈出「+1」的浮動動畫。

從場景層次到操作反饋,細節幾乎全部拉滿,端到端建構的完成度明顯高於Grok 4.6。

在開發者Hamza進行的另一項前端測試中,DeepSeek V4 Pro再次拿下Grok 4.6。

無論頁面完成度還是最終視覺效果,V4 Pro交出的成品都更勝一籌。

不過,V4 Pro也沒有場場封神。

在一組鵜鶘對比測試中,相較於Flash版本,V4 Pro的整體畫面完成度更高,大象的造型也更加美觀。

唯一的問題是——鵜鶘的運動方向,被完全畫反了。

繼續增加難度,讓DeepSeek V4 Pro、GPT-5.6 Sol和Claude Opus 5使用Three.js生成同一棵櫻花樹,差距就更加明顯。

無論是樹幹與枝葉的細節,還是光影、景深和整體氛圍,V4 Pro都不如另外兩款頂尖模型。

DeepSeek V4 Pro;GPT-5.6 Sol;Claude Opus 5

幾輪實測看下來,DeepSeek V4 Pro和Grok 4.6確實已經打到了同一水平線,難分伯仲。

03. 兩大AI同一天 追上了OpenAI和Anthropic

對於這兩款模型的同時爆發,大佬Rick De Oliveira給出的評價是,「強大,而且實惠。」

這DeepSeek V4 Pro和Grok 4.6的加持下,這兩個幾乎不可能同時出現的詞,在今天,第一次真正走到了一起。

從網路安全、知識型任務到Agent自主解決問題,它們已經在多個戰場上,憑藉著更低的成本直接擊碎了前沿能力的天花板。

回看今天這場魔幻的AI「對轟」,DeepSeek與Grok共同改寫了一條遊戲規則:

頂尖智能,不再高不可攀。

過去,開發者往往只能在「用不起」和「不夠強」之間艱難選擇。

而今天,DeepSeek用僅為SOTA幾十分之一的價格掀翻桌子,Grok則以極高的性價比緊隨其後。

這場「高能低價」的正面衝擊,已經撕開了舊秩序的裂口。

而戰爭還沒有結束。

馬斯克已經提前預告,Grok 4.7馬上就來,目標直指超越所有頂尖AI;OpenAI與Anthropic的反擊,也必將接踵而至。


身處這個以「小時」為單位進化的時代,智能不再是少數巨頭的特權,屬於所有人的應用大爆發,才剛剛開始。 (新智元)