天,這一架太魔幻了!
一邊是梁文鋒,終於在凌晨放出了DeepSeek V4 Pro正式版。
另一邊,馬斯克砸下了下一代旗艦Grok 4.6,主打一個成本低,性能強。
兩大巨頭,同一時間發佈,火藥味兒瞬間拉滿。
他們盯上的,幾乎是同一件事——
讓模型能在長任務裡持續呼叫工具、修改程式碼、驗證結果,最後交付一個真正能用的成品。
01. DeepSeek V4 Pro來了馬斯克Grok 4.6出戰
DeepSeek V4 Pro正式版最亮眼的成績,是在兩項評測中拿下絕對第一,直接反殺Fable 5。
網路安全智能體測試CyberGym拿到83.3分,超過Fable 5的83.1分、Opus 4.8的78.3分。自動化任務AutomationBench拿到31.8分,把Fable 5的29.1分和Opus 4.8的27.2分一起壓了下去。最「貼臉」的一次,則發生在Terminal-Bench 2.1。
DeepSeek拿到87.9分,超過Opus 4.8的85.0分,距離Fable 5的88.0分,只差0.1。
其他幾項高難度Agent測試中,DeepSeek則實現了對Opus 4.8的絕對跨越。
帶工具的「人類最後考試」中拿到60.0分,反超Opus 4.8的57.9分,繼續逼近Fable 5的63.0分。
就連此前最薄弱的軟體工程智能體,DeepSWE也從預覽版的12.8分暴漲到62.7分,接近原來的4.9倍。
這個成績不僅超過Opus 4.8的58.0分,距離Fable 5的70.0分也只剩7.3分。
同一時間,馬斯克也把Fable 5和GPT-5.6 Sol架在了火上烤。
Grok 4.6先是在綜合能力上追平GPT-5.6,再在編碼測試中連續完成反超。
綜合智能指數上拿到61分,距離Fable 5的62分只差1分。CursorBench上拿到69.9%,超過GPT-5.6的67.2%,距離Fable 5的70.5%只有0.6個百分點。FrontierCode上拿到61.3%,也壓過GPT-5.6的60.6%,繼續緊追Fable 5的63.6%。到了更接近真實職場交付的知識工作中,Grok 4.6直接翻身反殺,在三項評測中全部拿下第一。
GDPval-AA v2中拿到1753 Elo,超過Fable 5的1741,也超過GPT-5.6的1728。AA-Briefcase上再拿1577 Elo,壓過Fable 5的1574和GPT-5.6的1502。專業法律任務Harvey LAB中拿到15.8%,Fable 5隻有11.3%,GPT-5.6更是只有2.5%。
更狠的是,DeepSeek V4 Pro和Grok 4.6不僅在性能上直逼OpenAI和Anthropic的頂尖模型,還一起把前沿智能的價格打了下來。
每百萬輸出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。
而DeepSeek只要0.87美元——
約為Grok 4.6的1/7、GPT-5.6 Sol的1/35、Claude Opus 5的1/29、Fable 5的1/57!
02. 全網首測DeepSeek大戰Grok
現在,第一批實測已經出爐。DeepSeek V4 Pro和Grok 4.6,也終於從跑分榜走進真實任務場。
第一輪,我們直接給DeepSeek上強度。
只用一條提示詞,它便在瀏覽器中從零搭出了一顆完整的3D互動式地球。
拖動、旋轉、縮放等基礎互動全部可用;全球資料流、動態航線和地理標記,也被完整鋪在地球表面。
再往細節看,大氣層散射、雲層渲染、晝夜光影乃至整套UI介面,同樣一應俱全。
接下來,直接把兩款模型拉進同一個擂台。
AI博主「向陽喬木」先用DeepSeek V4 Pro連跑三個小任務,隨後又把其中兩道題的相同提示詞交給Grok 4.6,直接對比最終成品。
第一個任務,是呼叫3個Skill開發並部署一個網站。
DeepSeek順利跑通了整套流程,從頁面設計和完成度來看,整體表現非常穩定。
第二個任務,是一次復刻60種設計風格,並生成一整套Bento卡片集中展示。
這一輪,DeepSeek在字型、配色和版式上做出了明顯區分,整體視覺效果相當不錯。
最後一個任務,則是從零生成一款3D打磚塊遊戲。
遊戲不僅可以直接上手,還加入了立體場景、背景音樂和動態音效,操作反饋和可玩性全部線上。
隨後,相同的提示詞被交給了Grok 4.6。
在3D打磚塊這一局中,兩款模型幾乎打成平手。
Grok生成的遊戲同樣質感線上,無論視覺效果、場景完整度還是可玩性,都與DeepSeek V4 Pro不相上下。
到了60種Bento設計這一局,Grok 4.6則扳回一分。
它生成的部分頁面,在排版、配色和視覺層次上更為成熟,最終效果也更加好看。
更激烈的對決,發生在Flappy Bird上。
開發者Jun Song給出完全相同的提示詞,讓DeepSeek V4 Pro和Grok 4.6分別從零「手搓」一款遊戲。
結果,兩款模型走出了截然不同的路線。
DeepSeek V4 Pro消耗超過2萬Token,成本僅為0.019美元;Grok 4.6隻使用約5000 Token,成本卻達到0.03美元。
但從最終成品來看,這一局DeepSeek明顯更勝一籌。
遊戲中不僅有山脈遠景和層疊雲朵,水管也帶有漸變與體積感。角色穿過水管時,畫面甚至會彈出「+1」的浮動動畫。
從場景層次到操作反饋,細節幾乎全部拉滿,端到端建構的完成度明顯高於Grok 4.6。
在開發者Hamza進行的另一項前端測試中,DeepSeek V4 Pro再次拿下Grok 4.6。
無論頁面完成度還是最終視覺效果,V4 Pro交出的成品都更勝一籌。
不過,V4 Pro也沒有場場封神。
在一組鵜鶘對比測試中,相較於Flash版本,V4 Pro的整體畫面完成度更高,大象的造型也更加美觀。
唯一的問題是——鵜鶘的運動方向,被完全畫反了。
繼續增加難度,讓DeepSeek V4 Pro、GPT-5.6 Sol和Claude Opus 5使用Three.js生成同一棵櫻花樹,差距就更加明顯。
無論是樹幹與枝葉的細節,還是光影、景深和整體氛圍,V4 Pro都不如另外兩款頂尖模型。
幾輪實測看下來,DeepSeek V4 Pro和Grok 4.6確實已經打到了同一水平線,難分伯仲。
03. 兩大AI同一天 追上了OpenAI和Anthropic
對於這兩款模型的同時爆發,大佬Rick De Oliveira給出的評價是,「強大,而且實惠。」
這DeepSeek V4 Pro和Grok 4.6的加持下,這兩個幾乎不可能同時出現的詞,在今天,第一次真正走到了一起。
從網路安全、知識型任務到Agent自主解決問題,它們已經在多個戰場上,憑藉著更低的成本直接擊碎了前沿能力的天花板。
回看今天這場魔幻的AI「對轟」,DeepSeek與Grok共同改寫了一條遊戲規則:
頂尖智能,不再高不可攀。
過去,開發者往往只能在「用不起」和「不夠強」之間艱難選擇。
而今天,DeepSeek用僅為SOTA幾十分之一的價格掀翻桌子,Grok則以極高的性價比緊隨其後。
這場「高能低價」的正面衝擊,已經撕開了舊秩序的裂口。
而戰爭還沒有結束。
馬斯克已經提前預告,Grok 4.7馬上就來,目標直指超越所有頂尖AI;OpenAI與Anthropic的反擊,也必將接踵而至。
身處這個以「小時」為單位進化的時代,智能不再是少數巨頭的特權,屬於所有人的應用大爆發,才剛剛開始。 (新智元)
