梁文鋒要卷死在座的各位。
今天一早,各大AI測試榜單上突然出現一個新名字:DeepSeek-V4-Pro-0813。
沒有發佈會,沒有熱搜,梁文鋒甚至連個正經公告都沒發,打磨了近兩個月的DeepSeeV4Pro正式版就這麼上線了。
這股不管不顧的狂勁兒,直接把馬斯克乾性情了。僅12小時不到,Grok 4.6直接上線,跑分、定價、接入Cursor的消息一股腦全放了出來,連一點緩衝都不帶留的。
等開發者們測試後才反應過來,兩家大模型好像又把行業斬殺線往前提了提。
更巧的是,阿里也趕在同一天,開放了剛發佈10天的2.4兆參數旗艦Qwen3.8的模型權重。
三家頂流廠商擠在同一天亮底牌,說不是故意的,你信嗎?
先說DeepSeek。還是老樣子,一個月黑風高的夜晚,DeepSeek官網API文件悄然換版,模型版本從V4-Pro預覽版切換為“DeepSeek-V4-Pro-0813”。
自從R1模型收穫前所未有的關注度之後,DeepSeek似乎很喜歡只用實力說話。
而後續一張DeepSeek官方群流出的評測對比表,證實了這個說法。
Terminal-Bench 2.1,一項衡量AI智能體在真實終端環境中完成複雜任務能力的測試,V4 Pro正式版拿到87.9分。距離全球第一Anthropic Fable 5的88.0分,差距只剩0.1。
而在其他兩項測試中,DeepSeek V4 Pro則是直接反殺了Fable 5。
分別是網路安全智能體測試CyberGym拿到83.3分,超過Fable 5的83.1分;自動化任務AutomationBench拿到31.8分,壓過Fable 5的29.1分。
就連此前最薄弱的軟體工程智能體DeepSWE,也從預覽版的12.8分暴漲到62.7分,接近原來的4.9倍!
而在帶工具的“人類最後考試”(HLE),DeepSeek也拿到了60.0分,反超Opus 4.8的57.9分。
再看馬斯克這邊,Grok 4.6的進攻同樣猛烈。
綜合智能指數上拿到61分,距離Fable 5的62分只差1分。CursorBench上拿到69.9%,超過GPT-5.6的67.2%。FrontierCode上拿到61.3%,壓過GPT-5.6的60.6%。
到了更接近真實職場交付的知識工作中,Grok 4.6直接翻身反殺,在三項評測中全部拿下第一。專業法律任務Harvey LAB中拿到15.8%,Fable 5隻有11.3%,GPT-5.6更是只有2.5%。
兩家同時把矛頭指向了同一個對手——Anthropic Fable 5。
但他們之間並非互相沒有競爭,畢竟這場對決真正殘酷的地方,不是性能,是價格。
官網最新資料顯示,DeepSeek V4 Pro每百萬輸出Token收費0.87美元,Grok 4.6要6美元。
GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元!
DeepSeek的價格約為Grok 4.6的七分之一、GPT-5.6 Sol的三十五分之一。
而對於一些只考慮用國外大模型的人來說,4.6的出現,也讓Grok重新變得眉清目秀,性價比十足。
過去那種“性能、價格和速度”不能兼顧的三角定律,正在被這兩家公司聯手拆掉。或者用網友很喜歡的一種說法,AI行業又開始縮圈了。
事實上,DeepSeek的發佈外界早有預料,畢竟8月初V4 Flash剛把AI圈大攪一通,很難不讓人對V4 Pro正式版有所預料。
但馬斯克突然的這一手,才是真令人意想不到。
梁文鋒一直在算一筆很細的帳。
從V3開始,DeepSeek的論文便反覆討論MoE、MLA、低精度訓練和推理效率。外界喜歡講它用了多少晶片,DeepSeek更在意的是另一件事,同樣一批晶片,能不能多訓練一些,推理時能不能少花一點。
到了V4 Pro,這種偏執直接寫在價格表上。每百萬輸出Token 0.87美元,約為Grok 4.6的七分之一、Fable 5的五十七分之一。
這已經超出了普通價格戰的範圍。
聊天機器人貴一點,使用者未必有感覺。問十句話,用不了多少Token。
但Agent會自己讀檔案、呼叫工具、改程式碼、跑測試,一項任務來回幾十輪,甚至連續工作幾個小時。呼叫量上去以後,每百萬Token差幾美元,月底就是兩張完全不同的帳單。
價格足夠低,還會出現一個過去很少有人認真討論的變化。
那些價值不高、步驟很多、以前不值得交給AI的雜活,也可以嘗試自動化。整理一批舊檔案,給幾百段程式碼補測試,把散落的資料重新分類。這些任務單次省不了多少錢,數量卻很大。
梁文鋒賭的就是這個市場。
DeepSeek還提供Anthropic和OpenAI格式的介面。官方文件甚至直接教使用者修改環境變數,讓Claude Code呼叫V4 Pro。工具照舊,工作習慣照舊,裡面那顆價格更高的模型可以先換下來試試。
而馬斯克的想法則粗暴得多。
他先造出Colossus,把20萬塊H100接進同一個叢集。此前xAI披露,Colossus I和II到2025年末已有超過100萬塊H100等效算力。
SpaceX收購xAI以後,算力、Grok、X和企業產品又被裝進了一家公司。
Grok 4.6就是這套機器推出的新結果。它強調長周期Agent、軟體工程、知識工作和互動式項目。發佈當天,模型直接進入Cursor和Grok Build。SpaceXAI還把它放進Business與Enterprise方案,連接企業的文件、信箱和辦公軟體。
梁文鋒想把一次呼叫變得足夠便宜。馬斯克想讓一次呼叫持續得足夠久,再讓幾億使用者和企業客戶隨時找到入口。
兩家公司爭的是同一批開發者,0.87美元和6美元也在爭奪同一筆預算。競爭越直接,兩種近乎極端的做法反而越容易把行業推向同一個結果。
智能開始從稀缺走向過剩。
過去,一個人使用一個AI,在聊天框裡問問題。接下來,一個人可能同時開著幾個Agent。有人讓它們改程式碼,有人讓它們查資料,還有人讓它們盯著一項任務不斷重試。模型不需要休息,只要價格和穩定性允許,呼叫便可以一直繼續。
到那時,AI公司賣的依然是Token,使用者購買的卻是一段可以反覆呼叫的工作能力。每百萬Token多少錢會逐漸退到後面,一個任務最終花了多少錢、有沒有按時完成,會成為更直接的標準。
當智能不再稀缺,很多今天算不過帳的事情,才會有人認真考慮交給AI。
但故事到這裡還沒完。
幾乎是在同一時間,阿里巴巴開源了8月3號剛發佈的Qwen3.8-Max。
2.4兆參數的旗艦模型,說免費就免費,企業下載下來就能私有化部署,不用給阿里交一分授權費。
不過,該模型採用稀疏混合專家架構,單次啟動約950億參數,開放權重版的BF16檔案接近4.9TB,普通電腦連存下它都費勁。阿里顯然沒有指望每個人都把模型搬回家。
它面對的是擁有GPU、工程團隊和大量內部資料的企業。以前,這些公司想使用最強一檔模型,往往只能通過外部API。Qwen第一次開放Max級權重以後,它們多了一個選擇。模型可以放在自己的伺服器裡,資料也可以留在自己的環境中。
小團隊繼續呼叫雲端API,大公司自行部署,普通使用者直接使用產品。DeepSeek、SpaceXAI和阿里在十天之內,把三條路全鋪了出來。
這也是矽谷高價模型接下來最難應付的地方。
單項評測領先0.1分,已經很難支撐幾十倍的價差。企業還會繼續比較任務完成率、返工次數和服務穩定性,但它們終於有資格追問一句,同樣一項工作,為什麼非要用最貴的模型。
DeepSeek V4 Pro打腳踝,Grok 4.6打腰部,Qwen3.8-Max打命根,三家在同一夜,用不同的價格點位,從三個方向同時合圍Anthropic和OpenAI等閉源模型的高價堡壘。
AI行業過去一直擔心算力不夠、模型不夠強。現在,另一種問題已經出現。
當最頂級的智能開始降價、延長工作時間,甚至可以被企業搬回自己的伺服器,人類會把這麼多突然多出來的智能用到那裡?
梁文鋒和馬斯克都沒有給出答案。他們只是在同一個夜晚,把這個問題提前擺到了所有人面前。(科技頭版)
