馬斯克慌了,梁文鋒突然發佈新模型,不給人留活路

AI速讀
AI 領域近期迎來三波強勢攻勢:DeepSeek 悄然上線 V4 Pro,其性能逼近全球第一且定價僅為對手的極小部分,試圖透過極低成本推動 AI 任務自動化;馬斯克的 xAI 推出 Grok 4.6,強調長週期 Agent 與企業級集成,利用 Colossus 超大規模算力集群搶佔開發者市場;阿里巴巴則開源 2.4 萬億參數的 Qwen3.8-Max,主攻企業私有化部署。三者從價格、功能與部署方式三路合圍,共同挑戰 OpenAI 等高價閉源模型的市場地位,標誌著 AI 智能正進入供給過剩的新階段。
梁文鋒要卷死在座的各位。


今天一早,各大AI測試榜單上突然出現一個新名字:DeepSeek-V4-Pro-0813

沒有發佈會,沒有熱搜,梁文鋒甚至連個正經公告都沒發,打磨了近兩個月的DeepSeeV4Pro正式版就這麼上線了。

這股不管不顧的狂勁兒,直接把馬斯克乾性情了。僅12小時不到,Grok 4.6直接上線,跑分、定價、接入Cursor的消息一股腦全放了出來,連一點緩衝都不帶留的。

等開發者們測試後才反應過來,兩家大模型好像又把行業斬殺線往前提了提。

更巧的是,阿里也趕在同一天,開放了剛發佈10天的2.4兆參數旗艦Qwen3.8的模型權重。

三家頂流廠商擠在同一天亮底牌,說不是故意的,你信嗎?

猛攻世界第一,差距縮小到0.1分

先說DeepSeek。還是老樣子,一個月黑風高的夜晚,DeepSeek官網API文件悄然換版,模型版本從V4-Pro預覽版切換為“DeepSeek-V4-Pro-0813”。

自從R1模型收穫前所未有的關注度之後,DeepSeek似乎很喜歡只用實力說話。

而後續一張DeepSeek官方群流出的評測對比表,證實了這個說法。

圖源:DeepSeek

Terminal-Bench 2.1,一項衡量AI智能體在真實終端環境中完成複雜任務能力的測試,V4 Pro正式版拿到87.9分。距離全球第一Anthropic Fable 5的88.0分,差距只剩0.1

而在其他兩項測試中,DeepSeek V4 Pro則是直接反殺了Fable 5。

分別是網路安全智能體測試CyberGym拿到83.3分,超過Fable 5的83.1分;自動化任務AutomationBench拿到31.8分,壓過Fable 5的29.1分。

就連此前最薄弱的軟體工程智能體DeepSWE,也從預覽版的12.8分暴漲到62.7分,接近原來的4.9倍!

而在帶工具的“人類最後考試”(HLE),DeepSeek也拿到了60.0分,反超Opus 4.8的57.9分。

再看馬斯克這邊,Grok 4.6的進攻同樣猛烈。

圖源:SpacexAI

綜合智能指數上拿到61分,距離Fable 5的62分只差1分。CursorBench上拿到69.9%,超過GPT-5.6的67.2%。FrontierCode上拿到61.3%,壓過GPT-5.6的60.6%。

到了更接近真實職場交付的知識工作中,Grok 4.6直接翻身反殺,在三項評測中全部拿下第一。專業法律任務Harvey LAB中拿到15.8%,Fable 5隻有11.3%,GPT-5.6更是只有2.5%。

兩家同時把矛頭指向了同一個對手——Anthropic Fable 5。

但他們之間並非互相沒有競爭,畢竟這場對決真正殘酷的地方,不是性能,是價格。

官網最新資料顯示,DeepSeek V4 Pro每百萬輸出Token收費0.87美元,Grok 4.6要6美元。

圖源:DeepSeek API 官方文件

GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元!

DeepSeek的價格約為Grok 4.6的七分之一GPT-5.6 Sol的三十五分之一

而對於一些只考慮用國外大模型的人來說,4.6的出現,也讓Grok重新變得眉清目秀,性價比十足。

過去那種“性能、價格和速度”不能兼顧的三角定律,正在被這兩家公司聯手拆掉。或者用網友很喜歡的一種說法,AI行業又開始縮圈了。

兩個瘋子,正在把智能推向過剩

事實上,DeepSeek的發佈外界早有預料,畢竟8月初V4 Flash剛把AI圈大攪一通,很難不讓人對V4 Pro正式版有所預料。

但馬斯克突然的這一手,才是真令人意想不到。

梁文鋒一直在算一筆很細的帳。

從V3開始,DeepSeek的論文便反覆討論MoE、MLA、低精度訓練和推理效率。外界喜歡講它用了多少晶片,DeepSeek更在意的是另一件事,同樣一批晶片,能不能多訓練一些,推理時能不能少花一點。

到了V4 Pro,這種偏執直接寫在價格表上。每百萬輸出Token 0.87美元,約為Grok 4.6的七分之一、Fable 5的五十七分之一。

這已經超出了普通價格戰的範圍。

聊天機器人貴一點,使用者未必有感覺。問十句話,用不了多少Token。

但Agent會自己讀檔案、呼叫工具、改程式碼、跑測試,一項任務來回幾十輪,甚至連續工作幾個小時。呼叫量上去以後,每百萬Token差幾美元,月底就是兩張完全不同的帳單。

圖源:小紅書

價格足夠低,還會出現一個過去很少有人認真討論的變化。

那些價值不高、步驟很多、以前不值得交給AI的雜活,也可以嘗試自動化。整理一批舊檔案,給幾百段程式碼補測試,把散落的資料重新分類。這些任務單次省不了多少錢,數量卻很大。

梁文鋒賭的就是這個市場。

DeepSeek還提供Anthropic和OpenAI格式的介面。官方文件甚至直接教使用者修改環境變數,讓Claude Code呼叫V4 Pro。工具照舊,工作習慣照舊,裡面那顆價格更高的模型可以先換下來試試。

而馬斯克的想法則粗暴得多。

圖源:X

他先造出Colossus,把20萬塊H100接進同一個叢集。此前xAI披露,Colossus I和II到2025年末已有超過100萬塊H100等效算力。

SpaceX收購xAI以後,算力、Grok、X和企業產品又被裝進了一家公司。

Grok 4.6就是這套機器推出的新結果。它強調長周期Agent軟體工程知識工作互動式項目。發佈當天,模型直接進入Cursor和Grok Build。SpaceXAI還把它放進Business與Enterprise方案,連接企業的文件、信箱和辦公軟體。

梁文鋒想把一次呼叫變得足夠便宜。馬斯克想讓一次呼叫持續得足夠久,再讓幾億使用者和企業客戶隨時找到入口。

兩家公司爭的是同一批開發者,0.87美元和6美元也在爭奪同一筆預算。競爭越直接,兩種近乎極端的做法反而越容易把行業推向同一個結果。

智能開始從稀缺走向過剩。

過去,一個人使用一個AI,在聊天框裡問問題。接下來,一個人可能同時開著幾個Agent。有人讓它們改程式碼,有人讓它們查資料,還有人讓它們盯著一項任務不斷重試。模型不需要休息,只要價格和穩定性允許,呼叫便可以一直繼續。

到那時,AI公司賣的依然是Token,使用者購買的卻是一段可以反覆呼叫的工作能力。每百萬Token多少錢會逐漸退到後面,一個任務最終花了多少錢、有沒有按時完成,會成為更直接的標準。

當智能不再稀缺,很多今天算不過帳的事情,才會有人認真考慮交給AI。

阿里也幹了

但故事到這裡還沒完。

幾乎是在同一時間,阿里巴巴開源了8月3號剛發佈的Qwen3.8-Max。

2.4兆參數的旗艦模型,說免費就免費,企業下載下來就能私有化部署,不用給阿里交一分授權費。

不過,該模型採用稀疏混合專家架構,單次啟動約950億參數,開放權重版的BF16檔案接近4.9TB,普通電腦連存下它都費勁。阿里顯然沒有指望每個人都把模型搬回家。

它面對的是擁有GPU、工程團隊和大量內部資料的企業。以前,這些公司想使用最強一檔模型,往往只能通過外部API。Qwen第一次開放Max級權重以後,它們多了一個選擇。模型可以放在自己的伺服器裡,資料也可以留在自己的環境中。

小團隊繼續呼叫雲端API,大公司自行部署,普通使用者直接使用產品。DeepSeek、SpaceXAI和阿里在十天之內,把三條路全鋪了出來。

這也是矽谷高價模型接下來最難應付的地方。

單項評測領先0.1分,已經很難支撐幾十倍的價差。企業還會繼續比較任務完成率、返工次數和服務穩定性,但它們終於有資格追問一句,同樣一項工作,為什麼非要用最貴的模型。

DeepSeek V4 Pro打腳踝,Grok 4.6打腰部,Qwen3.8-Max打命根,三家在同一夜,用不同的價格點位,從三個方向同時合圍Anthropic和OpenAI等閉源模型的高價堡壘。

AI行業過去一直擔心算力不夠、模型不夠強。現在,另一種問題已經出現。

當最頂級的智能開始降價、延長工作時間,甚至可以被企業搬回自己的伺服器,人類會把這麼多突然多出來的智能用到那裡?

梁文鋒和馬斯克都沒有給出答案。他們只是在同一個夜晚,把這個問題提前擺到了所有人面前。(科技頭版)