成本拉低100倍,梁文鋒把Claude拉進“斬殺線”

AI速讀
DeepSeek 擬啟動第二輪 500 億元融資,投前估值達 5000 億元。其 V4-Flash 模型以極低成本與高速度衝擊市場,任務成本較 Claude 低 100 倍,性能僅微幅落後。透過 CSA/HCA 架構與 GRPO 強化學習,DeepSeek 重新定義 AI 定價邏輯,促使企業採取「模型路由」策略以優化成本。業界由此誕生「DeepSeek 斬殺線」,預示中端模型將被淘汰,AI 市場將分化為追求極限智能與提供基礎設施的兩極化格局。

據《財經》獨家報導,DeepSeek已重啟第二輪融資,計畫募資500億元,投前估值約5000億元,預計8月下旬完成簽約。



今年6月,DeepSeek才剛剛完成首輪500億元融資,創下國內大模型首輪融資規模紀錄,投後估值超過3500億元。僅時隔兩個月,其投前估值便攀升約43%,兩輪募資完成後累計金額將超千億元。

估值狂飆的底氣,來自DeepSeek正在改寫行業規則的計費規則。

具體的情況是這樣的,權威模型測試媒體Artificial Analysis放出了一組實測資料,他們用多個主流模型跑同一組基準測試,比誰的平均成本更低。

測試結果顯示,DeepSeek V4-Flash 跑完整套基準測試,平均一次任務成本只需要3美分。

乍一看這個資料可能沒什麼,但是如果把其他主流模型拉來作為對比,一切就都變了。在同一份基準下,Anthropic 的旗艦模型 Claude Fable 5平均成本為3.15美元,GPT-5.6 Sol 要1.86美元,DeepSeek 比 Claude 便宜了100倍。

而且這只是金錢成本,DeepSeek V4-Flash 還有一大特點就是快。根據 Artificial Analysis 的實測資料,DeepSeek V4 Flash(Max Effort 模式)的輸出速度約為113tokens/秒,而同等級的 Anthropic 旗艦模型Claude Opus 5約為74tokens/秒,約為1.5倍。

也就是說,當DeepSeek跑完所有基準測試的時候,Claude才剛跑完一半。

代價是什麼呢?

為了得到這種極致的性價比和效率,DeepSeek V4-Flash在智能水平上做了一定的取捨。Artificial Analysis的資料顯示,智能指數方面V4-Flash得分為50分,跟GoogleGemini 3.6 Flash持平,只落後旗艦模型約10分——Claude Opus 5為61分,Fable 5為60分。

便宜100倍,快2倍,性能只低不到20%。尤其是對於那些需要採購模型 API 的企業來說,這筆帳可能得重新算算了。

過去這幾年,大模型行業的定價方式既簡單又粗暴,按跑了多少token算錢。輸入每百萬token多少錢,輸出每百萬token多少錢,廠商怎麼定價,使用者就怎麼交錢。

但這個演算法有個問題,它比的是“原材料價格”,不是“成品價格”。

就像去飯店吃飯,菜單上寫著“大米5塊錢一斤”,但我只在乎“一碗米飯多少錢”。token相當於是大米,任務就是那碗米飯。大米就算再便宜,蒸成米飯的工藝依然會影響米飯的最終價格。

DeepSeek V4-Flash的官方定價是每百萬輸入token 0.14美元,每百萬輸出token 0.28美元,人民幣定價為輸入快取未命中每百萬輸入1元,輸入快取命中每百萬0.02元,輸出每百萬2元。

這個價格本身就已經是行業最低梯隊了。但問題是,token價格低不等於任務成本低,一個模型如果需要生成更多的token才能完成同樣的任務,那便宜的token單價可能換來一張昂貴的帳單。

Artificial Analysis 做的事情,就是把這層“翻譯”給做了。他們比的是“跑完同一套基準測試要花多少錢”。這個口徑叫“每次任務成本”(Cost per Task),它把token用量、推理深度、快取命中率、思考時間這些變數全部揉在一起,直接給出一個終極答案,幹完一件事到底要花多少錢。

但問題來了,DeepSeek憑什麼能這麼便宜?

V4-Flash模型總參數有2840億,但每次推理時實際啟動的只有130億,不到總參數量的5%。

但光靠這些還不夠。V4在注意力機制上做了很大的文章,他們設計了一套叫CSA(壓縮稀疏注意力)和HCA(重度壓縮注意力)交替排列的混合架構。

這兩套機制的核心是不同距離的資訊,用不同的精度來記。

比如最近幾分鐘發生的事,記得非常清楚,每一個細節都能說出來;幾天前發生的事,大概就只能記得發生了什麼,細節被模糊掉了;幾個月前的事,可能只記得一個大概的印象。

CSA和HCA,就是模擬了這個“近清楚、遠模糊”的記憶規律。隨著上下文增長,把重要的資訊留下,不重要的就全都抹去。

在百萬token上下文下,V4 Flash的單token計算量只有V3.2的10%,KV快取更是只需要7%。而且上下文越長,這個優勢越大。

但架構也還只是故事的一半,V4-Flash從預覽版到正式版進行了一次“原地升級”。

這兩個版本的模型一個參數都沒動,唯一的區別在於後訓練。

這背後是DeepSeek一套獨特的兩階段後訓練方法。

第一階段叫“分科培養”。數學、程式碼、Agent、指令跟隨這些領域,各自單獨訓練專家模型。每個專家先用監督微調(SFT)打基礎,再用GRPO強化學習反覆打磨。GRPO是郭達雅在DeepSeek時發表論文DeepSeekMath中首次提出的概念。

傳統PPO演算法需要額外訓練一個價值函數模型,又費視訊記憶體又費算力,而GRPO直接把這一步砍了,改成讓模型對同一問題生成多個答案,用組內的相對排名來代替絕對價值評估,自己跟自己比、自己跟自己學。既省了訓練成本,效果還更好。

第二階段叫“融會貫通”,用On-Policy Distillation(線上策略蒸餾)把多個領域專家的能力合併回同一個模型裡。蒸餾的時候不是簡單地複製輸出,而是讓目標模型在自己的策略分佈下生成資料,再用專家模型的輸出來矯正,確保合併後的模型不會“學了這個忘了那個”。

過去說模型蒸餾,都是先讓高性能的模型生成答案,再讓低性能的模型去學。但是線上策略蒸餾是反過來的,是學生先自己做題,老師在旁邊看著,邊看邊指導。學生根據各個老師的反饋,當場調整自己的思路,繼續往下做。做完一道,再做下一道,邊做邊學。

“線上”指的是學生和老師是同步的,老師即時給學生反饋。“策略”指的是它學的不是具體某道題的答案,而是“遇到問題該怎麼想”這套思考方法。

其結果是,Terminal Bench 2.1從61.8分幹到了82.7分。這個測試測的是模型在真實終端環境中完成複雜命令列任務的能力,分數直接超過了自己的老大哥V4-Pro預覽版的72.1分,逼近Anthropic旗艦Opus 4.8的85.0分。

更誇張的是 DeepSWE,這是一個專門測試GitHub真實Issue解決能力的基準,DeepSeek V4-Flash從7.3分飆到54.4分,漲幅645%。一個Flash等級的輕量模型,在9項Agent基準測試上全面碾壓自家旗艦Pro的預覽版。

100倍的價差很可能會改變企業對模型API的採購邏輯。

過去幾年,企業選模型的過程就像選供應商,比參數、比跑分、比價格,最後選一個“綜合最優”的。這種思路的前提是模型之間的價格差距不大,都在同一個數量級內,當然大家都會選能力最強的。

但在Artificial Analysis提出“每次任務成本”之後,這個前提就塌了。

假設一個企業每天要處理100萬次API呼叫,用Claude,每天的成本是31500美元,用DeepSeek,每天只需要300美元。一年下來,差距是1130萬美元。這已經不是省點錢的問題,這是能不能活下去的問題。

尤其是對於那些日常營運包含電商客服、程式碼審查、資料清洗場景的企業來說,每天100萬次的API呼叫非常常見。

所以企業的核心命題就不再是“用那家模型”了,現在變成了“怎麼把任務分到最合適的模型上”。這個思路在行業裡有個名字,叫模型路由(Model Routing)。

模型路由的邏輯很簡單,把高價值、高失敗成本的複雜任務放到Claude Opus 5或 GPT-5.6這樣高上限的模型裡,比如自動程式設計中架構設計、金融報告的關鍵分析、法律文書的條款審查等等,企業給模型的智能等級和成功率付費。

不過這些任務數量其實並不多,主要是任務失敗會導致企業付出巨大的代價,用貴模型是完全合理的投資。

像是批次分類、程式碼初篩、資料清洗、低風險Agent任務之類的“苦力活”,往往佔據了企業營運的80%,因此把這些全都交給DeepSeek,省下來的每一分錢都是純利潤。

根據Menlo Ventures的企業AI調研,37%的企業已經在生產環境中使用5個以上的模型。學術方面也有相同的推論,LMSYS團隊(UC Berkeley、Anyscale)在 ICLR 2025上發表的RouteLLM研究發現,在MT Bench基準上,智能路由可以在保持GPT-4 95%質量的前提下削減85%的成本。

在已經公開的行業實踐中,不同任務分佈和路由策略下,降本幅度通常在40%到85%之間。

路由做得好不好,直接決定了企業的AI成本。一個路由策略粗糙的企業,可能80%的任務都打到了旗艦模型上;而一個路由做得精細的企業,可能只有20%的任務需要旗艦模型,其餘80%都分流到了高性價比模型。

兩家企業做同樣的事情,AI成本可能差出5到10倍。

最原始的路由,是“靜態規則”。舉個例子,客服部門的,就用便宜模型;演算法部門的,就用貴模型。或者關鍵詞匹配,提到“程式碼”就用中低檔模型,提到“分析”就用旗艦模型。

這種辦法簡單粗暴,但不准。很多時候會錯配,簡單任務給了貴模型;複雜任務給了便宜模型,做不好還要重來,反而更貴。

高級一點的,是用分類器。先訓練一個小模型,專門用來判斷“這個請求應該用那個模型”。請求進來,先過分類器,分類器說簡單,就給便宜模型;分類器說難,就給貴模型。

這種辦法比靜態規則准,但還是有問題。分類器本身也會犯錯,而且它只能根據請求的字面意思判斷,不知道模型實際做出來效果怎麼樣。

再高級一點的,叫做“先試後升”。不管什麼請求,先讓最便宜的模型試試。如果結果質量夠好,就直接用;如果質量不夠,再自動升級到更貴的模型重做。

比如一個任務,直接用Claude要3美元。用DeepSeek先試,3美分,成功了就賺了;失敗了,再用Claude,總共 3.03美元,也只比直接用Claude多花了1%。

只要成功率不是0,這個買賣就划算。

所以閉源廠商的日子,以後會越來越不好過。它們必須不斷往上走,去做那些更難、更複雜、價值更高的任務,把自己的護城河挖得更深。因為下面的市場,已經被DeepSeek佔滿了。

最難受的是中間那檔模型,比DeepSeek強,但又沒強到那裡去,價格還貴了幾十倍的。

往上,打不過旗艦模型的能力;往下,打不過DeepSeek的價格。

這就引起了一個新的現象,DeepSeek斬殺線。

Artificial Analysis做了一張圖,把所有主流模型都放在一個坐標系裡。橫軸是每次任務的成本,對數坐標;縱軸是智能指數得分。

圖片中的虛線,代表了DeepSeek V4-Flash正式版的性價比斬殺線,任何處於虛線中的模型,都無法在DeepSeek可以實現的任務中,價格低於DeepSeek。

此前,行業常會用GPT-4o、Claude Sonnet、Gemini Pro這些模型來作為參考,它們的性價比就成為了行業基準。比它們貴的,就得證明自己更強;比它們弱的,就得證明自己更便宜。

不過圖片中可以看到,這些作為行業基準的模型,它們的斬殺線是很低的,稍微推理強度高一點的模型,都可以輕鬆逃過被斬殺的命運,DeepSeek V4-Flash正式版的出現,讓整個斬殺線抬高到了一個非常高的地方,全球將近70%的模型都處於被斬殺區域。

圖片另一邊的橙黃色區域,是Artificial Analysis基於V4-Flash預覽版和正式版之間的區別,對旗艦模型V4-Pro的正式版性能和價格的預測。

V4-Pro現在的定價,輸入快取命中是每百萬token1 元人民幣,快取未命中是12元,輸出是24元。限時優惠期間更便宜,輸入只要2.5元,輸出12元。

雖然價格比Flash貴了不少,但是性能也提升了很大。

這也就意味著,包括低推理強度的Fable 5和GPT-5.6在內,全球90%的模型,在完成任務的性價比這方面,都被DeepSeek斬殺了,更有甚者,無論是把推理強度調高也好調低也好,依然也逃不過被DeepSeek滿血斬殺的命運。

而DeepSeek手裡還有另一張牌,Harness。

8月初,DeepSeek Harness負責人崔添翼在X發文稱“如果你是Agent Harness相關開放原始碼專案的開發者,希望參加 DeepSeek Harness的內測,可以回覆或私信聯絡我。請附上GitHub id以及開源代表作。”

雖然有保密協議以防止參與測試者洩露DeepSeek Harness的功能、參數相關資訊,但已有部分參與測試者發文稱,“效果炸裂”。

Harness是DeepSeek自研的Agent執行階段框架,類似於OpenAI的Codex和Anthropic的Claude Code,但深度繫結了 V4系列的模型能力。

它的作用是讓模型在執行Agent任務時少走彎路、少浪費token。

一個Agent任務的完成質量,不只取決於模型本身的能力,還取決於框架怎麼組織上下文、怎麼處理工具呼叫的錯誤返回、什麼時候該重新規劃、長會話怎麼壓縮、什麼條件算任務完成。Harness所負責的,正是這些事情。

在V4-Flash正式版的基準測試中,DeepSeek已經用自家Harness的minimal模式跑了Code Agent任務,max檔位,top_p 0.95,溫度1.0。前文所提到的V4-Flash正式版分數,很多都是DeepSeek Harness跑出來的。

但minimal模式只是Harness能力的冰山一角。Harness正式發佈並開放完整功能後,同樣的模型在同樣的任務上,可能會表現出更高的成功率和更少的token浪費。

換句話說,同樣的智能水平,實際成本再降一截。

DeepSeek已經明確表示,Harness會和V4-Pro正式版同步上線。兩層疊加,V4-Pro正式版更強的性能,加上Harness更高效的執行框架,就會有更多的模型面臨斬殺。

因此,Artificial Analysis現在給出的斬殺線可能偏低了。

市場的終局正在收斂成一根“啞鈴”。

一端是少數幾個能力最強的旗艦模型,賣的是極限智能;另一端是DeepSeek,把自己當AI基礎設施來賣。

中間那些既不夠強又不夠便宜的產品,最終會成為這場價格戰中最先被淘汰的犧牲品。(字母榜)