DeepSeek V4 Pro為何沒能贏得滿堂彩?大招或在模型之外

AI速讀
DeepSeek 近期推出 V4 Pro 模型與開源 Agent 框架 Harness。儘管 V4 Pro 性能強勁且價格具競爭力,但因 V4 Flash 已滿足多數開發者需求,且實測中發現 Token 低價不等於任務低成本,導致市場評價兩極。文章強調,AI 產業正經歷範式轉移:從追求「最聰明的大腦」轉向追求「能把工作做完的系統」。DeepSeek Harness 的推出,象徵其戰略重心已延伸至模型之外的運行環境,試圖透過開放插件化框架,定義 AI Agent 的工作方式,將競爭維度從單純的模型參數提升至整套執行生態。

8月12日深夜,DeepSeek V4 Pro正式版悄然上線了。然而不到24小時,官網首頁的發佈通知和開放平台公告就被撤了下來,頁面額外標註“V4 Pro暫未更動”。開發者社區一片嘩然:是臨時工發錯了版本,還是模型表現未達預期被緊急回滾?直到13日晚間,DeepSeek 重新發佈公告確認上線,這場回滾烏龍才算告一段落。

此前預告的 API 漲價也同步落地。8月17日起,V4 Pro將採用峰谷定價:高峰時段輸出價格漲至每百萬Tokens 27元,較此前的6元上漲4.5倍;快取命中輸入價格更是從0.025元暴漲至0.30元,漲幅達12倍。即便大幅提價,V4 Pro的高峰定價也僅約4美元,價格依然有競爭力,但“極致性價比”的敘事已悄然鬆動。

就在這樣一片爭議聲中,DeepSeek 在8月13日一口氣端上了兩樣新東西。其一是升級後的 DeepSeek V4 Pro 0813,按照官方資料,這款面向複雜推理和Agent任務的模型,在測試中繼續刷新了成績。另一個則低調得多,此前外界鮮少討論,名字卻相當直白:DeepSeek Harness。

本該又是一場大模型發佈秀:參數更強、基準更高、價格依舊能打。可有趣的是,從開發者社區的首波反饋來看,V4 Pro並未等來預想中的滿堂喝彩。

開發者靈魂拷問:Flash已經夠好了,我為什麼還要升級?

在Hacker News等開發者論壇上,人們發出靈魂拷問:Pro到底比Flash強在那裡?為何要用Pro?

一名使用者坦言自己對這次V4 Pro的發佈感到“失望”,不是因為模型弱,而是因為此前的V4 Flash已經超出了他的預期。他平時主要用AI做架構討論、思路碰撞和程式碼原型開發,而Flash已經能滿足絕大部分需求,即使Pro顯然更強,他暫時也找不到足夠理由進行遷移。另一名使用者注意到,在Artificial Analysis評分中,Flash和Pro的綜合分數一度只差1分,於是直接發問:“為什麼我要用Pro,不用Flash?差距到底在那裡?”更有人直言“我怎麼感覺Pro的效果反而不如Flash?只是我的錯覺嗎?”

當然,V4 Pro不是沒有進步。從官方資料看,0813版本在Agent相關測試上的進步相當明顯,在工具呼叫、終端操作和複雜程式設計 Agent任務上確有專攻,多個Agent基準成績明顯走高,比如在Terminal Bench 2.1 中拿到 87.9分,在Toolathlon-Verified拿到74.1分。但普通使用者並不會因為排行榜上多了幾個百分點就自動切換模型,他們真正關心的始終是:手上的工作能否完成?如果Flash做到了,而且價格更低,那麼Pro的“更強”究竟能帶來多少實際價值?一名使用者的總結相當現實:“99%的情況下,你並不需要最好的模型。”

這句話恰好點出了大模型競爭裡正在發生的變化。過去,AI公司比拚的是“誰最聰明”;但隨著越來越多模型進入相近能力區間,使用者開始轉向另一套標準:誰夠用?誰最便宜?誰最穩定?DeepSeek過去最大的成功,正是把“足夠強”與“極低價格”結合在了一起。如今,Flash已經足夠強,旗艦版Pro反而必須證明,使用者為何願意為那一部分額外能力付費。這就是V4 Pro發佈之後最微妙的處境:自己把自己“斬殺”了。

更尖銳的爭論則圍繞Benchmark與實測效果之間的落差而展開。一名開發者分享了自己的實測:讓AI掃描一個已有程式碼庫,生成一套可直接運行的docker-compose部署方案,涉及反向代理、連接埠佔用、萬用字元證書和PostgreSQL等多個具體條件。結果他感覺V4 Pro表現不如預期,出現了幾個問題,而另一款更昂貴的模型沒有犯同樣的錯誤。他說“基準測試告訴我的,和我實際觀察到的,並不一樣。”在他的體驗中,DeepSeek在簡單項目上的表現不錯,但項目複雜後,可靠性仍然存疑。

一組開發者實測更直觀地展現了模型能力與實際成本之間的關係。一名使用者用Codex CLI測試V4 Pro和另一款頂級模型完成同一個新功能開發任務:DeepSeek V4 Pro工作了12分02秒,成本0.12美元,但留下了一個Bug;另一款模型只用了3分18秒,成本1.41美元,且沒有發現問題。該使用者結論是:V4 Pro非常便宜,但便宜不意味著每一次都更划算。當然,這條測試很快遭到質疑:樣本量只有1,大模型本身具有隨機性,不能僅憑一次輸出判斷真實能力,至少應重複多次才能得出可靠結論。但也有人認為,這種批評不能完全否定實測價值,因為真實的Agent任務本身就是一個完整過程,一次任務最終是否完成,就是使用者最關心的結果。

無論如何,這組數字提出了一個非常現實的問題:Token價格不等於任務價格。一個模型每百萬Token的價格可能極低,但如果為了完成任務消耗更多Token、花費更多時間,甚至最終還需要人工檢查和修Bug,那麼真正的使用成本可能遠高於表麵價格。反過來,一個模型雖然昂貴,但如果一次就能完成任務,減少了人工參與,最終成本也未必更高。未來比較AI模型,恐怕不能再看“每百萬Token多少錢”,而要看“完成一個真實任務需要多少錢”,甚至還要加上“需要多少人工監督”。

在懷疑和批評之外,V4 Pro同樣獲得了大量積極的實測評價。一名長期使用者表示,自己已用它完成不少“相當重大”的工作,總體成功率不錯,但仍不願完全放手讓模型自主運行:“我會檢查每一步,也會進行引導。”即便如此,他認為以這個價格來看,DeepSeek“值得”。另一名使用者則把V4 Pro當作多個項目實現的“審計員”,結果“很紮實”,計畫將不同模型分工:更貴更強的負責一部分,DeepSeek Pro負責另一部分。越來越多的使用者構造了非常實際的工作方式,不同模型幹不同的活,一個模型適合生成程式碼,另一個適合審查,一個便宜可承擔重複工作,另一個貴但用於最關鍵的任務。

未來AI的使用方式,可能越來越像一個“模型團隊”,而不是尋找一個全能冠軍。從這個角度看,V4 Pro不一定需要在所有任務上擊敗對手,它真正需要找到的,是自己在開發者工作流中的位置。而這一點,或許比跑分排名更值得關注。

Harness登場:給天才AI配上一套工作系統

就在同一天,Deepseek還發佈了DeepSeek Harness。

過去,人用AI主要是聊天,輸入問題,等答案,模型的任務是回答。今天,越來越多的AI 需要直接幹活:閱讀程式碼倉庫、搜尋檔案、呼叫終端、修改程式碼、運行測試,失敗後查看報錯再改,必要時還要拆分任務交給子Agent處理。

這時候,模型再聰明,也無法憑空完成工作。你得先決定它能訪問那些檔案?能用什麼工具?終端命令怎麼執行?那些操作需要使用者批准?失敗後怎麼辦?任務跑了幾小時,它如何記住之前做了什麼?這些看似瑣碎的細節,合在一起正形成一個越來越重要的新層次:Harness。DeepSeek在發佈V4 Pro的同時悄悄推出的,恰恰就是這個東西。

不妨把大模型想像成一名剛入職的天才員工。大腦當然重要,知識夠不夠多,推理強不強,寫程式碼水平高不高。但把這名員工關在空房間裡,不給電腦、檔案和工具,也不允許操作,再聰明也幹不成複雜的事。反過來,給他電腦、程式碼倉庫、終端權限、搜尋工具、測試環境和清晰的工作流程,他能完成的事情就完全不同了。Harness,某種意義上就是圍繞 AI大腦搭建的這套工作系統。

據DeepSeek介紹,DeepSeek Harness是基於Cordis框架的開源 Agent Harness,核心理念是“Everything is a plugin”,幾乎所有元件都可模組化替換,包括模型、工具、技能、會話、沙箱、檔案系統、Agent循環、任務編排和介面。它在試圖回答:當大模型開始長期執行任務,外面的這套系統究竟該如何組織。目前Harness已具備檢查程式碼倉庫、編輯檔案、執行 Shell命令、搜尋檔案和網頁、維持任務計畫、呼叫技能、委派子Agent以及設定操作審批等能力,標準模式被描述為一個完整的程式設計Agent環境。

回頭再看V4 Pro發佈後那些矛盾的使用者評論,事情就變得有意思了。也許有的使用者說DeepSeek在自己項目裡不行,另一個人卻說它能完成複雜部署,不一定是誰在撒謊。他們可能用的不是同一個DeepSeek,精準地說,用的是同一個模型,卻不是同一個“模型+工具+任務循環+驗證機制+權限系統+Agent環境”。而下一場 AI 競爭,或許就藏在這個加號後面。

模型與Harness,誰主沉浮?

這個問題迅速在社區裡引發了爭論。有人給出一個大膽判斷:從今年2月開始,在編碼 Agent 的最終表現中,Harness的重要性已幾乎和模型本身一樣,甚至更高。問題不再是“那個模型最好”,已經變成了“那個模型+Harness的組合最好”。有開發者舉例說,用不同 Agent 框架呼叫同一模型時,工具呼叫的失敗率竟出現巨大差異。另一位使用者則認為,如今討論 AI 能力已不能脫離具體運行環境,因為改變Agent的狀態、工具和流程,本身就會改變結果。

當然,反對聲音也不少。有人反問:如果一個模型連通用工具都需要專門的Harness才能用好,豈不是說明模型本身的泛化能力存在缺陷?還有人覺得,“Harness和模型同等重要”的說法過於誇張,大部分智能仍來自訓練本身。

至少,今天我們很難把模型和它所在的 Agent環境完全割裂。連所謂的模型基準測試都未必是模型單獨作答的。一個值得注意的細節是,DeepSeek在公佈V4 Pro 0813 在部分公開 Code Agent 任務上的成績時,明確說明測試使用了即將推出的 Harness 的minimal mode。換言之,這些結果衡量的並非一個脫離環境的裸模型,而是模型進入特定 Agent 執行環境後的表現。這就讓傳統大模型排行榜出現了一個越來越明顯的尷尬點:過去能直接比較“模型A對模型 B”,現在卻越來越像是比較“模型 A+某種工具環境”對“模型 B+另一種 Agent 系統”。

此事非同小可。如果AI 只需回答一道數學題,我們或許可以剝離環境變數,只測大腦本身。而如果任務是開發一個軟體項目,情況就完全不同了:它要讀幾十個檔案,決定修改那些程式碼,運行測試,分析錯誤,呼叫終端修復,搜尋文件,發現需要新資訊再去呼叫其他工具。在這個鏈條裡,模型負責思考,但它能看到什麼、能做什麼、何時停下、失敗後如何繼續,都由模型之外的系統共同決定。所以,未來衡量一個AI Agent,還得問“你給了它怎樣的工作環境”。

從開放模型到開放AI的工作方式

從這個角度看,8 月13 日的兩項發佈並非互不相干。V4 Pro解決的是大腦問題,Harness 解決的則是讓這個大腦如何真正開始工作的問題。DeepSeek的新方向似乎出現了。

Harness採用MIT 許可證,允許開發者替換和擴展幾乎所有元件,目前雖處於開發者預覽階段,但方向已然清晰。它像 Claude Code、Codex 等產品一樣,試圖把模型、程式碼倉庫、終端、權限、測試、任務管理組織成一套可長期工作的系統。當然,Harness目前還遠不能與那些成熟產品劃等號,它更像一個開放的、無關模型的 Agent 基礎設施,本地介面和無頭命令等能力與後者的雲端生態仍有差距。但DeepSeek 顯然不滿足於只做一個模型,它開始親自提供模型在 Agent世界中的那套框架。

DeepSeek 過去的成功,恰恰在於“開放”二字。當國際AI競爭由少數巨頭的閉源模型主導,它通過開放權重和極低價格提供了另一條路。而Harness將這種開放向上延伸了一層,以前開放的是模型,現在嘗試開放的是模型之外的 Agent 運行框架。“Everything is a plugin”尤其說明問題:開發者不必接受固定黑箱,可以替換其中的模型、工具,甚至允許 Anthropic、OpenAI 或其他相容模型進入體系。這背後是一種與封閉產品不同的競爭思路。未來,開發者可能不會問“我能不能用 DeepSeek 的大腦,加上我自己的工具?能不能換掉任務系統?能不能控制Agent的存取權?”

提供最強的模型是一場競爭,定義AI如何呼叫工具、如何執行任務、如何長期工作,則很可能成為另一場競爭。而 DeepSeek 顯然希望進入後一場。

V4 Pro這次沒有迎來一邊倒的滿堂彩,未必是壞事。它反而暴露了一種越來越清晰的行業變局:DeepSeek Flash已經太強了,與此同時,即使模型本身不變,放進不同的 Agent 環境,最終結果也有天差地別。

大模型行業從一個問題走向另一個問題。以前是“誰擁有最聰明的大模型?”後來是“誰能用最低成本提供足夠聰明的大模型?”現在,隨著 AI 開始操作電腦、呼叫工具、修改程式碼、完成長時間任務,問題變成“誰能讓AI 把工作做完?”V4 Pro固然重要,代表著模型本身的持續強化。但如果未來的我們越來越難通過一次聊天、一次程式碼生成或一張排行榜直觀感受模型差距,那麼決定勝負的,可能在於誰先給模型配上更有效的工具、記憶和工作流程。

模型決定AI能想什麼,Harness決定 AI能做成什麼。DeepSeek V4 Pro也許只是一次常規升級,但Harness的出現意味著,這家因低價大模型而被世界認識的公司,已經把目光投向模型之外。下一場競爭已經開始。 (心智觀察所)