實測完DeepSeek V4 Pro正式版,我發現下一條「斬殺線」可能藏在它的Agent裡

AI速讀
DeepSeek V4 Pro 正式版發布,在文字模仿與複雜 Coding 任務上表現優異,支援 1M tokens 上下文。作者分析認為,DeepSeek 的戰略重心已從單純提升模型能力轉向「Harness」運行框架的開發。透過在低成本的 Flash 模型與高性能的 Pro 模型之間建立動態路由,DeepSeek 試圖將其極致的成本優勢轉化為 Agent 系統的競爭力,降低長任務的 Token 消耗,從而定義 AI Agent 時代的成本「斬殺線」。

一夜之間,三款重磅模型罕見撞車。

Grok 4.6 紙面跑分逼近 Fable 5,大有成為海外御三家的勢頭。

總參數達到 2.4T 的 Qwen3.8 Max 也如期開放權重;DeepSeek 這邊,DeepSeek V4 Pro 正式版(deepseek-v4-pro)同步上線,並開放 API 介面。

看完 V4 Pro 正式版的跑分圖,我只能說,這波提升還是肉眼可見的。

但這年頭,跑分沒輸過,實際體驗沒贏過的模型我們也見得太多了。因此,我們也第一時間將 deepseek-v4-pro 接進 Codex 和 Claude Code,看看實際效果如何。

V4 Pro 正式版到底好不好用?

先從文字能力開始。

我讓 V4 Pro 正式版模仿魯迅,寫一篇約 400 字的短文,吐槽現代人餓著肚子也要先給飯菜拍照發朋友圈,同時要求兼顧年代感、諷刺和幽默。

結果如下:

說實話,第一眼看過去,離真正的魯迅先生肯定還有距離。

開頭甚至直接借用了魯迅最具辨識度的經典句式,模仿痕跡相當明顯。但 V4 Pro 正式版至少沒有把「魯迅風」機械理解成半文半白、生僻詞和之乎者也。

它能抓住句式節奏,也知道把「吃飯拍照」從一個日常行為慢慢引向展示欲、面子和旁觀者評價。

更重要的是,整篇文章的「AI 命題作文味」已經比較淡。雖然還算不上一代文豪,但至少沒有那種讓人兩眼一黑的範本拼接感。

如果說模仿魯迅多少還有點「考試」意味,接下來這封商務郵件,就更接近日常工作了。

我假設公司內部失誤,導致一個大客戶的定製系統延期一周,讓它寫一封道歉郵件,要求承認責任、提出補償,同時不能把客戶合作信心寫沒了。

V4 Pro 正式版沒有用「多方面因素」「項目節奏調整」這類常見的職場模糊表達,而是直接承認「此次延期完全源於我方內部的失誤」,隨後給出了延長質保、增加免費培訓和專屬維運三項補償。

整封郵件 28 秒左右完成,正文基本到了修改一下資訊就能使用的程度。

有意思的是,郵件寫完以後,它又額外解釋了一遍為什麼這麼寫,頗有一種交完卷還要給老師講解答題思路的執著。

文筆測完以後,我把 DeepSeek V4 Pro 正式版接進了 Codex。

DeepSeek 已經原生支援 OpenAI Responses API,官方也直接提供了 Codex 接入方案。配置完成後,Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 外掛可以共用同一份配置。

我也測試了幾個程式設計任務。

我先丟給它一個很典型的「大而全」前端需求。

經典的 macOS 風格 Web OS,要求所有程式碼放進單個 HTML 檔案,同時加入文字編輯器、Terminal、程式碼編輯器、遊戲、檔案管理、畫圖和視訊編輯等應用。

單看完成度,這應該是我此前測試過的同類模型裡,功能最豐富的一版。多個應用都做出了基本介面和互動,系統框架也搭得比較完整,只不過審美嘛,就比較中規中矩了。

隨後我又測試了一個拍立得相機案例,需要完整模擬按快門、閃光、出紙和 8 到 10 秒化學顯影的過程,同時疊加復古偏色、輕微雜色以及類似寶麗來照片的表面質感。

從成品來看,動畫之間的銜接也是比較自然流暢的。

再比如直接上 Three.js 和 WebGL,讓它生成可以互動的黑洞吸積盤,滑鼠改變觀察角度以後,星空、吸積盤和光線彎曲都要跟著變化。

面對 WebGL 這類對性能敏感的場景,V4 Pro 對粒子數量、即時計算、渲染開銷和動畫複雜度的控制仍然偏激進。光打開網頁,我的 M2 電腦已經開始明顯掉幀。

最後則是一套科幻飛船駕駛艙 HUD,需要同時處理動態準星、雷達、航向、速度、能量、目標鎖定和滑鼠移動後的慣性偏移。V4 Pro 正式版最終把主要互動關係都做了出來。

總的來說,如果不存在官方部署 bug 的前提下,V4 Pro 正式版應對複雜任務的完整度還是有所提高,只不過,整體體驗下來,我也總感覺少了一些特別驚豔感,甚至有些地方沒有比 V4 Flash 拉開想像中那麼大的差距。

不過放到 Agent 場景裡,如果 Flash 已經能完成 80% 甚至 90% 的任務,Pro 只負責少數高難度節點,那麼真正高效的系統,會動態決定什麼時候呼叫 Flash,什麼時候呼叫 Pro,而不會全程掛著最貴的模型。

換句話說,模型之間的能力梯度,本身可以變成 Agent 的成本最佳化空間。

DeepSeek 的下一張牌,藏在 Harness 裡

規格上,DeepSeek V4 系列已經把上下文拉到 1M tokens,最大輸出達到 384K tokens。

普通聊天基本用不到這麼大的窗口,但 Coding Agent 很容易需要同時處理幾十個檔案、歷史修改、工具返回結果和長時間任務狀態。上下文越長,模型能夠留在手裡的項目資料越多。

代價也是不言而喻的,Token 會迅速上漲。

這也解釋了 DeepSeek 宣佈近期會上調 API 價格以後,為什麼外界如此關注。

當前 V4 Pro 正式版快取命中的輸入價格為每百萬 tokens 0.025 元,快取未命中輸入 3 元,輸出 6 元。V4 Flash 則分別是 0.02 元、1 元和 2 元。

Pro 的輸入和輸出價格基本是 Flash 的三倍,但放到全球市場裡,依然十分便宜。

DeepSeek 自己也已經提前提醒,API 服務近期計畫整體漲價,而且漲幅預計不會小。所以現在的 3 元輸入、6 元輸出,更像一個階段性價格。

另一個值得注意的地方是,按照現有模型資訊,它的主要能力仍集中在文字、推理、Coding、Tool Calls 等方向,暫時還沒有看到圖像、視訊等原生輸入能力。簡言之,多模態目前並不是 V4 Pro 正式版的重點。

相比之下,V4 Pro 正式版發佈前後,DeepSeek 在 Agent 方向上的動作明顯密集了起來。

在過去的兩三個月裡,我們也看到正式掛帥 DeepSeek Harness 部門的崔添翼,在各個平台瘋狂搖人,主打一個求賢若渴。

包括一個名為 「DeepSeek Harness 團隊」 的官方微信公眾號近期也完成註冊,認證主體屬於深度求索,目前還沒有發佈內容。

Harness 是今天 Agent 競爭裡經常被模型光環遮住的一層。

模型負責推理,真正決定 Agent 如何讀檔案、調工具、管理上下文、失敗重試和持續執行的,還有外面的整個運行框架。

Claude Code 和 Codex 的實際體驗,也從來不只由底層模型決定。

尤其當 DeepSeek 手裡同時有 Flash 和 Pro 之後,Harness 又多了一項很現實的工作:決定什麼任務值得上 Pro,什麼任務交給 Flash 就夠了。模型路由一旦做好,Agent 不需要為了少數高難度步驟,全程承擔 Pro 的價格。

在模型的成本優勢上,我們已經見識到了 DeepSeek 的斬殺線打法,它不必在每一項能力上都拿第一,只要模型達到「絕大多數任務能做完」的水平,再把呼叫價格壓得足夠低,就足以佔據一席之地。

同理,現在 DeepSeek Harness 團隊最值得關注的地方,是如何將 DeepSeek 已經建立起來的模型成本優勢,繼續傳導到整個 Agent 系統。

讓模型更少重複讀取上下文,讓工具呼叫更高效,讓長任務儘量避免無意義消耗,讓同樣一個任務需要的 Token 更少,再把底層模型本身的價格優勢疊加上去。

到那時,那怕 DeepSeek 未必要親手做出下一個稱霸市場的 Claude Code,只要越來越多的 Claude Code 建立這套極致性價比的體系之上,同樣也是一種不容忽視的勝利。 (APPSO)