DeepSeek-V4,重大升級!

AI速讀
DeepSeek-V4-Flash 正式版於7月31日上線,主打高性價比與強大的 Agent 執行能力。該模型在維持 2840 億總參數的輕量設計下,透過後訓練在程式碼理解、終端操作及網路安全等 9 項基準測試中得分顯著提升,性能直追頂級旗艦模型。第三方評測顯示其單任務成本比 GPT-5.6 Luna 低約 60%,被評為同類產品中性價比最高。券商分析指出,此輕量模型追平旗艦性能的趨勢,將對 AI 應用產業鏈產生正面利好影響。
性能追平旗艦模型,Agent能力大幅增強。

DeepSeek-V4系列模型迎來重大升級。搶在7月最後一天(31日),DeepSeek-V4-Flash正式版上線。

根據官方消息,DeepSeek-V4-Flash正式版的模型架構、大小和與預覽版相同,即MoE(混合專家)架構、2840億總參數、130億啟動參數、1M上下文,在此基礎上,正式版僅重新進行了後訓練,Agent能力便大幅增強,基準測試得分遠超V4-Pro-Preview。

官方性能對比的是國產程式設計代表GLM-5.2及美國的Opus 4.8。DeepSeek-V4-Flash正式版的整體性能超過了GLM-5.2,逼近Opus 4.8。相比對標模型,V4 Flash只是個小參數模型,GLM-5.2總參數高達7440億,啟動參數為400億,均遠高於V4 Flash。

具體來看官方給出的9項Agent基準測試得分,在考察終端操作能力的Terminal Bench2.1上,DeepSeek-V4-Flash正式版的得分從61.8漲到了82.7;在程式碼倉庫理解與修改任務NL2Repo、DeepSWE上,分別得分54.2和54.4,而其前身Flash Preview在DeepSWE項目上的得分僅為7.3。

另外,其指向網路安全任務的Cybergym得分為76.7,反映工具呼叫能力的Toolathlon-Verified達到70.3。

在更綜合的智能體評測中,DeepSeek-V4-Flash正式版在Agent Last Exam和 Automation Bench Public上的得分分別為25.2和25.1,這兩個項目都是2026年新推出、面向AI智能體的現實任務評測基準,用來檢驗大模型Agent能不能真正完成真實工作,區別於MMLU、Humanity’s Last Exam這類純問答測試。

在內部全端開發測試DSBench-FullStack與高難度編碼測試DSBench-Hard上,得分則達到68.7和59.6。多項指標遠超今年4月上線的V4-Pro預覽版。

新版本上線後,Artificial Analysis和Arena.ai兩大AI評測平台同步更新了該模型的基準測試結果。

Artificial Analysis智能指數顯示,DeepSeek-V4-Flash獲得50分,比4月發佈的Flash版本高出10分,僅比OpenAI的GPT-5.6 Luna(51分)低1分。該平台發文稱,即使OpenAI將GPT-5.6 Luna的價格下調了80%,DeepSeek-V4-Flash正式版在其自有API上的單任務成本仍然比GPT-5.6 Luna低約60%

Arena.ai的報告稱,DeepSeek-V4-Flash正式版以1586分的成績重塑了Frontend Code Arena跑分榜單。每MToken的價格為0.14美元/0.28美元,是同類產品中性價比最高的

申萬宏源證券最新研報稱,DeepSeek-V4-Flash繼續展現國產模型超高性價比;國聯民生證券稱,DeepSeek-V4-Flash輕量模型追平旗艦性能,利多AI應用產業鏈。(科創板日報)