DeepSeek-V4-Flash正式API上線!Agent能力暴漲6倍,價格僅為Claude的1/90

AI速讀
DeepSeek 推出 V4-Flash API,主打「低價高能」。該模型在不變更結構的前提下,透過後訓練使 Agent 能力暴漲 6 倍,且輸出價格僅為 Claude 的 1/90。開發者實測顯示其在程式碼編寫與終端指令執行上表現優異,並原生支援 Responses API 以兼容 Codex 生態。此舉與 OpenAI 同日降價形成對比,揭示 AI 產業競爭焦點已由「堆參數」轉移至「精調優」,證明低成本亦能實現高性能。

AI圈又炸了。DeepSeek悄然上線了V4-Flash正式版API,一個“廉價版”模型,卻在Agent能力上碾壓了三個月前的Pro預覽版。更讓人震驚的是——它只重新做了後訓練,模型骨架一點沒變。

昨晚,DeepSeek-V4-Flash正式版API上線。

消息一出,開發者社區瞬間沸騰。

這不是一次普通的版本迭代。一個2840億參數的MoE模型,啟動參數僅130億,價格低至0.2元/百萬tokens(快取命中),卻在多項Agent基準測試中,硬生生把三個月前的V4-Pro預覽版摁在地上摩擦。

最讓人細思極恐的是模型結構、尺寸一點沒變,只是重新做了一遍後訓練。

這意味著什麼?後訓練最佳化的空間,可能比我們想像的大得多。

九項基準測試,全面碾壓

先看硬指標。

DeepSeek-V4-Flash正式版採用MoE架構,總參數量2840億,啟動參數130億,支援100萬token上下文,可切換思考/非思考模式。

官方公佈的9項Agent基準測試成績,堪稱驚豔:

最大的亮點在DeepSWE(專門用於評估 AI Agent在‌真實、長周期、多步驟程式設計任務‌中的自主解決能力)從預覽版的7.3分飆升至54.4分,暴漲超過6倍。

在 Terminal Bench 2.1(評估 AI Agent在‌Linux 終端環境中自主規劃、執行多步命令列任務及錯誤恢復能力‌的權威基準測試) 中,Flash 正式版得分82.7,高於V4-Pro-Preview的72.1和GLM-5.2 的81.0,逼近Opus-4.8的 85.0。

在海外模型評測機構Artificial Analysis的智能指數測試中,V4-Flash-0731(最高推理檔位)拿下50分,而同類可比模型的中位數僅為17分。

差距,肉眼可見。

真正恐怖的是:模型沒變,只重做了後訓練

如果說性能提升是常規操作,那這次升級的方式才真正值得細品。

DeepSeek官方確認:V4-Flash-0731的模型結構、尺寸與預覽版完全一致,僅重新進行了後訓練。

同一個骨架,同一套參數規模,只是後訓練的策略更精細了,結果就在Agent基準測試上產生了質的飛躍。

這讓很多人開始重新思考:堆參數真的是唯一出路嗎?

後訓練階段的最佳化空間,可能被嚴重低估了。

與此同時,DeepSeek自研的Agent測試框架DeepSeek Harness也首次正式亮相。

開發者實測:便宜到離譜,幹活還不賴

性能是紙面上的,真正讓開發者興奮的是實測體驗。

有使用者曬出帳單:“蹬了一小時才不到一塊錢”。

價格有多誇張?輸入命中快取0.02元/百萬tokens,未命中1元,輸出2元。大約只有Claude的1/90(DeepSeek-V4-Flash的輸出價格約0.28美元,Claude Opus 4.8輸出25美元)。


最讓人上頭的場景是Claude Code。

有開發者分享:“今天正式版出來後,就用官方API接入Claude Code中開始幹活,不到4個小時,差不多消耗了1億token,快取命中率竟然達到了99%,關鍵是幹活質量還不錯,很少返工。”

另一位使用者更直接:“一遍寫完,真實測試一遍完美通過,順手還修了十幾個bug……最恐怖的是opencode花了0.1美元。”

從事Qt/C++上位機、STM嵌入式開發的個人開發者反饋:“flash0731的agent表現與v4-pro-preview的表現非常接近”,“目前初步使用感覺flash在能力上和pro-preview相比沒有明顯差異,但是人是便宜啊!!!”

微博上有使用者評價:“最近又高強度的使用了DeepSeek V4 Flash,感覺優勢貌似又回來了點兒,在程式碼和Terminal指令這塊貌似也提升很大。”

槽點也很真實:普通使用者玩不了

當然,質疑聲也不少。

最大的槽點是僅限API公測。網頁端和App都沒有更新,普通使用者暫時無法體驗。“對大眾玩家不夠友好”是高頻反饋。

指令遵循仍有短板。有開發者指出:“這版本太喜歡框框幹了,沒說清楚的事情不太適合交給他幹,會出錯岔子的;很清晰、有邊界的任務可以交給他。”

另外,Agent模式下推理語言被鎖定為英文,系統提示詞完全無效。GitHub上已有使用者提出希望開放語言控制參數。

嵌入式開發仍有瑕疵。有開發者反饋:“在嵌入式開發表現已經比上半年的許多模型表現好很多了,但是還是會出現連接埠識別不清、寫出連編譯都通過不了的程式碼。”

原生支援Responses API,劍指Codex生態

除了模型本身,工程側的適配同樣值得關注。

V4-Flash正式版原生支援OpenAI的Responses API格式,並針對性適配了Codex。開發者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex外掛中直接呼叫DeepSeek模型。

Responses API目前僅支援V4-Flash,V4-Pro預計8月初接入。

這意味著開發者可以用更低的成本,無縫接入Codex生態。

長上下文效率:單token計算量降至27%

V4-Flash在長上下文場景下的工程最佳化同樣值得一提:

100萬token場景下,V4系列的單token推理計算量僅為V3.2的27%,KV Cache佔用降至約10%。

長鏈路任務的算力與視訊記憶體成本,被大幅壓縮。

巧合還是狙擊?同日OpenAI宣佈降價80%

就在DeepSeek-V4-Flash正式版上線的同一天,OpenAI宣佈GPT-5.6 Luna降價80%。

時間點耐人尋味。

一邊是國際巨頭主動降價,一邊是中國廠商用1/90的價格交出更強的Agent能力。

有評論一針見血:“DeepSeek-V4-Flash正式版的Agent能力全面超越此前的Pro預覽版,相當於用更便宜的價格交出了更強的幹活能力。這是在證明,低價不等於低能。”

有業內人士指出,這次升級釋放了一個明確的訊號,大模型競賽正在從“堆參數”轉向“精調優”。同樣的模型骨架,僅靠後訓練的最佳化,就能在Agent能力上實現6倍增長。這對整個行業的啟發是深遠的,參數的盡頭可能不是更大,而是更聰明地訓練。 (TechWeb)