AI圈又炸了。DeepSeek悄然上線了V4-Flash正式版API,一個“廉價版”模型,卻在Agent能力上碾壓了三個月前的Pro預覽版。更讓人震驚的是——它只重新做了後訓練,模型骨架一點沒變。
昨晚,DeepSeek-V4-Flash正式版API上線。
消息一出,開發者社區瞬間沸騰。
這不是一次普通的版本迭代。一個2840億參數的MoE模型,啟動參數僅130億,價格低至0.2元/百萬tokens(快取命中),卻在多項Agent基準測試中,硬生生把三個月前的V4-Pro預覽版摁在地上摩擦。
最讓人細思極恐的是模型結構、尺寸一點沒變,只是重新做了一遍後訓練。
這意味著什麼?後訓練最佳化的空間,可能比我們想像的大得多。
九項基準測試,全面碾壓
先看硬指標。
DeepSeek-V4-Flash正式版採用MoE架構,總參數量2840億,啟動參數130億,支援100萬token上下文,可切換思考/非思考模式。
官方公佈的9項Agent基準測試成績,堪稱驚豔:
最大的亮點在DeepSWE(專門用於評估 AI Agent在真實、長周期、多步驟程式設計任務中的自主解決能力)從預覽版的7.3分飆升至54.4分,暴漲超過6倍。
在 Terminal Bench 2.1(評估 AI Agent在Linux 終端環境中自主規劃、執行多步命令列任務及錯誤恢復能力的權威基準測試) 中,Flash 正式版得分82.7,高於V4-Pro-Preview的72.1和GLM-5.2 的81.0,逼近Opus-4.8的 85.0。
在海外模型評測機構Artificial Analysis的智能指數測試中,V4-Flash-0731(最高推理檔位)拿下50分,而同類可比模型的中位數僅為17分。
差距,肉眼可見。
真正恐怖的是:模型沒變,只重做了後訓練
如果說性能提升是常規操作,那這次升級的方式才真正值得細品。
DeepSeek官方確認:V4-Flash-0731的模型結構、尺寸與預覽版完全一致,僅重新進行了後訓練。
同一個骨架,同一套參數規模,只是後訓練的策略更精細了,結果就在Agent基準測試上產生了質的飛躍。
這讓很多人開始重新思考:堆參數真的是唯一出路嗎?
後訓練階段的最佳化空間,可能被嚴重低估了。
與此同時,DeepSeek自研的Agent測試框架DeepSeek Harness也首次正式亮相。
開發者實測:便宜到離譜,幹活還不賴
性能是紙面上的,真正讓開發者興奮的是實測體驗。
有使用者曬出帳單:“蹬了一小時才不到一塊錢”。
價格有多誇張?輸入命中快取0.02元/百萬tokens,未命中1元,輸出2元。大約只有Claude的1/90(DeepSeek-V4-Flash的輸出價格約0.28美元,Claude Opus 4.8輸出25美元)。
最讓人上頭的場景是Claude Code。
有開發者分享:“今天正式版出來後,就用官方API接入Claude Code中開始幹活,不到4個小時,差不多消耗了1億token,快取命中率竟然達到了99%,關鍵是幹活質量還不錯,很少返工。”
另一位使用者更直接:“一遍寫完,真實測試一遍完美通過,順手還修了十幾個bug……最恐怖的是opencode花了0.1美元。”
從事Qt/C++上位機、STM嵌入式開發的個人開發者反饋:“flash0731的agent表現與v4-pro-preview的表現非常接近”,“目前初步使用感覺flash在能力上和pro-preview相比沒有明顯差異,但是人是便宜啊!!!”
微博上有使用者評價:“最近又高強度的使用了DeepSeek V4 Flash,感覺優勢貌似又回來了點兒,在程式碼和Terminal指令這塊貌似也提升很大。”
槽點也很真實:普通使用者玩不了
當然,質疑聲也不少。
最大的槽點是僅限API公測。網頁端和App都沒有更新,普通使用者暫時無法體驗。“對大眾玩家不夠友好”是高頻反饋。
指令遵循仍有短板。有開發者指出:“這版本太喜歡框框幹了,沒說清楚的事情不太適合交給他幹,會出錯岔子的;很清晰、有邊界的任務可以交給他。”
另外,Agent模式下推理語言被鎖定為英文,系統提示詞完全無效。GitHub上已有使用者提出希望開放語言控制參數。
嵌入式開發仍有瑕疵。有開發者反饋:“在嵌入式開發表現已經比上半年的許多模型表現好很多了,但是還是會出現連接埠識別不清、寫出連編譯都通過不了的程式碼。”
原生支援Responses API,劍指Codex生態
除了模型本身,工程側的適配同樣值得關注。
V4-Flash正式版原生支援OpenAI的Responses API格式,並針對性適配了Codex。開發者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex外掛中直接呼叫DeepSeek模型。
Responses API目前僅支援V4-Flash,V4-Pro預計8月初接入。
這意味著開發者可以用更低的成本,無縫接入Codex生態。
長上下文效率:單token計算量降至27%
V4-Flash在長上下文場景下的工程最佳化同樣值得一提:
100萬token場景下,V4系列的單token推理計算量僅為V3.2的27%,KV Cache佔用降至約10%。
長鏈路任務的算力與視訊記憶體成本,被大幅壓縮。
巧合還是狙擊?同日OpenAI宣佈降價80%
就在DeepSeek-V4-Flash正式版上線的同一天,OpenAI宣佈GPT-5.6 Luna降價80%。
時間點耐人尋味。
一邊是國際巨頭主動降價,一邊是中國廠商用1/90的價格交出更強的Agent能力。
有評論一針見血:“DeepSeek-V4-Flash正式版的Agent能力全面超越此前的Pro預覽版,相當於用更便宜的價格交出了更強的幹活能力。這是在證明,低價不等於低能。”
有業內人士指出,這次升級釋放了一個明確的訊號,大模型競賽正在從“堆參數”轉向“精調優”。同樣的模型骨架,僅靠後訓練的最佳化,就能在Agent能力上實現6倍增長。這對整個行業的啟發是深遠的,參數的盡頭可能不是更大,而是更聰明地訓練。 (TechWeb)
