從2026年3月崔添翼加入DeepSeek開始組建Harness團隊到今天,憋了5個月,DeepSeek的Harness工具這回真的要來了?
一張截圖在各大AI社區流傳,內容是DeepSeek Harness的內部測試招募通知。
按照截圖的說法,Harness計畫於本週晚些時候開啟內測,首批使用者從小範圍群組中篩選,入選者需要提交個人資料、簽署《保密承諾函》,才能拿到產品存取權。
並且截圖顯示,一旦洩密,不只是當次資格取消,還會影響日後DeepSeek各類模型、產品內測以及合作機會的入選。
雖然截圖真偽無法驗證,但結合DeepSeek此前關於V4正式版發佈日期的公告,以及崔添翼曾表示Harness將和V4同時發佈,那麼這條傳聞很有可能是真的。
然而目前市面上沒有任何關於DeepSeek Harness產品形態的報導,按照DeepSeek以往的作風來看,Harness是重要產品,它的研發與設計一定是嚴格保密的。
不過我們還是能通過DeepSeek的各種蛛絲馬跡,大致推斷出這個產品大概長什麼樣。
DeepSeek Harness到底長什麼樣
DeepSeek Harness究竟長什麼樣?目前公開的資訊只有兩塊,第一塊是負責人崔添翼的量化背景,第二塊是DeepSeek關於Harness部分的招聘職位描述(JD)。
先來說第一塊,崔添翼不是做AI出身的。他在Jane Street做了九年的量化交易系統。
在量化交易系統裡,最值錢的是執行系統。它講究的是軟體能不能在毫秒等級把策略變成交易?能不能在出了異常的時候自動恢復?能不能在每一步都留下可追溯的日誌?
如果把這個思維搬到Harness上,那麼其大體邏輯可能會是這樣的:
量化交易裡,慢一毫秒,錢就被別人賺走了。所以系統的每一步都得摳著毫秒級最佳化,不能有多餘的步驟。
所以Agent循環的每一輪推理-執行-反饋都要快,不能有冗餘開銷。你跟AI說一句話,它不能半天沒反應。從它想一下、到呼叫工具、到拿到結果、到再想下一步,整個循環必須得快。
同時,量化系統必須得非常可靠。如果量化系統崩了,那虧的是真金白銀。所以哪怕行情再詭異、資料再離譜,系統本身不能掛,得能自己恢復。
模型可能會犯錯,甚至輸出一些離譜的東西給你,但Harness這個框架本身不能崩,得能兜住結果,想辦法把模型拉回來繼續幹活。
其實在量化交易裡,網路斷了、交易所介面掛了、行情資料異常了,這些都是家常便飯。系統不能一遇到問題就死,得有重試、有備用方案、實在不行就降級,比如即時行情拿不到,就先用延遲資料頂著。
模型也是同理,呼叫工具失敗了、檔案讀不出來、網路超時了,這些都是常事。好的Harness不會因為一個工具呼叫失敗就整個任務廢掉,它會自動重試、換個方法、實在不行就降級處理,繼續推進任務。
另外,由於量化系統涉及大量的金錢,交易出問題了,得能查到是哪一步出錯的,可能是下單的時候錯了,也有可能是行情解析錯了。每一步都得有日誌,這樣才能復盤。
Harness也一樣,AI把活幹砸了,你得能回看它是怎麼一步步走到坑裡的。是哪一步想錯了?哪個工具呼叫返回了異常結果?它為什麼做了那個錯誤的決定?
在整個量化系統裡,訂單狀態也非常重要。不能出現“我以為下單了但其實沒下”或者“重複下單”這種情況,每一步的狀態都得是確定的、一致的。
放到Harness上,在所有人都押注長程任務、複雜任務的當下,能否維持模型中間的狀態,將決定整個Harness的成功率。不能前面改了A檔案,後面改B檔案的時候把A的改動忘了。
最後是風控和安全了,量化交易有熔斷機制,行情異常的時候自動停止交易,防止一個bug把錢虧光。另外,高風險的操作必須有審批,不能說下單就下單。
那麼回到Harness裡,在讓AI刪檔案、格式化硬碟、跑sudo rm -rf這種高危操作之前,就必須得停下來進行確認。不能它自己想幹啥就幹啥,Harness得有個安全閘門。
從DeepSeek的JD裡看產品
說完了第一塊再說第二塊,DeepSeek官方掛出來的崗位JD。
JD裡提到了KV Cache、長上下文裁剪與壓縮演算法,說明Harness會做智能的上下文管理。
配合DeepSeek V4的前綴快取能力,相同上下文的任務不重複計算。長對話中自動對歷史消息做摘要,保留關鍵資訊,釋放token空間。根據任務複雜度動態調整上下文策略,簡單任務用短上下文省成本,複雜任務拉滿百萬token的長上下文。
相當於是把每一份算力都花在刀刃上,小事能省則省,大事算力拉滿。
JD裡還提到了向量儲存方案選型、會話狀態持久化與回放,這也就意味著Harness有長期記憶系統,會記住你項目的架構、編碼規範、常用模式,下次打開項目自動載入。
會話持久化代表就算你關掉終端後再打開,之前的對話狀態、修改記錄、執行軌跡依然都在。甚至DeepSeek Harness還可能記住你的命名風格、喜歡的框架版本,跨對話記憶你的各種習慣。
JD裡提到了Tool Use鏈式呼叫、錯誤回退與自動重試,這是指Harness有完整的工具呼叫編排能力,能編排多步工具呼叫的有向無環圖。工具呼叫失敗自動重試,重試不行就降級換方案,再不行就回滾到上一個穩定狀態。
劃重點,DeepSeek Harness還可能支援動態註冊新工具,Agent能自動發現並學會使用。
JD裡提到了多Agent間通訊協議設計、任務分解與結果聚合。這說明Harness有子Agent架構,一個主Agent負責任務規劃和協調,多個子Agent負責具體執行。
不同子Agent有不同的系統提示詞、工具權限、上下文窗口。主Agent把複雜任務拆成子任務,分發給子Agent,再把結果聚合成最終輸出。每個子Agent運行在獨立上下文或處理程序中,互不干擾,出錯了不影響主流程。
JD裡還提到了任務規劃圖生成、執行路徑線上最佳化。這意味著Harness有規劃與自進化的能力。
規劃說的是接到任務後先生成執行計畫,分幾步、每步用什麼工具、預期產出是什麼。執行過程中根據實際情況動態調整,不是死板地按原計畫走。每完成一步就自我檢查,不對就自動修正。
而且,DeepSeek Harness很可能有一套內部benchmark,每次架構改動都跑一遍,看是進步了還是退步了,以此實現工具的自我進化。
最有意思的一點在JD最後,DeepSeek說,要讓模型與Harness共同進化,實現模型與Harness的深度適配。
這也就代表了,Harness會利用DeepSeek-V4模型的特性,比如V4的稀疏注意力、前綴快取。它不是通用Harness 框架,而是跟DeepSeek模型深度繫結的一體化產品。
其實這也是OpenAI現在的理念。
此前。OpenAI是有兩條獨立的後訓練線。一條是程式碼專用的Codex線,一條是通用推理的GPT線。到GPT-5.5的時候,兩條線合併了,GPT-5.5-Codex將程式碼能力和通用推理能力整合進了同一個模型。
這就好比汽車,原廠就像汽車廠家自己做發動機+變速箱,知道發動機的扭矩曲線、轉速特性,變速箱換擋邏輯可以精準匹配。但是如果把這事交給第三方來做,發動機對他們來說是黑盒,只能憑感覺調變速箱,這就導致永遠調不到原廠那麼絲滑。
V4正式版,跳票一個月
Harness不是一個人來的。崔添翼曾表示,V4正式版和Harness將同步發佈。
4月24日,DeepSeek發佈V4 Preview,Pro和Flash兩個版本同步開源。兩個月後,在6月29日那天,DeepSeek向API使用者傳送郵件,明確說V4正式版計畫於7月中旬上線。結果眼瞅著要到8月了,依然沒有任何關於V4正式版的消息。
曾有傳聞稱,由於7月24日,DeepSeek舊的API deepseek-chat和deepseek-reasoner正式退役,所以V4正式版將會同期發佈。畢竟更換API介面,通常是給新版本讓路的前置動作。
可V4正式版依然沒有發佈。只是兩個舊模型名正式停用,所有呼叫必須換成新的deepseek-v4-flash和deepseek-v4-pro。換句話說,API介面名換了,但模型本身還是預覽版那套。
那麼正式版比預覽版強在哪?
綜合多個內測信源的說法,稱V4正式版在三個方向上做了升級:
核心推理能力再上一個台階。
日常對話的響應速度明顯最佳化。
Agent能力針對性迭代。
有參與灰度測試的人總結,V4正式版整體表現接近Opus 4.8等級,編碼能力不弱於GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同樣的任務比Claude Fable 5迭代輪數還少。
不過這些說法都來自非官方管道,DeepSeek沒有公開確認。
預覽版的問題其實社區裡討論得不少。V4 Preview在程式設計能力上和Kimi K2.7、GLM 5.1接近,但仍然遜色當前的主流模型。
尤其是在那些複雜的任務上。有測試者發現,即便要求模型“不使用外部依賴”,模型依然引用了外部CDN。
遇到真正複雜的任務,需要手動加reasoning_effort=max(推理強度最高)才能拿到更深的思考深度,但變成agent往往會忽略這個提示詞,導致模型思考的強度不夠。
還有一點,雖然目前DeepSeek已上線識圖模式(OCR),不過DeepSeek-V4的多模態能力也是短板。
按照DeepSeek官方的說法,預覽版是純文字,正式版首次原生支援圖像推理,DeepThink引擎可以在同一個思考流程中分析圖片、解讀截圖。這變相也增加了Harness工具的壓力。
以及V4正式版會加入一些企業功能,但具體如何,DeepSeek官方並沒有進一步透露。
再說價格,這是爭議最大的部分。
V4正式版將引入峰谷定價機制,高峰時段(北京時間9:00-12:00和14:00-18:00)API價格直接翻倍。具體來看,V4 Pro快取命中輸入平時0.025元/百萬 token,高峰0.05元;快取未命中平時3元,高峰6元;輸出平時6元,高峰12元。V4 Flash 快取命中平時0.02元,高峰0.04元;快取未命中平時1元,高峰2元;輸出平時2元,高峰4元。
峰谷定價這件事,往好了說是把算力選擇權還給使用者,不急的任務挪到低谷時段跑,成本更低。可另一方面,在平時的辦公時間,跑相同的任務,成本就會增加。
這不是DeepSeek第一次在定價上換思路。
2025年2月搞過夜間錯峰優惠,V3五折、R1二五折。2025年9月 V3.1發佈,取消夜間優惠,全天統一價,輸出價格還往上抬了50%。
但關鍵問題不在於價格漲沒漲,而在於結合Harness之後,整體使用成本會如何?
第三方測試顯示,不同的harness 在完成同樣任務時,token消耗差異巨大。測試機構用DeepSeek V4 Flash,分別測試了Claude Code、OpenCode和Pi這三個市面上最常見的Harness工具。發現,三種工具的程式碼質量基本一致,但Claude Code 每個任務平均跑約70次工具呼叫,OpenCode只有約22次。
此外,同一個任務,在弱Harness(Pi)裡失敗了,換到強Harness(Claude Code)裡居然成功了。
因此,如何去平衡價格與性能,這是DeepSeek做Harness必須要面對的問題。
不過有一點我很放心,在省錢這件事上,梁文鋒還是太權威了。(字母AI)
