“V4 Pro實測表現、Harness拆解、DeepSeek的產品哲學,一篇文章全講透。”
不管那個時代,人都會遇到同一道題:無論宏大敘事還是人生決策,面前問題太複雜,資源和時間卻不夠,必須決定先做那個、放棄那個。
從 1812 年黑格爾的辯證法,到馬克思、列寧,再到 1915 年毛澤東在延安寫下的《矛盾論》,一百多年裡,這套思想最終落到了一個很實際的問題上:複雜事物中矛盾很多,但真正重要的是找到決定其他矛盾的主要矛盾。
今天的大模型行業也不例外,當前大模型行業面臨的主要問題有以下這些:
- 模型能力的增長速度,同把這種能力轉化成可靠產出的能力之間的矛盾(模型強,但產出物沒價值)。
- 算力資源受限,同能力需求無限之間的矛盾(人們總吐槽 AI 太傻)。
- 單價在快速下降,同真實帳單在上漲之間的矛盾(模型便宜了,但每個月花的更多了)。
- 要做通用智能,同要交付一個能用的產品之間矛盾(簡單的不好用,好用的不簡單)。
這些矛盾才構成了交錯向上發展的行業和機會。沒有人能逃避這些選項,DeepSeek 也一樣。
我們對 deepseek-v4-Pro以及 Harness 做了幾輪實測:直接打介面的探針、七次編碼任務運行(其中四次是只改一個變數的對照)、把上下文壓到 92 萬 token 的位置測試,加上把它 19.8 萬行原始碼和 21.7 萬行測試過了一遍。試圖來回答以下問題:
- v4-Pro這個模型到底怎樣,比 flash、preview 版本有那些不同?
- 好多網友反饋接入其他 Harness 會降智是怎麼回事?
- 使用成本到底怎麼樣?能否量化?
- Harness 解決什麼問題?什麼人適合它?
總而言之,這幾天的研究和使用下來還是很精彩的,我們甚至能透過 v4-Pro和 Harness 管中窺豹,看到一些 DeepSeek 對技術、對人性,甚至對世界的判斷和認知。
01. 先看模型:DeepSeek V4 Pro 到底強在那裡?
Pro 很可能重做了一次非常先進的後訓練
Pro和 Flash 這兩個模型其實有挺多版本,我們一次性拉出來看下:
我們會發現兩個有意思的結論:
- Pro 對比 flash,模型本身的層面在深度、寬度、注意力、專家池以及專家內部寬度都有很大進展。
- 但這五個維度都是預訓練階段就定性的,不是後訓練帶來的變數。
(有一樣是相同的:每個 token 實際只啟動 6 個專家,兩個模型都是 6。)
還有一處彩蛋,後面會再 call back:deepseek Harness 的出廠默認模型寫的是 deepseek-v4-flash。
為什麼 Pro 正式版拖到 Flash 轉正之後才公佈?坊間其實預測 Pro 早就該來了。
我們都知道模型預訓練定天花板,後訓練定發揮。如果去翻舊帳會發現四月那版 v4-Pro-Preview 其實有一個缺陷:競賽型程式碼題三項全場第一,但 Terminal Bench 2.0 隻有 67.9。7 月 31 日 Flash 轉正,官方貼出它的 Terminal Bench 2.1 是 82.7,而同一張表裡 Pro-Preview 是 72.1。也就是說 Flash 正式版的 Terminal Bench 已經比旗艦模型 Pro的分數高不少了,我合理推測 DeepSeek 在 Flash 版本上嘗試出了更好的後訓練方法,因此 v4-Pro 被回爐重造。
再看 v4-pro-0813 的幾項躍升裡邊,正好 Terminal Bench 2.1 從 72.1 到 87.9,DeepSWE 從 12.8 到 62.7,內部全端測試集從 41.8 到 71.1。
我自己也出了兩道題去驗這件事,因為分數漲了和活能不能幹好是兩回事。一道是同一個改動要落到五處分散的呼叫點上,其中一處是用字串登記的,grep 根本搜不出來;另一道是兩個前後串聯的故障,修的順序錯了就白改。在實測中六次運行全部滿分,那個搜不出來的點它也找到了。(我們自己造的題、樣本小,不與官方或第三方的分數並列比較。)
也就是說這一版補上的是能自己把一件活幹完的能力。以前估計得在旁邊盯著,現在可以把一件有明確驗收標準的活交出去,然後走開。(而且做的更好了。)
但這張官方表還有另一半,中英文媒體都沒提。媒體的敘事是“逼近 Claude Fable 5”。而在 DeepSeek 自己貼的對照表裡,Kimi K3 在多數 agentic 項上仍然領先 0813,比如 Terminal Bench 2.1 是 88.3 對 87.9,DeepSWE 67.5 對 62.7,Toolathlon 76.5 對 74.1,Agents' Last Exam 27.6 對 25.7。0813 隻在三項上領先。(這是官方自測表,K3 與 GLM 的分數來源官方未說明。)
大概 deepseek 想傳遞的敘事是發生在國產開源之間,並無心和國外閉源模型較真。
還有一個更有意思的資料:官方 changelog 裡 Flash-0731 和 Pro-0813 用的是同一套內部測試集、同一個 Harness,所以可以直接並排:
Pro 的總參是 Flash 的 5.6 倍、啟動參數 3.8 倍。但換來的是個位數的領先。最難那一項 Agents' Last Exam 分別是25.2 對 25.7,幾乎打平。而且它自己那個框架的出廠默認模型寫的是 deepseek-v4-flash;第三方評測機構 AA 的 coding agent 榜上,DeepSeek 那一行用的也是 Flash;兩個老模型名下線前指向的同樣是 Flash。
幾條獨立線索都指向同一件事:Flash 才是它認定的主力性價比檔,Pro 是上限檔。
但是官方並沒有披露過 0813 這個版本重做了後訓練,只說它建立在 Preview 的結構之上、外掛了一個投機解碼模組。但同系列的 Flash-0731 有明文:"keeps the same model architecture and size … and was only re-post-trained"。因此 Pro模型重新做過後訓練是我們的單純推斷而已。
還有個值得一提的行業現象,隔一天發佈的 GLM-5.3也是同一個 744B 底座、不換架構、不重新預訓練,全部提升來自延長後訓練,也主打 agentic。兩家頭部開源模型隔一天做了同一個動作是否說明這一代旗艦升級的主戰場,已經從預訓練挪到了後訓練。
1M 上下文的真相
這是本輪最獨家的一處發現,而且任何人都能自己核對。
65536 × 16 = 1,048,576,正好 1M。也就是說這 1M 不是原生訓練出來的,是在 64K 的基礎上用一種叫 YaRN 的辦法外推 16 倍得到的。像一個只在 100 米跑道上練過的人,你讓他跑 1600 米。 也不是不能跑,但是很可能最後幾百米的質量直線下降。而且這在同行裡是特殊的。三家都標 1M:
我們可以看到在三個都標 1M 的開源旗艦裡,只有 DeepSeek 在配置裡明確用了外推縮放。
Kimi K3 沒有這個欄位,它換掉了注意力機制本身;GLM-5.2 也沒有外推參數,它把 rope_theta 拉到了 800 萬。但必須說明配置只能證明是否在推理期做位置縮放,不能直接證明訓練長度,所以精準說法是只有它明確用了外推。另外 GLM-5.3 的權重開源延後約兩周,這一欄對照的是 5.2 的可核配置。
順便一提:GLM-5.2 的架構類名叫 GlmMoeDsaForCausalLM,它的 indexer 欄位和 DeepSeek V4 同名,index_head_dim 連值都一樣是 128。而智譜在自己的官方模型卡里明寫:"GLM-5 also integrates DeepSeek Sparse Attention (DSA), largely reducing deployment cost while preserving long-context capacity."
這就不是推斷了,是對方正面寫出來的。
那麼按通常的工程認知,外推得來的長上下文代價會出現在窗口後段,也就是說越到後期質量越差。
我跑了個指令碼實測了一下,把可客觀判對錯的事實埋進長文字的不同位置,看它能不能取回來。
語料 3,857,465 個字元 = 923,858 個輸入 token。五個位置各埋兩條,10/10 全部命中,零編造,零文件中未提及。其中 95% 那個位置,落在約 90.2 萬 token 處(真正的尾巴片段)。
所以結論是外推並沒有導致窗口後段衰減。不過最後大約 8% 我們仍然沒碰到,但足以說明跑到 1440 米還沒掉速,只是最後 160 米沒測。不過官方自己給 Claude Code 的接入建議裡,把自動壓縮窗口設在 768K,也就是 1M 的四分之三。他們的建議就是別把 1M 跑滿。
02. V4 Pro 到底貴不貴?
單價偏貴,一項任務便宜
第三方評測機構 Artificial Analysis 明確把它的輸入價標為 expensive。同類中位數是每百萬 token $0.33,它是 $1.32。但它每個任務只花 $0.25,在同批 106 個開源大模型裡第二低。
比它強的 Kimi K3 每任務 $0.84,貴 3.4 倍;和它同分的 GLM-5.2 是 $0.32;最強的 Claude Opus 5 是 $2.34,貴 9.4 倍。就是說它起步價比別人貴,但路線短、繞得少,一趟算下來還算便宜。
真正省錢的是快取
agent 幹活的方式天生就是繞彎的。讀一遍不夠就讀兩遍,改錯了再改回來。繞彎就是燒 token。所以真正算帳的時候不應該去看單價多少,應該去看完成一次任務要多少米。
我們在長上下文測試裡正好量到了這個數:同一份 92 萬 token 的上下文,第一次提問花了約 ¥9.00,第二到第五次提問加起來只花了約 ¥0.28。 五次提問裡被快取命中的部分完全相同:923,776 個 token,只有 143 到 151 個 token 是新的。而我們四次編碼任務的快取命中率在 93% 到 98% 之間。這就像熬火鍋底料。第一次熬很貴,之後每次下菜只加一點新料。但底料只要被改動一點點,就得從頭重熬。也就是說讓他多試幾遍也沒關係,反正大頭出在第一次上面。
省錢是寫在工程裡的
我們在它 219 個包裡查到,215個 README 都必須回答同一個問題:我對 KV 快取前綴穩定性有什麼影響。
而且它還有個只許規劃、不許動手的 plan 模式。正常做法是把寫檔案、改程式碼這些工具從工具表裡摘掉,摘了模型就調不到。但是 dsh 沒摘。 出廠提示詞裡明寫:
The tool catalog stays the same across modes for request-cache stability … those tools remain listed only to keep the request shape stable.
它寧可承擔模型不聽話、真去呼叫了被禁工具的風險,也要保住請求前綴不變、保住快取命中。因為很可能拿掉一個工具後整個快取命中得重來。而且還有一個工程設定:工具結果超過 8,192 字元就裁、留頭 4,096 尾 1,024;超過 50,000 字節直接落盤不進上下文;連給會話起個標題都設了 64 token 的輸出上限。每一處都在算 token 真不是願景或者口號,DeepSeek 是真為你錢包著想。
8 月 17 日 0 點漲價正式生效(英文頁寫的是 16:00 UTC, Aug 16,恰等於台北時間 8-17 00:00)。
對舊價的倍數:快取命中漲 6 到 12 倍,未命中漲 1.5 到 3.0 倍,輸出漲 2.25 到 4.5 倍。高峰時段是 UTC 01:00–04:00 和 06:00–10:00,也就是台北時間 9 點到 12 點、14 點到 18 點。
注意漲得最多的是快取命中。而我們四次編碼任務的命中率在 93% 到 98% 之間(最高那次是 1,431,040 對 30,672)。所以這次漲價真正肉疼的是那些把快取用得最好的人。
把前面幾章串起來看,會發現同一件事在不同層面重複出現。
架構層:MoE 讓總參像 1.6T、算力像 49B。
定價層:單價偏貴、每任務第二低。
快取層:92 萬 token 第一次 ¥9、後四次 ¥0.28。
工程規範層:215 個包必答快取前綴問題、plan 模式寧可不摘工具、連會話標題都限 64 token。
DeepSeek 一直在做同一件事:用更少的算力和更少的上下文,買同樣的產出。而當 DeepSeek 把自己的 Harness 也開源之後,我們發現,這種對計算成本的敏感已經不只體現在模型和定價上,而是直接寫進了 Agent 的運行方式裡。
03. 為什麼換個 Harness,模型就像“降智”了?
社交媒體和知乎上早有使用者實測:把 V4 Pro接到 Claude Code 裡明顯變差,同樣任務換 OpenCode 就正常。那位作者自己也說,分不清是模型的問題還是工具的問題。我們實際測試,打了介面,發現答案是官方路由導致的。
DeepSeek 為了讓 Claude 生態的工具直接接過來,做了一層模型名翻譯。Anthropic 那邊有三檔(Opus 旗艦、Sonnet 主力、Haiku 輕快),DeepSeek 只有兩檔,於是 claude-opus 對應到 Pro,而claude-sonnet 和 claude-haiku 一起對應到 Flash。響應裡的 model 欄位就是這麼回的。
問題就發生在 Sonnet 這裡,這在 Anthropic 那邊是幹活主力,能力離 Opus 更近,但在這套對應裡被和 Haiku 一起歸到了 284B 的 Flash。
這是可以定向做的相容層。我們試了非 claude 的名字:foobar-9000 和 gpt-5-turbo 都直接報 400,錯誤資訊明說只支援那兩個 DeepSeek 模型名。只有 claude-* 開頭的名字才會靜默落到某個 DeepSeek 模型。
所以 Claude 生態的使用者命中它是必然的並不是意外。
還有一個更容易踩的坑:配置裡寫著任何非當前代的 claude 名字,都可能落到 Flash。比如claude-3-opus-20240229 名字裡有 opus,但最後落到的是 Flash。 而 claude-opus-4-6 落到 Pro。如果開發者照抄老教學、老指令碼,那幾乎必然會踩到這個坑裡,你以為用的是 pro,實際是 flash 在跑。
那這時候有使用者要問了,好傢伙你不會收著我 Pro 的錢,實際跑 flash 的質量吧?!我們實際打了 23 發會被對應到 Flash 的請求、把累計輸出堆到 10.3 萬 token,讓餘額跳動 ¥1.00。四套價格假設裡最接近的是按 Flash 計價(預測 ¥0.925,差 ¥0.075;次近的“按 Pro”差 ¥0.388,遠 5 倍)。
所以這不是錢的問題,主要問題是我以為在用 1.6T 的旗艦,實際有一部分活是 284B 的小模型在干,而且沒有任何提示。如果開發者拿這樣一個環境去評測和跑任務,其實幹活的是兩個模型的混合物。
因此對開發者而言,用 Claude 生態的工具接它,ANTHROPIC_MODEL、ANTHROPIC_DEFAULT_OPUS_MODEL、ANTHROPIC_DEFAULT_SONNET_MODEL、CLAUDE_CODE_SUBAGENT_MODEL 這四個環境變數要一起顯式覆蓋。
這次測試也讓我們意識到,到了 Agent 階段,只討論模型本身已經不夠了。模型接入什麼 Harness、看到什麼工具、如何管理上下文,同樣會直接影響最終表現。
04. DeepSeek Harness : 它到底解決了什麼問題?
8 月 13 日晚 19:19,V4-Pro正式版公告發出。76 分鐘後,DeepSeek 把自己的那套腳手架也開源了。
最後一條它寫在了倉庫描述第一行:
官方分數終於可以復現了
廠商報跑分,用的都是自家的腳手架,而腳手架不公開。所以我們看到的分數是這個模型配那套腳手架的成績,實際上不是這個模型的成績,因為環境拿不到也就沒法復現。
DeepSeek 自己在公告腳註裡也說明了這件事:0813 的 Code Agent 成績是用「DeepSeek Harness 極簡模式」加 max 思考檔跑的,並主動聲明“其他框架下結果可能略有不同”:
它把這套配置直接放進了倉庫:
極簡模式下模型能看到的工具只有兩個:一個持久 bash、一個字串替換編輯器。上下文壓縮:關閉。系統提示詞:一句話。而流空閒超時是 172,800,000 毫秒48 小時。他們預期的是能跑兩天的任務。
而有意思的是 Claude Code 恰好是反過來的:重系統提示詞、一大堆工具、帶自動壓縮。兩者幾乎是對立的兩端。
我們照它跑通了,兩道題同樣滿分。那官方備註的“略有不同”到底有多少?我們用同一批題跑了兩邊:
同一道多檔案重構題,標準模式走了 42 步,官方極簡模式走了 65 步(多 55%)。另一道終端修故障題,20 步對 27 步,多 35%。兩道題極簡模式都做對了,但改動密集那道題的成本高了 58%,累計的快取命中量是標準模式的 2.4 倍(它沒有上下文壓縮,65 步全累在一條鏈上)。
咱比喻一下,相當於只給你一把瑞士軍刀去修車,對比給你一整套工具箱。軍刀什麼都能幹一點,所以你確實能修好,但要多擰很多下。工具少不等於省,它是用步數換了工具數。
Everything is a Plugin
Everything is a Plugin那到底什麼是 Plugin?我理解其實就是 OS 和 APP 的關係,蘋果造 iPhone 的時候,根本不知道十年後會有個叫「小紅書」的 App。 核心沒變我只需要加強平台環境,能力卻無限長出來,這就是外掛能帶來的想像力。
dsh 把這件事推到了什麼程度呢?模型介面卡、工具登錄檔、會話日誌、沙箱策略、連派活的那個主循環本身,都是外掛,都能從配置裡換掉。聽上去都是附加能力嘛,但這和 skill 本質的不一樣是,skill 是教模型做事,但dsh 的外掛是能把底層都掀了,包括檔案系統後端、壓縮策略、循環驅動這些核心件。
而且它還多走了一步,也是自進化這個願景的實際工程落地:它給模型準備了五個工具,讓模型在運行中的處理程序裡自己寫外掛、掛載、執行、停止。
官方原文第一句:"The self-referential Cordis toolset: five model-facing tools over the live runtime in the current DSH process." 其中 cordis_define 讓模型自己寫一個包——名字、用途、宿主端程式碼,可選瀏覽器端程式碼;語法檢查後登記,使用者會在對話裡看到一張帶啟動按鈕的卡片;cordis_run 在一個 vm 沙箱裡執行它。
這相當於允許一個 App 在執行階段自己寫一個新 App,然後立刻裝進系統。而官方對這件事的說明非常坦誠:
沙箱只隔離全域對象,不是安全邊界 …… 宿主域的輔助函數使逃逸成為可能。把這套工具當作 bash 權限來對待。
也就是說它遞給你一把上膛的槍,同時非常認真地告訴你這把槍沒有保險栓。
實話說“一切皆外掛”做到這個程度,已經解釋不通了。因為外掛一直以來追求的是靈活性,但靈活是有邊際的。把工具做成外掛我懂,把壓縮策略做成外掛我也懂,但把派活的主循環也做成外掛、還專門給模型開一套“自己寫外掛”的工具,這已經超出方便使用者自訂能解釋的範圍了。
它有一個特性,可以把競品當子代理,也就是說可以讓 Claude、Codex 作為小弟來給 dsh 打工。我們把這條實測了一遍:
Claude 子處理程序真的被拉起來了,我們還抓到 Claude Code 正在 clone 它的官方外掛市場。所以這條路是真接到 Claude Code 二進制上的,不是配置擺設。但委派連續兩次失敗,返回 Error: subagent run failed。模型於是自己降級到普通子代理完成了任務,並主動交代了它換了工具、以及為什麼換。
V4 Pro和 Harness,是兩種完全不同的產品
用 V4-Pro和 用 dsh 是兩件不同的事。前者很簡單:拿個 API key,接進現在用的 Claude Code、Codex、OpenCode 就完事了(參考第二章那四個環境變數),大多數人需要的只是這個。而 v4-Pro 幾乎是一個產品了,成品交付到使用者手裡。但 dsh 卻完完全全是一個純粹的開發工具,絕對不是一個高度整合、封裝好一次性交付的產品。
用好 dsh 需要以下四樣東西:
- 你得會改配置,並且知道自己在改什麼。模型選那個、工具給幾個、上下文壓不壓、沙箱怎麼開,都在 YAML 裡,都沒有推薦設定這回事。
- 你得自己判斷該開那個模式。它給了你一個開關,工具是“直接調”還是“寫程序調”。而這個開關在我們兩道題上的結論是相反的:一道貴22%,一道省23%。這條分界線我們跑了四次才摸到。
- 你得能承受東西說變就變、而且出了問題沒人接。 它自己標著 developer preview,明寫會有破壞性變更。而 Issues 是關閉的,你不能提問題,只能自己看程式碼。它的架構文件第7行給的建議是:“建議用一個 agent 來探索這個程式碼庫。”
- 你得自己判斷安全邊界。就是上一章那把沒有保險栓的槍。它把風險寫得很清楚,但決定要不要開的是你。
總結一下:如果你是在右邊那一列,答案很乾脆:用 API 接你現在的工具,別裝 dsh。
我們有一發 92 萬 token 的請求在客戶端被超時 kill、本地什麼都沒落盤,但伺服器端已經完整處理並計費了,那 ¥9.00 就是這麼花掉的。客戶端超時不等於沒花錢,菜照做、錢照付,只是我沒吃上。還有一個正面觀察,雖然樣本只有一次:委派工具連續失敗兩次之後,模型沒有硬撐也沒假裝成功,它換了方案完成任務,並主動交代自己換了工具、以及為什麼。
回到上面那張表。你會發現 dsh 可能壓根沒打算服務這些場景。這就有意思了,為何 DeepSeek 交付的是這樣一個東西呢?
05. DeepSeek 把判斷權交給了誰?
一切從矛盾論開始,也從矛盾論結束,事物的本質就是矛盾的。解決一個矛盾,就產生新的矛盾,也就留下新的機會,如此循環。
以下就從這次研究和實測來聊聊我看到的 DeepSeek 解決和產生的新矛盾:
自由和選擇成本一起交給了使用者
事實是四條 API 欄位:Issues 功能關閉、外部 PR 總數為 0、只開了討論區、330 個 watch 對 85,268 個 star(資料抓取於 2026-08-14)。而倉庫裡帶著完整的 issue 治理流水線——policy、lifecycle、範本,連單測都寫了,就是沒開。
如果目標是讓豐富的個體自由創造,為什麼不接一個外部 PR?真正指向共同創造的開源都會張開手接貢獻。它的姿態好像是給你自由改,但別來跟我協作。像是宜家把板材、螺絲、圖紙全給使用者,但不接受使用者的任何改進建議。
但如果我們轉換視角,在經歷上面這些拆解和研究後你會發現,在它的假設下這其實是自洽的。如果每個人都知道自己要什麼,那提 issue 讓我改本身就是多餘的,你直接拿去改你自己那份不就好了。
我們實測了兩道同樣的題,但結果方向相反:
多檔案重構那道題,寫程序模式貴 22%、慢 34%;終端修故障那道題,省 23%、快 38%。為什麼?工具呼叫次數確實降了(67 次到 44 次),但輸出 token 漲了 42%、思考 token 漲了 53%。官方自己也留了餘地說Code Mode “並不承諾普遍減少 token”。
也就是說你究竟想要什麼,你能付出多大的代價,這都需要你自己想清楚,或者親自去嘗試摸清楚。就好像那句話說的,自由不等於繁榮,如果你不是對自由有著極其強大的掌控能力,那結果很可能不盡人意。
DeepSeek 把選擇權給你的同時,也把做出這些選擇所需要的認知成本交給了你。
Harness 到底是給人用的,還是給模型用的?
從上圖也可以看出,這個程式碼庫是按對 Agent 友好而不是對人友好來組織的。九條證據全是公開原始碼,任何人都能驗。至於他們這麼做是為了讓模型自主迭代,(當然這是我的判斷,並不是官方說法)。回到之前的問題,“一切皆外掛”做到“連主循環都能換、還給模型開一套自己寫外掛的工具”這個程度,用“方便使用者自訂”是解釋不通的。但換一個假設就全通了:如果它期待的使用者不是人,而是模型自己呢?
一個要長期自己跑、自己改自己的系統,需要的恰恰是這些:
- 每一環都可替換(不然改不動)
- 決策全部留痕(686 篇,連被否決的 11 篇都留著)
- 測試比原始碼還多且每個檔案 100% 覆蓋(不然改壞了沒人知道)
- 包拆得極碎(改動面才小)
- 單位成本壓到極限(不然跑不久)
在這個假設下,這幾處矛盾也全部順理成章。關掉 Issues 的假設是如果迭代的主體是模型,人提的 issue 本來就不在這條鏈路上。為最高遠的目標做最瑣碎的事情的假設是長期模型自己跑,單位成本就是天花板。
我也算在產品崗位上摸爬滾打多年的老人了,我理解的產品是建立在對使用者的 N 多判斷和假設之上的。使用者是誰、他要幹什麼、他會先點那裡、他願意為那一步多等三秒,每一個預設值背後,都是我們替他做完的判斷。但我發現 DeepSeek 拒絕做這些判斷。
它沒有推薦設定、沒有默認模式、不告訴你那個開關該開,因為給你一個預設值,就等於替你判斷了一次。比如 iOS 是平台,可 iPhone 對普通使用者是完全可用的成品,你不裝任何 App,開機就能打電話、拍照、上網。蘋果做了兩層:對開發者是平台,交出判斷權;對使用者是產品,承擔判斷。易上手難精通的真正含義,就是這兩層同時存在。
而 dsh 只做了平台那一層。也就是說它是一個只有核心、沒有出廠系統的 OS。真正的對照物是 AOSP——手機廠商拿它去做自己的發行版,HyperOS、OriginOS 都是這麼來的。AOSP 也不接你的 issue,你 fork 走自己維護。從這個角度看,關掉 Issues 不是傲慢,是這種模式的常態。
【交付四級階梯】
蘋果幾十年都在致敬極富創造力的人,但它交付的始終是產品。同樣相信使用者有創造力,一家替你鋪路,一家把零件遞給你。沒有誰優誰劣,只有不同的選擇,僅此而已。DeepSeek對世界的判斷是它假設面前的主體是自主的,無論那個主體是人,還是模型。
我覺得最終的主要矛盾我覺得可以用一句話總結:DeepSeek 交還判斷權的徹底程度,同接過這份判斷權所需的能力與成本之間的矛盾。
矛盾恰恰出在徹底上。不徹底就不矛盾了,給一半自由、留一套預設值,那是 Claude Code 的做法。而它把判斷權完整交還出去,包括那些你不知道自己需要判斷的地方(該開那個模式、默認模型是那個、那把槍有沒有保險栓)。事實上主體並不總是具備承接這份判斷權的條件。
那它為什麼會這麼選?我想至少有三個解釋:
第一層:他們沒有做產品的資源和意願。團隊構成是研究者,算力和人都壓在模型上。(社區有很多人直呼讓他們招一個產品經理吧,因為 dsh 用起來確實折磨人。
第二層:產品化的邊際收益太低。C 端使用者趕都趕不走,B 端靠 API 就夠了。
第三層:產品的前提是替使用者做判斷,而他們選擇不做這個判斷。 可能因為判斷不了,也可能因為他們真的認為人的想法足夠多樣,不該被一套預設值收攏。
我傾向第三個解釋,只有它能同時解釋模型側和使用者側。前兩個解釋不了為什麼要專門給模型做一套自己寫外掛的工具(這其實挺費力不討好的)它是一個交付給自主主體的零件箱,而這一代最重要的自主主體,可能不是現在的我們。沒準是針對未來的模型或者人們。(一瞬間就科幻起來了。)
我自己是做產品的,其實產品經理的工作就是替使用者做那些假設。所以把這套東西看完,我自然而然的想到,如果不做假設是一種更尊重人的姿態,那我這個崗位的意義是什麼?我想,做假設的本質是替使用者承擔認知成本。DeepSeek 把這個成本還給了我們,蘋果替我們吃掉了它。
兩種都是選擇,代價不同而已,最終取決於人們想要什麼,還有這家公司相信什麼?
這篇文章本身也是一個組合的產物。四道自造題、七次運行、兩輪實測,所有結論都只在這個特定組合裡成立。而且我們從開始全程都在問它能不能幹活,直到很晚才意識到該問一句:它是給誰做的,我適合用嗎?
回頭看 V4 Pro 和 DeepSeek Harness,這次真正有意思的或許不只是一個模型又變強了多少。模型越來越強、上下文越來越長、Agent 能做的事情越來越多之後,新的問題也隨之出現:能力該怎麼用,成本該花在那裡,那些判斷應該交給產品,那些又應該留給人,甚至留給模型自己。DeepSeek 給出的答案並不輕鬆——它把更多能力開放出來,也把更多選擇和責任一起交了出去。當 AI 開始能夠獨立完成越來越複雜的工作,真正稀缺的可能不再只是更強的模型,而是知道自己究竟想讓它做什麼,以及願意為這種自由承擔什麼代價。 (雷峰網)
