Claude Code、Codex子代理體系擴容。
智東西8月20日報導,昨夜,DeepSeek Harness迎來公測後的首次重要更新。DeepSeek Harness v0.1.0-rc.8版本上線,多模態能力成為這次更新的重頭戲。
此次更新共帶來14項調整,覆蓋多模態輸入、子代理協作、終端體驗、工具呼叫和開發者支援等多個方向,既補齊了Agent處理圖片等多模態任務的能力,也進一步完善了子代理協作、終端互動和工具呼叫體驗。
新版支援原生圖片請求和圖文混合輸入,/goal、/plan等命令也可以直接接收圖片;與此同時,Claude Code、Codex進一步接入其子代理體系,Windows終端體驗以及圖片請求、流式生成、自訂閘道器等一批問題也得到修復。
DeepSeek Harness於8月13日正式開啟v0.1版本公測並同步開源。公測當晚,智東西曾第一時間拉取原始碼進行實測,用它完成88頁論文翻譯、貪吃蛇遊戲開發等任務。
僅過去不到一周,這套Agent Harness又把多模態補上了。這次更新很快引起了DeepSeek Harness社區討論。
有國內開發者看到更新後直接感嘆:“DSH支援多模態了,奔走相告!”
海外開發者同樣把注意力放在這兩項能力上。有網友評價稱,DeepSeek Harness正變得“越來越有意思”,多模態支援和更完善的子代理整合是一次明顯推進。
更有意思的是,有開發者進一步扒出了DeepSeek Harness的“看圖”方式:面對本身不支援圖像輸入的模型,它還能呼叫OCR、顏色統計、像素掃描等工具,把圖片拆成結構化資訊後再交給文字模型推理,相當於給純文字模型拼出一套工具層的“視覺”。
GitHub:
https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8
01. 多模態正式補齊,直接“看圖”
rc.8最明顯的變化,就是DeepSeek Harness進一步補齊了多模態輸入。
根據官方更新日誌,DeepSeek模型介面卡現在可以通過配置啟用原生圖片請求。對於具備視覺能力的模型,Harness可以直接把圖片送進模型;/goal、/plan等指令也已經支援圖文混合輸入。
同時,輸入框中的@菜單新增檔案和會話引用,使用者可以直接把本地檔案、已有會話等內容拉進當前任務。
這意味著,過去主要圍繞文字、程式碼和工具呼叫展開的Agent工作流,現在可以進一步把截圖、圖片等視覺資訊納入任務上下文。
子代理體系也繼續擴充。
新版支援把Claude Code和Codex作為Profile Bundle按需安裝。其中,Codex支援非互動權限模式以及多個命名實例,方便在同一個任務中配置不同Codex子代理。
Windows使用者這次也被重點照顧。DeepSeek Harness的PTY終端加入持久PowerShell會話,並在極簡模式預設中默認開啟,減少命令執行過程中頻繁重建終端環境的問題。
除了新能力,這次更新還集中修掉了一批公測後暴露的問題。
比如,當單張圖片尺寸過大,或者歷史會話中累積圖片過多時,此前可能導致模型請求直接失敗;新版對此進行了處理。
取消一次流式生成後,已經顯示出來的回覆前綴此前也可能不會被帶入下一輪提問或者分叉會話,這一問題目前已經修正。
對於使用自訂OpenAI相容閘道器的開發者,新版還修復了部分閘道器因請求格式差異而無法呼叫,以及推理內容回傳缺失的問題。
02. 純文字模型也能“看圖” OCR和像素分析拼出工具層視覺
DeepSeek Harness補上原生圖片請求之外,一個有意思的細節很快被開發者扒了出來。
網友Yinsen測試DeepSeek Harness處理圖片時發現,當所呼叫的模型本身沒有聲明圖像輸入能力,直接呼叫read_image會首先失敗。
但任務並沒有就此停下。從其展示的執行軌跡來看,Harness隨後會退化到另一套工具鏈:先進行OCR文字辨識,再統計圖片中的顏色比例、掃描部分像素行,同時讀取圖片尺寸、色彩模式等元資訊。
例如,一張包含文字和簡單圖形的圖片,可以被拆成“文字內容及坐標”“背景顏色比例”“特定區域像素變化”“圖片尺寸”等多組資訊。
最後,這些結構化結果會被重新交給文字大模型,讓模型根據OCR文字、顏色佔比、像素位置等證據“腦補”出整張圖的大致內容。
因此,這種能力和視覺大模型直接理解圖片仍然有明顯區別。對於PPT截圖、流程圖、介面截圖等結構相對明確的圖片,它可以借助OCR和像素特徵得到不少有效資訊;面對真實照片、複雜空間關係等內容,這種工具鏈能夠恢復的資訊則會受到明顯限制。
但從Agent Harness的角度看,這個設計頗有意思:視覺能力並不完全綁死在底座模型上,工具也可以承擔一部分感知工作。
事實上,在官方加強多模態支援之前,DeepSeek Harness社區已經圍繞視覺能力出現了一批外掛,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通過pi2dsh橋接的pi-vision等。
其中一些方案就是通過OCR、像素分析、結構化證據或者獨立視覺子代理,讓純文字模型間接處理圖片;也有開發者通過自訂路由,為本身支援視覺的模型配置input: [text, image],直接接收圖片。
rc.8上線後,原生多模態模型和這類工具層視覺方案可以進一步配合使用。
03. 上線不到一周加速迭代 盯上了多模態和子代理
8月13日公測時,DeepSeek Harness團隊就強調,其核心設計思路是“一切皆外掛”:模型、工具、技能、會話、沙箱、記憶體、循環、調度和UI等Agent能力,都可以由不同外掛組合和替換。當Agent Harness擁有越來越豐富的工具和子代理後,一些原本依賴單個模型能力的任務,也可以通過工具編排被重新拆解和實現。
此次rc.8又繼續強化了這種外掛化思路:視覺模型可以原生接收圖片,純文字模型也能借助視覺工具獲得部分圖像資訊;Claude Code和Codex則可以作為子代理按需裝進同一套Harness中。
除了這些核心變化,rc.8還加入了web_search並行查詢、子代理reportDelivery及時喚醒父任務、本地運行dsh web自動打開瀏覽器等最佳化,並提升了大型歷史會話分叉以及SQLite後端的讀寫性能。
04. 結語:一切皆外掛 把模型能力“拆開重組”
從8月14日開放公測,到如今把多模態和更多子代理能力裝進來,DeepSeek Harness仍處於快速迭代階段。
接下來值得期待的,是這套外掛化Harness能否繼續把更多模型、工具和Agent裝進同一個體系,並跑出更複雜、更穩定的任務流程。 (智東西)
