DeepSeek 終於出了多模態:V4-Flash-Vision-Exp千呼萬呼終出來

AI速讀
DeepSeek 近日推出 V4-Flash-Vision-Exp 多模態視覺模型,標誌著其 AI 能力從推理、編碼擴展至視覺理解。分析指出,視覺能力讓 AI 能直接讀取螢幕介面,打破對傳統 API 的依賴,大幅擴展 Agent 的應用場景。同時,DeepSeek 與具身智能領先企業宇樹科技的戰略合作,預示著「大腦(模型)」與「身體(機器人)」的結合,有望將 AI 從數字空間推向物理世界,共同開發真正的世界模型(World Model)。

二十多年前,梁文鋒在浙江大學研究機器視覺。

2026 年 8 月,DeepSeek 成為宇樹科技戰略投資者。

8 月 31 日,DeepSeek 開源 DeepSeek-V4-Flash-Vision-Exp,這是 V4 系列第一個實驗性多模態視覺模型。

幾個時間點放在一起,很有意思。

DeepSeek 過去最鮮明的標籤一直是推理、Coding、效率和 Agent。現在,視覺進來了。

模型開始看到圖片、螢幕、圖表和環境。

表面上只是多了一種輸入,往後走,卻可能打開完全不同的空間。

01. 二十多年後梁文鋒又回到了機器視覺

梁文鋒 17 歲進入浙江大學,本科讀電子資訊工程,之後繼續攻讀資訊與通訊工程碩士,研究方向進入機器視覺。

那時還沒有 Transformer,沒有 ChatGPT,也沒有今天的大模型。

當年的問題很基礎:機器怎麼從圖像裡提取資訊,怎麼識別自己看到的東西。

二十多年後,問題已經往前走了很遠。

模型會讀、會寫、會推理、會寫程式碼,也開始呼叫工具完成任務。視覺進入以後,機器開始更直接地面對環境。

今天的多模態大模型和二十年前的機器視覺當然已經是完全不同的技術體系,不能簡單畫一條因果線。

但那個問題一直留在那裡:

機器看到世界以後,到底能理解多少。

二十多年後,這個問題以新的方式回到了 DeepSeek。

02. V4 長出了眼睛Agent 的邊界也跟著變了

DeepSeek-V4-Flash-Vision-Exp 建立在 V4 Flash 上,加入視覺模組,再通過持續訓練獲得圖片理解能力。

它可以識別截圖、分析圖表、讀取介面,也可以和 Agent 工具一起工作。

更值得看的是,加入視覺以後,原來的文字 Agent、推理和世界知識能力基本保持。

一個已經會推理、會 Coding、會呼叫工具的 Agent,現在開始自己看環境。

DeepSeek 公佈的 Benchmark 也很克制。

Terminal Bench 2.1 上,V4 Vision 得分 83.9,Claude Opus 4.8 為 85.0;DeepSWE 上,DeepSeek 59.3,Opus 4.8 為 58.0;NL2Repo 上,DeepSeek 57.7,Opus 4.8 為 69.7。

有輸有贏。

距離全面超過 Claude 還有距離。

但這幾分高低並不是最值得看的地方。

視覺和 Agent,開始真正接上了。

03. 眼睛 可能是人類最大的 API

今天很多 Agent 能工作的前提,是數字世界先把自己整理成 AI 容易理解的樣子。

軟體要有 API,工具要接 MCP,資料最好已經結構化。

可人類日常操作軟體,並不需要這些前置條件。

一個銀行櫃員面對十年前開發的系統,照樣可以操作。一個財務人員打開 ERP,看一眼頁面就知道下一步點那裡。一個營運人員進入後台,看數字、看異常、點按鈕,然後繼續處理。

這些系統從來沒有給人的大腦開放 API。

眼睛,就是人類最大的 API。

API 連接的是已經為機器整理過的世界,視覺可以直接面對原本就存在的世界。

這個差別很大。

全世界有海量老系統、桌面軟體、網頁和企業內部工具,從來沒有為 AI 重構過,也不可能為了 AI 全部重寫。

如果 Agent 能可靠看懂螢幕,它能進入的工作場景會迅速擴大。

以前,企業要先改軟體,讓 AI 能用。

以後,AI 也會開始學習直接使用那些已經存在的軟體。

視覺 Agent,可能是在給 AI 打開整個存量軟體世界。

這比“模型會看圖片了”大得多。

04. 多模態是兆級公司的標配 宇樹就在旁邊

一家大模型公司走到 DeepSeek 今天的位置,多模態已經很難缺席。

語言讓模型進入人類已經記錄下來的知識世界,Coding 讓模型進入軟體,視覺繼續把邊界推向圖片、視訊、介面和環境。

再往前,就是空間、機器人和真實世界。

多模態越來越像兆級大模型公司的標配。

對 DeepSeek 來說,它也可能是繼續打開兩兆、三兆級想像空間的一張必選票。

市場最終看的,不只是某一輪 Benchmark,而是這家公司還能把智能帶進多少新的世界。

更有意思的是,宇樹已經在旁邊。

就在 Vision 發佈前不久,DeepSeek 成為宇樹科技科創板 IPO 的戰略投資者,雙方合作方向裡已經寫進大模型、具身智能和通用機器人。

這件事在 Vision 發佈以後再看,味道變了。

DeepSeek 有模型、有推理、有 Agent,現在開始有視覺。

宇樹有機器人本體、運動控制、感測器,也一直在真實世界裡產生資料。

一個開始擁有越來越強的大腦和眼睛,一個已經擁有可以走進物理世界的身體。

而且兩家都在杭州。

資本和戰略合作已經把它們連在了一起。

目前沒有公開證據說明 DeepSeek 和宇樹已經在共同開發 World Model。

但問題已經可以提出來了:

杭州這兩家 AI 巨頭,會不會真的聯手,把模型從數字世界帶進物理世界?

05. 下一站 會不會是真正的 World Model

語言模型主要學習人類已經記錄下來的世界。

World Model 還要理解一件更難的事:

我做了什麼,世界隨後發生了什麼。

機器人恰好每天都在產生這種資料。

它看到環境,身體做出動作,現實世界給出結果。

一次成功、一次失敗、一次碰撞、一次移動,都在告訴模型:一個動作之後,世界會發生什麼變化。

如果這些資料有一天和視覺、推理、行動形成閉環,模型開始學習的,就會越來越接近現實世界本身的規律。

這也是 DeepSeek 和宇樹這條線最讓人期待的地方。

二十多年前,梁文鋒研究的是機器如何看見。

今天,DeepSeek 已經有了越來越強的推理和 Agent 能力,現在又開始擁有視覺。

旁邊,宇樹已經讓機器人可以跑、跳、操作並進入真實環境。

如果有一天,這兩條線真的連起來,問題就會從“模型能不能看見”繼續往前走:

機器看見以後,能不能理解這個世界會發生什麼,並據此行動。

到那時候,眼睛可能真的會成為 AI 最大的 API。

而 DeepSeek 的下一站,也許才會開始接近一個真正的 World Model。 (Space AIThinker)