DeepSeek多模態模式相信有很多人已經灰度到了,對應的技術報告也來了,可以說DeepSeek 解決了可靠且廉價的電腦代理的最後一個難題DeepSeek放出了一篇新論文,解決的是多模態大模型裡一個被長期忽視的根本性問題。不是看不清圖,而是說不清位置。論文名叫 Thinking with Visual Primitives(基於視覺原語的思考),來自DeepSeek、北大和清華的聯合團隊。paper:https://github.com/deepseek-ai/Thinking-with-Visual-Primitives/blob/main/Thinking_with_Visual_Primitives.pdf問題出在那裡現有的多模態大模型,推理過程基本被鎖死在文字空間裡。模型用Chain-of-Thought(CoT)一步步推導,聽起來很合理,但有個致命缺陷:語言本身是模糊的,它沒辦法精確指向圖像裡某個具體位置。比如你問模型:圖裡左邊那個小杯子旁邊的那個東西是什麼顏色?模型的語言推理鏈條很快就會亂掉,它"想著"一個物體,實際上卻已經搞混了另一個。這就是論文裡定義的Reference Gap(指代鴻溝)。和它對應的是另一個已經被廣泛研究的問題:Perception Gap(感知鴻溝),即模型看不清高解析度圖像裡的細節。前者已有不少工作在做,比如高解析度裁切、動態分塊。但後者一直沒有被正面解決。論文的核心判斷是:就算感知做到完美,只要指代還靠自然語言,模型在密集計數、複雜空間推理、拓撲導航這類任務上就會持續出錯,產生連鎖幻覺。DeepSeek解法:讓模型一邊想一邊指DeepSeek的方案叫 Thinking with Visual Primitives,思路:把空間標記,也就是點(point)和邊界框(bounding box),升格為"最小思維單元",直接插進模型的推理鏈條裡。人類數一堆密集的東西時,會用手指逐個點過去。這個框架做的事情和這個一樣:模型每推理一步,就可以在圖上"戳一下",把抽象的語言思維錨定到圖像的物理坐標上。兩種視覺原語各有分工:邊界框適合捕捉具體物體的位置和大小;點則更適合抽象的視覺指代,比如軌跡追蹤或拓撲推理中的路徑節點。架構:極致的token壓縮這套框架建立在一個對token效率做到極致的架構上。語言骨幹是 DeepSeek-V4-Flash,總參數284B,推理時啟動參數13B。視覺編碼用的是 DeepSeek-ViT,一個從頭訓練的ViT,支援任意解析度輸入。它先用14×14的patch大小把圖像切成patch token,然後在ViT輸出端用3×3空間壓縮,把每9個相鄰patch token合併成1個。進入LLM之後,還有一層 Compressed Sparse Attention(CSA) 機制,對視覺token的KV cache再壓縮4倍。整體下來的壓縮比是7056倍。舉個具體的數字:一張756×756的圖,原始像素展開是571,536個,經過patch embedding變成2,916個ViT token,3×3壓縮後變成324個,進入LLM後KV cache裡只剩81個視覺條目。如圖所示,處理一張800×800的圖,本文模型消耗約361個token(KV cache裡只有約90條),而Claude-Sonnet-4.6需要約870個,Gemini-3-Flash需要約1100個,GPT-5.4需要約740個。token用量不到競品的三分之一,但在7個基準測試上的平均分是77.2%,高於Gemini-3-Flash的76.5%和GPT-5.4的71.1%。訓練:四個階段,從專才到通才訓練流程分為預訓練和後訓練兩大階段預訓練目標是讓模型學會輸出視覺原語。訓練資料來自大規模網路爬取。僅在Huggingface上,團隊就用官方API篩選了帶有Object Detection或Grounding標籤的資料集,按熱度排名初篩,排除所有驗證集和測試集,再用LLM agent解析README檔案,統一格式。最終爬取了97,984個box grounding相關資料來源。原始資料質量參差不齊,團隊設計了兩步過濾流程:第一步是語義審查,用MLLM自動識別並丟棄三類問題資料:無意義的機器碼和亂碼標籤、無法泛化的私有實體(比如MyRoommate這類私人稱呼)、歧義縮寫和主觀評價(比如工業檢測裡的OK/NG)。這一步從97,984個源過濾到43,141個。第二步是視覺幾何質量審查,排除三類標註缺陷:嚴重漏標(漏標率超50%)、嚴重截斷或偏移(切掉了物體關鍵視覺特徵)、無意義的超大框(覆蓋超過90%圖像面積,通常是圖像分類資料被強行轉成檢測資料)。過濾後剩31,701個資料來源。最終通過類別均衡採樣,得到超過4000萬個高品質樣本。格式上,box grounding任務的prompt範本類似於:Locate TARGET in this image and report its bounding box coordinates,響應格式使用特殊token包裹坐標,坐標歸一化到0到999的離散整數。point任務同理,但響應不要求輸出物體名稱,以便將點標記擴展到軌跡等更抽象的概念。後訓練:冷啟動資料後訓練需要少量但高精度的冷啟動資料。團隊圍繞四類任務建構這些資料:1. 計數(Counting)分粗粒度和細粒度兩類,如圖粗粒度計數:聚合多個密集檢測資料集,過濾掉物體過密、框太小、召回率低的樣本,用MLLM生成推理內容,分三步走:意圖分析、批次定位(同時找出所有候選物體)、基於視覺原語統計求和。細粒度計數:因為公開資料集太少,團隊基於GQA資料集建構了專屬流程,用MLLM生成帶有屬性約束的計數問題,再合成包含視覺原語的推理鏈。同時建構了ground truth為零的負樣本,增強模型抗幻覺能力。冷啟動計數資料共約10,000條。2. 空間推理和通用視覺問答如圖所示,資料來源包括自然場景(基於GQA)和合成場景(基於CLEVR工具鏈,支援可控場景生成和多跳推理)。還建構了負樣本,當查詢的物體或關係不存在時,模型學會基於視覺證據給出忠實的拒絕回答。共約9,000條冷啟動樣本。3. 迷宮導航如圖所示,這是為瞭解決純語言CoT無法精準描述不規則形狀軌跡的問題。迷宮用DFS、Prim和Kruskal演算法生成,確保路徑不能被輕易猜到。設計了三種拓撲結構:矩形網格、同心圓形迷宮、六邊形蜂巢迷宮。同時設計了無解迷宮,方法是先生成有解迷宮,找到解路徑後,在路徑中段故意放置幾堵牆,使迷宮看似可解但實際需要完整搜尋才能確認無解。難度通過網格大小控制:簡單迷宮只需串聯少量本地連通性檢查,最難的噩夢級迷宮需要持續追蹤數百步而不丟失已探索區域資訊。推理內容記錄了基於DFS的探索過程,每一步都用point坐標錨定到圖像上。共生成460,000條冷啟動樣本。4. 路徑追蹤如圖所示,任務是在一堆相互纏繞的線條中,沿指定曲線追蹤到它的終點。圖像由多條貝塞爾曲線生成,每條連接一個標記起點和終點。關鍵挑戰在於交叉點消歧:在兩條線交叉的地方,模型必須判斷那個分支是目標曲線的延續。設計了純色統一風格模式,所有線條顏色和粗細相同,強迫模型只靠曲率連續性判斷,而不是靠顏色捷徑。推理內容用一系列坐標序列表示追蹤過程,在曲率大或交叉密集的區域坐標點更密,在平直段坐標點更稀疏,模仿人類在視覺複雜區域放慢注意力的行為。共生成125,000條冷啟動樣本。後訓練流程:專才訓練再合併後訓練採用專才訓練後合併的策略,分四個子階段:專項SFT:訓練資料由70%通用多模態和純文字資料、30%視覺原語專項資料構成。box(thinking with grounding)和point(thinking with pointing)分開訓練,避免在專項資料量較少時產生模式衝突,分別得到專才模型FTwG和FTwP。專項RL:對FTwG和FTwP分別獨立進行強化學習,使用GRPO演算法。設計了三類獎勵模型同時監督:格式RM(規則型,驗證視覺原語格式是否正確,同時檢查是否存在重複框)、質量RM(基於LLM的生成式獎勵模型,檢查回答冗餘、思維與回答是否一致、是否存在自相矛盾、獎勵駭客行為等)、精準性RM(針對不同任務定製)。計數任務的精準性獎勵採用平滑指數衰減函數,對接近正確的預測輕懲,對偏差大的預測重懲,而非簡單的二值精確匹配。迷宮導航的獎勵分解為探索進展、探索完整性、穿牆懲罰、最終路徑有效性、答案正確性五個分項,確保獎勵訊號密集且資訊豐富。路徑追蹤的獎勵包含雙向軌跡評估:正向懲罰偏離真實路徑的預測點,反向懲罰模型跳過的路徑段,兩者缺一不可。RL結束後,將資料池按難度分為三級:所有N次rollout全對(Easy)、部分對(Normal)、全錯(Hard),只選Normal級資料用於GRPO訓練。訓練完成得到專才模型ETwG和ETwP。統一RFT:用ETwG和ETwP對資料池做rollout,生成RFT資料,保留所有Normal級樣本,隨機子採樣5%的Easy級樣本防止災難性遺忘,重新從預訓練基礎模型初始化訓練一個統一SFT模型F。On-Policy Distillation(OPD):RFT模型F相比專才模型ETwG/ETwP仍有性能差距。用線上蒸餾彌合這一差距,讓學生模型基於自己生成的軌跡學習教師模型(ETwG和ETwP)的輸出分佈,使用全詞表logit蒸餾,損失函數為反向KL散度的加權求和。實驗結果模型在多個任務上達到前沿水平:計數任務:Pixmo-Count上以89.2%的精確匹配率超過Gemini-3-Flash的88.2%,在DS_Finegrained_Counting上以88.7%超過Qwen3-VL-235B-A22B的87.2%。空間推理和通用VQA:在SpatialMQA(69.4% vs 67.0%)、MIHBench(85.3% vs 83.5%)、DS_Spatial_Reasoning(98.7% vs 97.2%)上均排名第一。拓撲推理:這是本文最突出的貢獻之一。所有前沿模型在DS_Maze_Navigation上的得分都在50%上下浮動,而本文模型達到66.9%。DS_Path_Tracing上,本文模型56.7%,排名第二的GPT-5.4隻有46.5%,Claude-Sonnet-4.6是30.6%。論文指出,這說明多模態大模型在拓撲推理上仍有大量提升空間。定性結果方面,如圖所示,在使用邊界框作為視覺原語的任務上,模型展示了粗粒度計數、細粒度計數、反常識視覺問答(判斷天平兩側那個更重)、世界知識關聯(識別金門大橋後判斷附近是否有NBA球隊)、行動建議(根據咖啡機和原料給出拿鐵製作步驟)等能力。此外,儘管後訓練的視覺原語資料不包含任何中文語料,模型仍能用中文進行思考和回答,這來自基礎模型繼承的多語言能力。如圖在使用點作為視覺原語的任務上,模型能對迷宮生成逐步DFS探索軌跡,並對路徑追蹤任務生成完整的坐標序列追蹤過程。侷限性論文也列出了三個當前的侷限:第一,受輸入解析度限制,模型在極細粒度場景下的視覺原語輸出精度有時不夠高。論文認為可以通過和現有解決感知鴻溝的方法結合來彌補。第二,當前的視覺原語思維能力依賴顯式的觸發詞才能啟動,未來目標是讓模型根據具體情境自主判斷是否呼叫這一機制。第三,用點作為視覺原語來解決複雜拓撲推理問題仍然困難,模型的跨場景泛化能力有限,這是重要的未來研究方向。訓練框架使用的是High-flyer的HAI-LLM(https://www.high-flyer.cn/en/blog/hai-llm),一個基於PyTorch的輕量級分佈式訓練框架。預訓練階段使用64K序列長度和FP8精度,後訓練階段序列長度擴展到256K,在Unified RFT和OPD階段使用FP4(MXFP4)量化。 (AI寒武紀) 李飛飛博士於 2025 年 11 月發表長文《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》。這是其深耕 AI 領域 25 年的重要思考結晶。全文以圖靈 “機器能思考嗎” 這一經典問題開篇,指出當前以大語言模型為代表的 AI 雖在抽象知識處理上成績斐然,卻存在脫離現實物理世界的短板。文章系統闡釋了空間智能的定義與核心價值,將其定位為支撐人類認知、創造力與文明進步的核心能力,同時提出建構具備生成性、多模態性和互動性的 “世界模型” 是解鎖空間智能的關鍵,還勾勒出空間智能從賦能創意到革新機器人技術,再到推動科學醫療突破的應用演進路徑,為 AI 下一個十年的發展指明了方向。In 1950, when computing was little more than automated arithmetic and simple logic, Alan Turing asked a question that still reverberates today: can machines think? It took remarkable imagination to see what he saw: that intelligence might someday be built rather than born. That insight later launched a relentless scientific quest called Artificial Intelligence (AI). Twenty-five years into my own career in AI, I still find myself inspired by Turing’s vision. But how close are we? The answer isn’t simple.1950年,當電腦還僅僅停留在自動化運算和簡單邏輯運算的層面時,艾倫・圖靈提出了一個至今仍能引發廣泛共鳴的問題:機器能思考嗎?他能洞察到常人未及的可能性,這需要非凡的想像力 —— 智能或許有朝一日能夠被創造出來,而非天生就存在。這一深刻見解隨後開啟了一場名為人工智慧的不懈科學探索。在我投身人工智慧領域的第二十五個年頭,圖靈的這一願景依舊在不斷給予我啟發。但我們如今距離那個目標究竟還有多遠?答案並非簡單就能說清。以 AI 領域的源頭性問題切入,奠定了全文的思辨基調。李飛飛通過回溯圖靈的經典疑問,既致敬了人工智慧的啟蒙思想,又巧妙地引出了核心矛盾 —— 經過數十年發展,AI 仍未完全實現 “機器思考” 的終極目標。她強調智能 “可被建構” 的核心觀點,既是對後續探討空間智能 “可被研發” 的理論鋪墊,也暗示當前 AI 發展尚未觸及智能的核心本質,為後文批判大語言模型的侷限性埋下伏筆。Today, leading AI technology such as large language models (LLMs) have begun to transform how we access and work with abstract knowledge. Yet they remain wordsmiths in the dark; eloquent but inexperienced, knowledgeable but ungrounded. Spatial intelligence will transform how we create and interact with real and virtual worlds—revolutionizing storytelling, creativity, robotics, scientific discovery, and beyond. This is AI’s next frontier.如今,以大語言模型為代表的前沿人工智慧技術,已經開始改變我們獲取和運用抽象知識的方式。然而,這些模型就如同在黑暗中雕琢文字的匠人:能言善辯卻缺乏實踐經驗,學識淵博卻沒有堅實的現實根基。而空間智能將徹底改變我們創造以及與現實和虛擬世界互動的模式 —— 它會給敘事創作、創意設計、機器人技術、科學發現等諸多領域帶來革命性變革。這,正是人工智慧的下一個前沿陣地。這裡點出,當前 AI 的核心短板並拋出全文核心論點。作者用 “黑暗中的文字匠” 這一形象比喻,深刻揭露了大語言模型的致命缺陷:僅擅長文字層面的資訊處理,卻脫離對物理世界的真實感知與互動能力。同時,她明確將空間智能定義為 AI 的下一個前沿,打破了當下 AI 研發集中於文字多模態擴展的侷限,為行業指出了從 “語言理解” 向 “世界感知” 跨越的全新方向。The pursuit of visual and spatial intelligence has been the North Star guiding me since I entered the field. It’s why I spent years building ImageNet, the first large-scale visual learning and benchmarking dataset and one of three key elements enabling the birth of modern AI, along with neural network algorithms and modern compute like graphics processing units (GPUs). It’s why my academic lab at Stanford has spent the last decade combining computer vision with robotic learning.自進入人工智慧領域以來,對視覺與空間智能的探索一直是指引我前行的北極星。這也是我耗費數年時間建構 ImageNet 資料集的原因 ——該資料集是首個大規模視覺學習與基準測試資料集,與神經網路演算法以及圖形處理器這類現代計算裝置一起,共同構成了催生現代人工智慧誕生的三大核心要素。同樣出於這個初衷,我在史丹佛大學的學術實驗室,在過去十年間始終致力於將電腦視覺與機器人學習相結合的研究。該段落通過結合自身學術經歷,增強了論點的可信度與說服力。李飛飛將自己建立 ImageNet 的行為、實驗室的研究方向與空間智能探索強繫結,既體現了她對這一領域研究的連貫性與執著,也從側面印證了空間智能的重要性 —— 畢竟 ImageNet 作為現代 AI 的三大基石之一,其核心價值正是為機器提供視覺感知的基礎,而這正是空間智能的重要組成部分。這一段落也為後文介紹 World Labs 的研發目標做了背景鋪墊,展現出其研究理念的一脈相承。Generative AI models such as LLMs have moved from research labs to everyday life, becoming tools of creativity, productivity, and communication for billions of people. They have demonstrated capabilities once thought impossible, producing coherent text, mountains of code, photorealistic images, and even short video clips with ease. It’s no longer a question of whether AI will change the world. By any reasonable definition, it already has.以大語言模型為代表的生成式人工智慧模型,已經從科研實驗室走進了人們的日常生活,成為數十億人用於激發創意、提升效率與日常溝通的工具。這些模型展現出了曾經被認為難以企及的能力,能夠輕鬆生成邏輯連貫的文字、海量的程式碼、高度逼真的圖像,甚至是短影片片段。如今,問題已不再是人工智慧是否會改變世界。以任何合理的標準來衡量,它都已經做到了這一點。李飛飛在此處先客觀肯定了生成式 AI 的巨大成就,避免了因強調空間智能而全盤否定現有技術的片面性。她列舉文字、程式碼、圖像等生成能力,既符合大眾對當前 AI 的認知,也為後文轉折做了鋪墊。這種先揚後抑的表述方式,能讓讀者更易接受後續關於 AI 短板的論述 —— 承認現有技術的價值,才能更好地理解為何需要向空間智能方向突破,而非停留在現有成果上。Yet so much still lies beyond our reach. The vision of autonomous robots remains intriguing but speculative, far from the fixtures of daily life that futurists have long promised. The dream of massively accelerated research in fields like disease curation, new material discovery, and particle physics remains largely unfulfilled.然而,仍有諸多目標至今我們仍難以實現。自主機器人的願景雖然充滿吸引力,但依舊停留在推測階段,與未來學家們長期以來描繪的、成為日常生活中常見設施的場景相去甚遠。而在疾病治療、新材料研發、粒子物理等領域借助人工智慧大幅加速研究處理程序的夢想,在很大程度上也尚未實現。該段落通過列舉具體場景,具象化了當前 AI 的能力邊界。李飛飛選取自主機器人、疾病治療、新材料發現等具有高關注度的領域,這些領域的共同特點是都需要 AI 具備對物理世界的感知、推理與互動能力 —— 而這正是大語言模型所欠缺的。通過指出這些大眾與行業期待已久的目標尚未達成,有力地論證了單純依靠現有技術遠遠不夠,進一步凸顯了研發空間智能的必要性與緊迫性。Spatial intelligence is the scaffolding of human cognition. It operates when we passively observe or actively create. It drives our reasoning and planning, even on the most abstract topics. And it shapes how we interact—whether through language or action—with others and our environment.空間智能是人類認知體系的腳手架。無論我們是在被動觀察世界,還是主動創造事物,空間智能都在發揮作用。它推動著我們的推理與規劃能力,即便面對那些極為抽象的事物亦是如此。同時,它還影響著我們與他人、與周邊環境互動的方式 —— 無論這種互動是通過語言交流還是實際行動來實現。此處是對空間智能核心價值的高度凝練。李飛飛用 “認知的腳手架” 這一比喻,精準概括了空間智能的基礎性作用 —— 如同腳手架支撐建築一樣,空間智能是人類所有認知活動的底層支撐。她打破了人們對空間智能僅侷限於 “空間感知” 的淺層認知,指出其對抽象推理、人際互動等多方面的深層影響,這一界定極大地提升了空間智能的理論高度,也為後文闡述建構空間智能 AI 的多元價值提供了理論依據。Unfortunately, today’s AI does not yet think this way. Despite significant advances in recent years—multimodal LLMs trained on vast troves of multimedia data have introduced basic spatial awareness, and state-of-the-art robots can manipulate objects in highly constrained settings—AI’s spatial capabilities remain far from human levels.遺憾的是,如今的人工智慧尚未具備這樣的思考模式。儘管近年來人工智慧取得了諸多重大進展 —— 經過海量多媒體資料訓練的多模態大語言模型已經具備了基礎的空間感知能力,最先進的機器人也能夠在高度受限的環境中操控物體 —— 但人工智慧的空間智能水平與人類相比,仍存在巨大差距。作者直面當前 AI 在空間智能領域的現狀,既不否認技術進步,也不迴避核心差距。李飛飛認可多模態模型和先進機器人在空間能力上的微小突破,體現了論述的客觀性;同時明確指出這些能力與人類水平相去甚遠,形成強烈對比。這種表述既避免了對現有技術的全盤否定,又為後文提出建構 “世界模型” 來突破這一差距的解決方案做了完美鋪墊,讓後續的技術路徑建議更具針對性。Building world models that unlock spatial intelligence requires something far more ambitious than LLMs: a new kind of generative model whose ability to understand, reason about, generate, and interact with semantically, physically, geometrically, and dynamically complex worlds—virtual or real—far exceeds that of today’s LLMs.要建構能夠解鎖空間智能的世界模型,需要開展一項遠比研發大語言模型更具挑戰性的工作:我們需要打造一種全新的生成式模型。這種模型在理解、推理、生成以及與語義層面、物理層面、幾何層面和動態層面均極為複雜的世界(無論是虛擬還是現實世界)進行互動的能力,都要遠超如今的大語言模型。這裡明確給出了突破空間智能瓶頸的核心方案 —— 建構世界模型,並凸顯了該方案的挑戰性。李飛飛強調這種新模型需跨越語義、物理、幾何、動態等多個維度,這一定位精準抓住了空間智能的核心需求:機器要像人類一樣綜合多維度資訊理解世界。同時,將其與成熟的大語言模型對比,既讓讀者清晰感知到研發難度,也暗示這一突破將帶來 AI 領域的下一次質的飛躍,為全文的技術構想劃定了核心方向。 (晚筀筆記)思維導圖參考: