Google的機器人賭局:不賣本體,只賣大腦

AI速讀
Google DeepMind 推出 Gemini Robotics 2 系列模型,旨在打造適用於任何機器人的通用「大腦」。該架構分為負責動作的 VLA、負責規劃的 ER 及本地部署的 On-Device 模型,並將核心推理能力開放為 API。此舉標誌著 Google 採取「平台化」策略,與 Tesla 及 Figure AI 的「垂直整合」模式截然不同。文章指出,人形機器人產業將面臨「Android 模式(開放系統)」與「Apple 模式(深度耦合)」的博弈,而 Google 試圖透過定義技術標準,在預計 2034 年達 1,651 億美元的市場中搶佔主導權。

三種模型、一套架構、開放 API。





當所有人都以為人形機器人的終極戰爭是誰先造出更好的“本體”時,Google的答案是把賭注押在了“大腦”上。


當地時間7 月 30 日,Google DeepMind 發佈了 Gemini Robotics 2系列模型,這套東西試圖定義整個機器人行業的作業系統。Google DeepMind 機器人高級總監Carolina Parada,在官方部落格裡寫下了第一句話:


“從腳到指尖——我們正在教機器人智能地控制全身、精細靈巧操作,以及團隊協作。”


同一時間,Google在社交平台 X 上的官方帳號拋出了更直白的九個字:“一個大腦。適用於任何機器人。”


造機器人的宣言和造“機器人之腦”的宣言,是兩回事。想像一個場景,特斯拉在弗裡蒙特工廠裡讓 Optimus 練習跑步,Figure AI 的 BotQ 工廠正以每小時一台的速度下線 Figure 03……Google站在旁邊掏出了三個模型問了一句:你們的機器人,要不要試試我的系統?



1

Google的“機器人之腦”


Gemini Robotics 2 其實不止一個模型,是三個。


第一個,Gemini Robotics 2,視覺-語言-動作模型,把視覺和語言輸入直接轉成電機指令。從腳到指尖,完整控制一台人形機器人的每一個關節。以前Google的模型只能控上半身在桌面上幹活,現在能讓人形機器人走路、下蹲、伸展、抓取,完成“把水壺放進底層櫃子的綠色收納箱”這種需要先走過去、再彎腰、再精確放置的完整任務。


第二個,Gemini Robotics ER 2,具身推理模型。它不直接控電機,而是充當機器人的“高級大腦”,負責看視訊、理解環境、規劃多步任務,然後把執行指令交給底層的 VLA 模型。它能呼叫工具,包括 Google 搜尋和使用者自訂的函數,能同時“思考下一步”和“執行當前動作”。此外,它首次引入了多機器人協作——不同類型的機器人可以即時溝通、分工配合,完成單個機器人做不了的活。


第三個,Gemini Robotics On-Device 2,在機器人本地運行的輕量 VLA。給它幾小時的資料,就能適配一個全新的機器人本體。


三個模型,三種分工。


動作、規劃、部署各司其職,這個架構本身就是Google的競爭宣言。


回看整個人形機器人賽道,幾乎所有玩家都在走同一條路:垂直整合。


Figure AI 是最極端的代表。2024 年發佈 Figure 02 時還掛著 OpenAI 的模型,2025 年 2 月直接宣佈分手,轉向自研 Helix VLA 模型。Figure 03 在 2025 年 10 月亮相,用的是 Helix 的升級版。他們要什麼有什麼,自己的模型、自己的手、自己的執行器、自己的 BotQ 工廠,2025 年 9 月融了超過 10 億美元,估值衝到 390 億美元。


到 2026 年 4 月,BotQ 生產了超過 350 台 Figure 03,從每天 1 台加速到每小時 1 台,良率超過 80%。到 2026 年 7 月,Figure 已宣佈第 1,000 台 Figure 03 下線。


創始人 Brett Adcock 的目標是四年內交付 10 萬台。


Tesla Optimus 走的是另一條垂直整合的路。用 Tesla 自研的視覺 AI 系統,自研執行器,在自己的超級工廠裡先用起來。2025 年底 Optimus 2.5 在弗裡蒙特工廠跑了起來,有 22 個自由度的五指靈巧手。


馬斯克曾計畫三代 Optimus 在 2026 年 Q1 亮相,但實際在 4 月 23 日財報電話會上才正式宣佈通過量產節點。公共銷售預計在 2027 年啟動。到 2026 年中,特斯拉制定的全年生產目標為 5 萬台 Optimus,但實際量產在 2026 年下半年才開始啟動,截至年中尚未大規模交付。Q2 交付報告裡沒有出現過 Optimus 的獨立資料。


NVIDIA 則在 2025 年 3 月發佈了 Isaac GR00T N1,號稱“首個開放式人形機器人基礎模型”,採用快慢雙系統架構,用合成資料加模擬訓練。它開源,但它的商業模式跟機器人本身沒什麼關係。它賣的是訓練這些模型所需的 GPU 叢集。


現在,Google加入了,帶著完全不同的邏輯。




2

全端還是平台?


Google不擁有自己的機器人產線,也不銷售機器人硬體。


它和 Apptronik 合作讓 Apollo 2 做人形機器人本體,和波士頓動力合作讓 Atlas 做人形機器人的“運動員”,然後自己專心做“大腦”。


三種模型覆蓋三種能力,VLA 管動作執行,ER 管推理規劃,On-Device 管本地部署。而且,一個 VLA 模型就可以直接控三種不同的機器人形態——Apollo 2 配 SharpaWave 手、Apollo 2 配 Inspire 手、Franka Duo 配 Robotiq 夾爪——用同一個模型參數就能完成全身操控、多指靈巧操作和夾爪操作三大類任務。


這才是關鍵。Google的路線是,模型做一次,適配所有機器人。Figure AI 和 Tesla 則傾向於每個機器人從頭做一套。


更鋒利的刀藏在 ER 2 的開放策略裡。VLA 和 On-Device 只對早期合作夥伴開放,但 ER 2 直接上了 Gemini API 和 Google AI Studio。任何開發者現在就可以接入,用這個模型為自己的機器人寫推理和規劃層。甚至不需要自己的 VLA,可以人手遙控,讓 ER 2 做決策,然後把指令發給人類操作者。


Google正在把機器人行業最關鍵的一層,理解和推理物理世界的能力,變成 API 呼叫的商品。如果這個策略跑通,Figure AI 費盡心血自研的 Helix 推理層,突然就要面對一個很直接的問題:憑什麼比Google的 API 更好?憑什麼更便宜?


Gemini Robotics 2 目前展示的能力距離“替代人工”還有明顯差距。Google自己在部落格裡坦誠,在多指靈巧操作上,成功率仍然明顯低於全身控制和夾爪操作任務,機器人的移動速度也“有待提升”。On-Device 2 雖然宣稱幾小時就能適配新身體,但實際適配質量、不同硬體平台的相容性邊界,Google沒有給出詳細資料。


更重要的是,Google這條路歷史上走過,而且結果參差不齊。


Android 在手機市場的成功是平台策略的教科書案例。但當Google把類似的思路搬到物聯網、智能家居和可穿戴裝置上,Nest 和 Wear OS 用了十幾年也沒有複製出 Android 的統治力。機器人比手機複雜至少一個數量級——物理互動、安全約束、即時性要求、異構硬體的驅動相容——每一個維度都可能成為平台策略的滑鐵盧。


另一重風險在商業層面。把核心大腦做成開放 API,確實能快速鋪量,但也意味著主動放棄了最厚的利潤層。Figure AI 估值 390 億美元的邏輯,不是因為它賣了多少台機器人,而是因為它同時掌握大腦和身體,有望在未來吃下整條價值鏈。如果機器人行業最終走向垂直整合,就像蘋果在手機行業證明的那樣,Google今天的平台策略,可能是在為別人做嫁衣。蘋果一度拿走全球手機市場超過 80% 的利潤,靠的就是“不開放”。


這取決於一個根本問題,人形機器人行業最終會變成“Windows-Intel 時代”還是“蘋果時代”?




3

刀也有鈍的一面


如果是硬體標準化、軟體平台化、各家拼組裝,Google這套三模型架構就是天選之子。


三星、LG、豐田、奔馳,任何一個想做機器人但沒能力自研 AI 的公司,都可以直接接入 Gemini Robotics,把精力放在硬體設計、供應鏈和管道上。屆時,Figure AI 和 Tesla Optimus 就會像當年的黑莓和諾基亞,以為自己全端是壁壘,結果被一個開放系統加一群硬體廠商圍毆。


如果是後者,硬體和軟體深度耦合才能產生最優體驗,那 Figure AI 和 Tesla 的垂直整合就是對的。模型再好,如果控制不了執行器的延遲、感測器的精度、散熱和功耗管理,就不可能給出超越原廠的表現。


截至 2026 年年中,這個答案還不明朗。但Google這場發佈至少暴露了一件事,人形機器人的競爭已經不再是“誰的機器人更厲害”。它變成了“誰有權定義機器人行業的技術堆疊”。


Figure 和 Tesla 押的是“硬體+軟體”全端,做一個偉大的產品,吃掉整個市場。Google押的是“模型即平台”,做一個偉大的大腦,讓所有人替你造本體。NVIDIA 則站在更上游,給所有人賣訓練這些模型所需的計算卡。


三家巨頭,三層博弈,一張牌桌上只有一件事是一致的,他們都認定人形機器人會是 AI 之後下一個兆級市場。Fortune Business Insights 的預測是,全球人形機器人市場到 2034 年將達到 1,651 億美元,從 2026 年到 2034 年的年複合增長率約為 50.6%。2025 年這個數字是 48.9 億美元。也就是說,十年要走完從“玩具”到“基礎設施”的距離。


在這場牌局裡,Google今天打出的三張牌有一個共同的名字,不賣機器人,賣系統。不建工廠,建標準。


人形機器人行業需要的不是一個“機器人界的蘋果”。它需要的是一個能跑通的“機器人界的Android”。至於這個Android最後會不會由Google來做,這是另一個問題了。


但至少今天,Google是唯一一個掏出了完整三模型架構,並且敢把推理層直接開放給所有開發者的人。它賭的,就是自己的大腦,能讓所有的機器人都跑起來。(鈦媒體AGI)