一根香蕉,讓整個機器人圈炸了。
研究人員先教機器人拿起一把刷子,把桌上的積木掃進碗裡。
然後,他們把刷子拿走,換成一根香蕉。
機器人抓起香蕉,將它橫過來貼住桌面,把積木一點點掃進碗中。
隨後,香蕉又被換成了一隻簸箕。機器人這次沒有繼續照搬 "掃" 的動作,而是伸出另一隻手,把積木推上簸箕,再端起來倒進碗裡 —— 一隻手掃、一隻手接,雙手配合,行雲流水。
重點是:研究人員從來沒有教過它用香蕉和簸箕,它是自己推理出來的。
這不是科幻電影,這是 8 月 19 日矽谷機器人公司 Generalist AI 發佈的新一代具身基礎模型 GEN-1.5 的真實演示。一條演示視訊,在 48 小時內刷爆了全球機器人研究者的社交網路。前 Google DeepMind Gemini Robotics 研究者 Ted Xiao 直接說:"那種能力突然躍升的感覺,讓我想起第一次使用 GPT-3。"
很多人把它稱為機器人的 GPT-3 時刻。但這個判斷到底成不成立?GEN-1.5 究竟做對了什麼?它離真正改變產業還有多遠?我們一層層扒開看。
一、GEN-1.5 到底能做什麼?四個能力,一個比一個炸裂
先把技術名詞放一邊,用大白話講清楚 GEN-1.5 展示的四項核心能力。
1. 物理提示(Physical Prompting):看一遍就會,0 行程式碼
這是 GEN-1.5 最核心的突破。
研究人員拿著一對簡易夾爪,在機器人面前完成一個 3 到 12 秒的操作 —— 拉開一次拉鏈、擰開一次罐蓋、從錢包裡抽出一張紙幣。演示只有一遍,GEN-1.5不進行任何微調,不更新任何模型參數,隨即在物體位置發生變化的情況下,開始嘗試同一項任務。
Generalist 把這個機制叫做 "physical prompting"—— 物理提示。它和給大語言模型寫一段 prompt 幾乎一模一樣:示範沒有被訓練進模型,只是臨時告訴它 "這一次要做什麼"。
在 10 項全新操作任務上,這種 "看一遍就做" 的平均成功率達到了59%。
這個數字乍看不算高,但放在機器人領域的語境裡,幾乎是不可思議的。過去教一個機器人擰瓶蓋,工程師要程式設計、採集資料、訓練、偵錯,周期動輒數月。現在需要的全部投入,是一段三秒鐘的演示,和零行程式碼。
2. 組合泛化:兩個動作,自己拼成一套流程
物理提示還可以組合。
研究人員分別示範兩個獨立任務 —— 比如 "拉開鉛筆袋拉鏈" 和 "從袋裡取出錢"—— 把兩段演示一起放進模型的上下文窗口。GEN-1.5 會把它們接成一套連續動作,並且自己補上示範裡沒有的中間步驟:調整位置、換手、重新抓取、錯誤恢復。
這些過渡動作,兩段示範裡都沒有出現過,是模型自己 "腦補" 出來的。
這意味著什麼?未來你不需要為一個複雜流程錄製完整演示,只需要建一個小動作庫,像搭積木一樣把短提示拼起來,機器人就能執行長程任務。這是物理世界裡的 "prompt chaining"。
3. 零樣本 Sim-to-Real:模擬器裡看一遍,真實世界直接上手
更絕的是跨域遷移。
一段完全在模擬器裡錄製的演示,可以直接作為物理提示,讓真實機器人執行對應任務。注意,GEN-1.5 的預訓練資料裡完全沒有模擬器資料—— 它從來沒在模擬環境裡訓練過,但模擬演示照樣能 "提示" 它在真實世界幹活。
這直接擊穿了機器人領域長期頭疼的 "sim-to-real gap"(模擬到現實的鴻溝)。過去這個問題需要複雜的域隨機化、大量真實資料微調來彌補,現在一段模擬演示就能跨過去。
4. 即興工具使用:沒見過的工具,自己琢磨用法
就是開頭那根香蕉和簸箕的故事。
模型只學過用刷子掃積木,但面對香蕉、簸箕這些從未見過的工具,它能自己推斷出 "這個東西也能用來掃",甚至發展出雙手配合的新策略。它還會在遇到意外時直接換辦法:碗被紙蓋住,它會先移開紙;樂高卡在夾爪上,它會用另一隻手取下;只學過單手開罐,有時會自動換成雙手。
這種 "行為策略層面的泛化",是過去機器人最缺的東西。以前的機器人像在忠實復現一條訓練過無數次的軌跡,環境稍有變化就失敗;而 GEN-1.5 開始表現出 "理解目標、靈活達成" 的跡象。
二、技術深扒:為什麼它能 "看一遍就會"?
GEN-1.5 的能力不是憑空出現的。理解它,要從三個層面切入:模型架構、資料引擎、scaling 規律。
模型架構:30 秒記憶窗口,100Hz 輸出動作
GEN-1.5 是一個大型多模態模型,同時處理視訊輸入(擁有 30 秒的記憶窗口)、其他感測器資料、語言指令和機器人自身的本體感知狀態,以100Hz的頻率輸出動作軌跡。
物理提示的工作機制是:把一段 3-12 秒的演示(感測器資料 + 動作軌跡)插入 30 秒的上下文窗口,剩餘空間持續滾動加入機器人最新看到的畫面。模型在執行中不斷觀察、修正,閉環控制。
一個關鍵細節:GEN-1.5約 99% 的參數是從頭訓練的,並不依附 Gemini、GPT 或其他已經讀過網際網路圖文的預訓練模型。Generalist 的判斷是 —— 機器人過去需要借用語言和圖像模型,是因為物理資料太少;當真實運算元據達到幾十萬小時,模型可以主要從物理經驗中建立自己的能力。
這也是為什麼 Generalist 一直拒絕把自己的模型簡單稱為 VLA(視覺 - 語言 - 動作模型)或 World Model(世界模型)。它的方式更直接:看到當前畫面和剛才的示範,持續決定下一步怎樣動。
資料引擎:一天讀取 6.85 年人類經驗
GEN-1.5 能力的根基,是海量真實物理世界資料。
Generalist 採用的資料採集路線類似 UMI(Universal Manipulation Interface):讓人拿著一隻帶相機的低成本手持裝置和簡易夾爪,直接在家庭、倉庫和工廠裡幹活,再把動作轉換成機器人能學習的資料。
這種方式的優勢是成本極低、擴展性極強 —— 不需要給每個採集者配一台昂貴的機器人。公司稱已經在不同地區部署了數千套採集硬體,訓練系統一天可以讀取相當於6.85 年的人類操作經驗。
資料增長曲線非常清晰:
- 2025 年 11 月 GEN-0:超過27 萬小時真實運算元據,每周新增約 1 萬小時
- 2026 年 4 月 GEN-1:超過50 萬小時
- 2026 年 8 月 GEN-1.5:未公佈最新總量,但連續預訓練已超過 8 個月
鹿明機器人聯合 CTO 丁琰曾估算:即使完全照著 Generalist 公開的採集方式重建,僅製造採集硬體就需要四到六個月;積累 27 萬小時資料,至少需要約 1000 人持續採集大半年到一年。對新團隊來說,"半年到一年追上" 都過於樂觀。
Scaling 規律:從數百次梯度更新,壓縮到 0 次
GEN-1.5 最震撼的不是某個單一數字,而是一條清晰的趨勢線。
Generalist 過去兩年的全部賭注,壓在一個判斷上:物理智能也可以 scaling—— 資料、模型規模和計算量一起增加,一組不同任務會共同進步。
這條路線的驗證過程:
- GEN-0(2025.11):證明物理資料可以 scaling,16 組新任務的動作預測誤差同時下降。被業內稱為機器人最接近 "GPT-1 時刻" 的嘗試。
- GEN-1(2026.4):用約 1 小時機器人任務資料,把一組簡單任務平均成功率從 64% 推到99%,任務速度提升約 3 倍。
- GEN-1.5(2026.8):新任務所需的梯度更新,從數百次→數十次→10 次→1 次→最終0 次。
即便只調整 10 次參數,模型內部參數的整體變化也不到 0.15%。用 Generalist 的話說,這已經不像從頭學習,更像是 "在提醒模型一件它幾乎已經會做的事"。
而最令人意外的是:這些能力沒有一項是專門訓練出來的。 沒有為 in-context learning 做架構改動,沒有元學習循環,沒有輔助目標鼓勵即興發揮。GEN-1.5 在大規模物理互動資料上預訓練後,這些能力 "開箱即用" 地湧現了出來。
為什麼會湧現?目前沒有確定答案
Generalist 自己也說不清楚為什麼會出現這種能力。目前有幾種假說:
假說一:物理世界的 "Zipfian 結構"。 類比語言模型 —— 人類物理操作的分佈可能也呈現 "爆發性" 和冪律結構,這種結構被認為與 in-context learning 的湧現相關。
假說二:天然重複循環。 物理工作充滿重複:擰完一顆螺絲通常還要擰下一顆,收好一個物體緊接著處理另一個。模型在海量連續動作中,可能已經無數次練習了 "看見前一個實例,延續下一個實例"。
假說三(輝達 Jim Fan):失誤 - 修正 - 恢復的完整鏈路。 人會失手、調整、重新抓起物體然後繼續工作。如果這些不完美的過程沒有在資料清洗時被剪掉,模型看到的就不是一條只有正確動作的軌跡,而是完整的 "失誤 — 修正 — 繼續"。這可能正是 GEN-1.5 會恢復和換辦法的關鍵原因。
三、Generalist 是誰?一家不造機器人的機器人公司
在大眾傳播裡,Generalist 的知名度遠不如不斷髮布人形機器人視訊的 Figure。但在機器人研究和投資圈,它一直是被密切追蹤的公司。
創始團隊陣容硬核:
- Pete Florence 和 Andy Zeng:來自 Google DeepMind,參與過 PaLM-E、RT-2 等具身模型
- Andrew Barry:前 Boston Dynamics 資深機器人研究員
- 團隊還有來自 OpenAI、自動駕駛和機器人公司的成員
公司定位獨特: 它不造人形機器人,不做明星硬體,而是訓練一套可以進入不同機械臂、夾爪和工具的底層智能。Figure 把模型和一具完整的人形身體一起交付;Generalist 更關心的是,同一種智能能不能換一雙手、換一台機器,仍然繼續工作。
今年 7 月,Generalist 還為 GEN-1 接入了五指手、夾鉗、電動螺絲刀、打蛋器等不同工具,以及大約 9000 種標準夾爪的改裝形態,試圖證明物理智能不必被鎖在一雙人形機器人的手上。
資本已經給出高價: 2026 年 6 月,Generalist 完成 4 億美元融資,累計融資超過 5 億美元,估值達到 20 億美元。Radical Ventures 領投,輝達、Bezos Expeditions(貝索斯旗下)、8VC、Union Square Ventures、Norwest、Spark Capital 等參與。黃仁勳、李飛飛均有參投。
聰明錢和聰明人同時湧向同一個方向,GEN-1.5 給出了它們投資的理由。
四、真的是 GPT-3 時刻嗎?冷靜看三組對比
"機器人的 GPT-3 時刻" 這個說法,既讓人興奮,也需要冷靜審視。我們做三組對比。
對比一:GPT-3 vs GEN-1.5 的數字
數字上 GEN-1.5 甚至比當年的 GPT-3 更好看。但物理任務的容錯率遠低於語言任務 —— 語言模型答錯一個問題可以重試,機器人擰錯一個瓶蓋可能損壞硬體,在醫療或工業場景中更是人命關天。
對比二:GEN-1.5 的 10 項任務,到底難不難?
GEN-1.5 測試的 10 項任務包括:從錢包取錢、摺紙、擰罐蓋、疊杯子、掃垃圾、翻書、掃積木、翻手機、拉拉鏈、取真空吸盤。
這些都是短程、原子化的操作任務,持續時間幾秒到十幾秒。沒有涉及複雜柔性物體(如衣物、線纜)、長時間多步驟任務、或完全陌生的場景。
其中 "用刷子掃垃圾" 的 one-shot 成功率只有 37.3%,是 10 項裡最低的 —— 說明即使是簡單任務,一旦涉及動態接觸和力控,穩定性仍然不足。而 few-shot 微調後可以達到 99%,說明模型的 "底子" 是夠的,只是 one-shot 的即時泛化還不夠穩。
對比三:侷限與未知
必須承認的侷限:
所有核心數字都來自 Generalist 自己
公司沒有公佈足以讓外界完整復現的論文、參數和訓練細節
- 任務簡單且短程:複雜場景的有效性未驗證
- one-shot 59% 的成功率不足以部署:離可靠交付還有距離
- 物理提示對完全陌生任務的效果存疑——Jim Fan 提醒,如果測試裡的拉鏈、罐子與模型過去見過的東西非常接近,"看一遍就會" 和真正學會陌生工作不是一回事
- 安全驗證、現場整合、硬體維護:不會因為模型變強而消失
但正確理解這些限制,不等於忽略這次進展。GPT-3 剛出現時同樣錯誤百出,它真正改變世界的地方,是讓人們第一次相信同一個模型可以通過 prompt 臨時學會許多不同任務。GEN-1.5 現在展示的,是這個介面在物理世界裡的早期形態。
五、產業影響:被重構的不只是技術,還有商業模式
GEN-1.5 的真正意義,可能不在於某個演示有多炫,而在於它可能重構機器人的部署成本結構。
過去,每增加一種機器人用途,都要重新採集資料、訓練模型、上機測試,再由工程師一輪輪修正。機器人本身或許可以買到,真正昂貴的是讓它在一個新現場可靠地做一件新工作。這也是為什麼工業機器人部署了幾十年,仍然大量集中在汽車銲接、噴塗等少數高度標準化場景 —— 換一個場景,成本高到無法承受。
physical prompting 指向的另一種可能是:機器人不必為每一項工作永久改變參數,使用者只需要告訴它 "這一次要做什麼"。 如果這種能力繼續提高,被壓縮的不只是示教時間,還有為每個新任務準備資料、佔用機器人和投入工程師的成本。
這不會消除安全驗證和硬體維護,但它可能改變部署成本中最難下降的那一部分 ——每增加一種用途,都要重新教一遍機器人的代價。
對中國機器人產業來說,GEN-1.5 的發佈也拋出了一個尖銳的問題:當海外團隊用幾十萬小時人類運算元據跑出清晰的 scaling 曲線時,我們的資料積累、模型架構和訓練範式,是否還跟得上這條新的競賽軌道?
值得注意的是,國內團隊也在同方向加速。像超維動力的 KAI 全端具身智能、銀河通用的 AstraBrain-Agent,都在探索 "人類怎麼動,機器人就怎麼動" 的通用動作學習路徑。
六、scaling 曲線已經顯現,剩下的只是時間問題
GEN-1.5 它是一個訊號 ——機器人的智能湧現,已經從 "有沒有" 進入了 "有多快" 的階段。
九個月前 GEN-0 證明物理資料可以 scaling 時,業內稱之為 "GPT-1 時刻";四個月前 GEN-1 把簡單任務推到 99%;今天 GEN-1.5 把新任務的訓練成本壓縮到了 0 次梯度更新。按照這個節奏,下一代模型會把 one-shot 成功率推到多少?會把任務複雜度擴展到什麼程度?沒有人能精確預測,但 scaling 曲線已經畫在了那裡。
今天的機器人還遠沒有學會一切。但讓它繼續變強、也讓每一種新用途變得更便宜的那條曲線,已經開始顯現。
一根香蕉能當刷子用,一隻簸箕能觸發雙手配合 —— 這些看似笨拙的即興發揮,可能正是通用物理智能的第一縷曙光。
最後問問大家:你覺得 GEN-1.5 真的是機器人的 GPT-3 時刻嗎? (未來機器人網)
