相信去年來過WRC現場的朋友,多半會跟我一樣:
剛一踏進場館,就開啟了逛展隱藏支線——尋找遙控器。
那時候,幾乎是每一個成功操作的機器人,背後都有一個拿著遙控器的小哥。
就算繞著展台兜了一圈,沒找到人,很快也會發現,機器人來來回回演示的,多半還是提前編好的一套“公式動作”。
說到底,機器人雖然在動,但真正幹活的,很多時候還是人。
但今年的WRC,體感上已經明顯不一樣了。
各家展台上,自主幹活幾乎成了標配,後面拿著遙控器的人明顯少了,就算偶爾還能看到遙操作,多半也是在采資料。
老實說,雖然目前機器人自主幹活仍然不甚絲滑,而且難免會看到抖動、抽搐、失敗,但起碼,這活真是機器人自己幹的,實乃一大進步。
不過逛了一圈之後,我們又發現,事情顯然還沒結束。因為機器人自己把活幹起來,只能證明它有了“自主性”。
真要進工廠、倉庫、商超,變成生產力,後面還有更現實的一道考題:
換個東西還能不能幹?幹得夠不夠準?速度能不能跟上?
也就是——泛化、精度和效率。
而今年把這三件事擺得最直白的展台之一,恰好也是整個WRC最大的展台:
星海圖。
500平方米,10組Demo,一排機器人同時開工。從前置倉、工業裝配、禮盒折疊,到雙足、輪式新品,幾乎把機器人真正進入生產現場之後會碰到的幾類問題,都搬到了一個展台上。
所以,看到星海圖的巨大展台後,我們真正好奇的,也不只是:
為什麼一向低調的星海圖,這次突然搞了個全場最大展台?
還有,當整個行業都開始強調“自主幹活”之後,星海圖又想把具身智能往前推到那一步?
走,進去看看!!
生產力覺醒,究竟是怎麼個覺醒法
走進展台,我們看到星海圖這次WRC的主題,叫生產力覺醒。
為了一探究竟怎麼個覺醒法,我們也現場試了一下。
首先是現場圍觀人數最多的,星海圖和京東合作的前置倉。
在排了一會兒隊之後,我們直接在iPad上下單了兩瓶脈動。
機器人接單後,會自己排隊、找貨、取貨,再一路送到櫃檯。
有一說一,在第一次嘗試把脈動放到櫃檯時,機器人失敗了;
就在我們以為是瓶子太重、太粗不好夾的時候,機器人調整了幾次動作,最後還是成功放了上去。
拿回來之後,剩下的一切都變得相當絲滑,打包,拉袋,封口,一氣呵成~
整體看下來,這套前置倉已經基本復刻了一套真實的生產流程。
貨架沒有為了方便機器人抓取而刻意擺開,從下單、抓取,到移動、打包、交付,整套流程都由機器人端到端完成。
機器人在這裡既需要完成長程規劃,移動操作,“下蹲抓取”,也涉及到對不同SKU、塑料袋這類剛性和柔性物體的互動。
更關鍵的是,它並不是只會抓我們眼前這兩瓶脈動。
據現場工作人員介紹,這套系統背後的G0.5模型,已經能夠泛化到上萬種SKU。
這其實對應的,就是機器人進入真實世界之後的第一道生產力門檻:泛化。
如果換個商品、換個擺法就得重新訓練,那再自主,本質上也還是一套更複雜的專機。
值得一提的是,打包機器人的加入,也把整個閉環進一步串了起來。
我們從下單到拿到商品,大概等了3-4分鐘,速度已經在可接受的範圍內。
再往裡走,是一套機器人組裝機器人的工業裝配場景。
雖然聽起來多少有點“物理RSI”那味兒,但這裡真正考驗的,其實是精度。
畢竟工業裝配不像抓瓶子,零件差一點可能就裝不上。
為此,星海圖在基礎模型之上引入強化學習,將操作精度做到1mm以內、成功率99.9%,同時把工作效率提升了400%。
也就是說,到了真正的工業現場,自主只是前提,精度和良率才決定它能不能上產線。
再往下,是一個看起來沒那麼唬人、實際卻挺難搞的任務:折禮盒。
我們現場隨手丟給它一個紙盒,機器人拿到之後,大概1分鐘就能折完。
這裡的難點在於,紙板和剛性零件不一樣:折過去會回彈,狀態一變,後面的動作也得跟著變。
以前很多靠背一套“小連招”的機器人,到這基本就歇了:中間一步被打斷,直接當機。
但G0.5可以根據紙盒的即時狀態調整動作,我們在現場站了一會,成功率已經沒的說了。
不光是紙盒,對於疊衣服這種柔性操作,G0.5也可以輕鬆拿捏。
除了這些依靠具身大腦的任務以外,星海圖這次還帶來了最新的通用小腦成果——
雙足機器人Kengo。
它遇到沒見過的地形時,不需要重新訓練,就能邊感知、邊調整步態。
這其實有點呼應了最近全身智能的研究熱點。
畢竟,以後機器人真進了家庭、工廠和倉庫,能不能走過沒見過的路,本身也是泛化的一部分。
值得一提的是,這也不是星海圖首次發力機器人運控。
早在2023年,聯合創始人趙行團隊的Robot Parkour Learning,就曾入選CoRL 2023 Oral,並躋身最佳系統論文候選Top 3;此後,他們又將這一路線推進到雙足人形機器人。
當然,500平米的展台上遠不止這些。
抓包裹、物料分揀、折衣服、長程送件……機器人幹的活五花八門,囿於篇幅,就不一一展開了。
但把前面這些Demo串起來看,星海圖這次真正想展示的東西,其實已經很清楚了:
機器人“能自主幹活”,只是生產力覺醒的起點。
再往下,至少還有三道更現實的考題。
第一是泛化。換個SKU、換個物體、換個環境,甚至中間狀態發生變化,機器人還能不能繼續幹,而不是重新訓練一套模型。
第二是精度。如果只是在Demo裡把動作做個大概,到了工廠裡精度不夠、良率不行,那依然幹不了真正的活。
再往前一步,就是效率。畢竟真正到了生產現場,機器人最後要比的,不是Demo漂不漂亮,而是能不能在相同時間裡完成一樣的工作,甚至把這筆帳算得比人更划算。
所以一圈看下來,星海圖這次至少做了一件挺有意思的事:
當整個行業開始從“遙操作”走向“自主幹活”,它又把考捲往前翻了一頁——把泛化、精度和效率,同時擺到了檯面上。
從“機器人能不能自己幹”,變成了:機器人能不能快、准、泛化地把活幹下來。
而這,可能才是真正的“生產力覺醒”。
那麼,這背後究竟是怎麼做到的?
十幾組demo背後的具身大腦
在前面的展示裡,機器人之所以能做到百萬SKU的物品與剛性柔性物體泛化,並把一整套長程任務自己串起來,背後用到的就是星海圖最新的VLA模型G0.5。
在公開榜單測試中,G0.5已經在LIBERO、BEHAVIOR-1K、RoboTwin 2.0、DROID Zero-shot等8個權威Benchmark中登頂,覆蓋長程任務、精細操作、零樣本泛化等不同能力,整體位居第一梯隊。
在具體的架構方面,G0.5走的是一條統一自回歸路線,用G0.5背後研究者的話說就是,你可以把它理解成一個大語言模型:
它把視覺理解、具身推理和動作生成,都放進了同一個Transformer Decoder裡。
和不少“VLM負責看和想,Action Expert負責動”的VLA架構不同。G0.5更像是把“想”和“做”重新接在了一起:機器人一邊理解環境、一邊判斷下一步該幹什麼,然後繼續往下生成動作。
這樣做的第一個好處,就是過去幾年LLM已經學出來的理解、推理和任務拆解能力,能更順暢地接到機器人身上。
模型不用從頭再學一遍“怎麼想”,而是直接把已經會的思考變成動作。
所以到了前置倉這種任務裡,它面對的就不只是“抓一個東西”,而是可以先理解訂單,再把找貨、規劃、抓取、打包這一整串事情接著做下去。
而統一自回歸的第二個好處,就是思考和動作可以連續往下走。
在前面的折禮盒demo中,這就讓機器人能夠一邊執行,一邊根據紙盒的變化及時調整動作。
而在G0.5代表的VLA路線之外,星海圖還同時押了另一條路線:世界模型。
他們今年推出的Fast-WAM,最大的特點就是快。
針對以往世界模型推理過慢,難以實際部署的問題,Fast-WAM把推理延遲壓到了約190ms,相比傳統方案提升約4倍,發佈時做到了全球最快。
目前,Fast-WAM論文引用量已經位居世界模型領域第一,也得到了同為世界模型創業者謝賽寧的認可。
所以回過頭看,星海圖在“大腦”上的路線其實挺實用主義。
VLA也做,世界模型也做,不是先選一個技術信仰,然後證明另外一條路線是錯的。
而是反過來:那個東西能讓機器人把活幹得更好,就先用那個。如果都好,那就都用。
前面500平方米裡看到的那些Demo,某種程度上就是這套思路的集中展示。
但說到底,模型架構只是第一步,真正能在具身領域拉開身位的,還得是資料以及全端自研帶來的飛輪效應。
資料、本體、模型閉環
星海圖創始人、CEO高繼揚曾不止一次解釋過這套飛輪:
做過自動駕駛你發現:要做物理世界智能,就得有物理世界資料;要有資料,就得有一個收集資料的載體,整機。以前做自動駕駛最大的問題就是軟體供應商拿資料的鏈路不通暢,飛輪跑不起來,這就是致命的問題。
說白了,不掌握本體,就很難掌握資料閉環;資料閉環跑不起來,大腦也就很難持續迭代。
所以在資料上,星海圖一直押注真實資料。
早在去年9月,他們就開源了GOD真實場景資料集,下載量全球第一。與此同時,還通過投資簡智、元流等玩家繼續擴充資料來源,並計畫2026年將真實資料規模做到100萬小時。
而這些資料背後,是星海圖自己的本體體系。
包括最新的雙足機器人Kengo、輪式機器人Nexo在內,星海圖已經先後推出R1、R1 Lite、R1 Pro等一系列機器人。
整機握在自己手裡,帶來的不只是資料來源更可控,模型、控制和硬體也能一起迭代。
據現場工作人員介紹,G0.5這次表現背後,很大程度上就來自自研本體產生的高品質資料,以及模型和本體之間更高效的協同。
這也是具身智能和純軟體系統很不一樣的地方:
機器人最終面對的是物理世界,模型能力、控制演算法、執行器和本體設計彼此牽連,很難完全拆開最佳化。
模型發現新的能力邊界,本體就能針對性迭代;本體升級之後,又能採集更高品質的資料,反過來繼續訓練模型。
於是,一套完整的飛輪也就跑了起來:
資料推動模型,模型定義本體,本體再生產新的資料。
上一代機器人出去幹的每一份活,都有機會變成下一代繼續進化的燃料。
具身智能,開始參加生產力大考
所以再回到開頭那個問題:WRC最大的展台,為什麼是星海圖?
看完整個展台,答案已經很明顯:
星海圖想展示的,不只是機器人又學會了多少新Demo,而是當“自主幹活”逐漸成為行業標配之後,具身智能的考卷已經開始往下一頁翻。
過去,大家先解決的是機器人能不能脫離遙控器,自己把任務做起來。
而真到了工廠、倉庫和真實客戶現場,光“能自己幹”顯然還不夠。
接下來要比的,是換個東西還能不能幹,幹得夠不夠準,速度又能不能跟上。
也就是泛化、精度和效率。
換句話說,機器人真正成為生產力,不只是要“會幹活”,而是要能在真實現場快、准、穩地把活幹下來。
這次500平方米、十幾組Demo,從倉儲揀選、工業裝配,到柔性操作和雙足運動,星海圖某種程度上就是把這張新的考卷,集中攤在了大家面前。
而作為具身“大腦”第一梯隊玩家,它所展示的也不只是自己的能力邊界,更像是在給行業打一個樣:
接下來,不再只比誰的Demo更好看,而是比誰能真正把機器人變成生產力。
從“能不能自主幹”,到“能不能快、准、泛化地干”。
某種程度上,這可能才是具身智能下一階段真正要卷的東西。(量子位)
