今年WRC最大展台,預告具身智能未來

AI速讀
在今年 WRC 大會上,星海圖透過最大展台定義了具身智能的新考卷:從「能否自主」演進為「能否快、準、泛化地完成工作」。星海圖展示了與京東合作的前置倉系統,證明其 G0.5 模型可泛化至上萬種 SKU,並在工業裝配中將精度控制在 1mm 內。技術核心在於採取統一自回歸路線的 VLA 模型 G0.5 以及全球推理速度最快的世界模型 Fast-WAM。公司採取「本體-資料-模型」的全端自研策略,透過掌握硬件本體來獲取高品質真實數據,驅動模型迭代,試圖將具身智能從 Demo 階段推向真正的工業生產力應用。

相信去年來過WRC現場的朋友,多半會跟我一樣:

剛一踏進場館,就開啟了逛展隱藏支線——尋找遙控器

那時候,幾乎是每一個成功操作的機器人,背後都有一個拿著遙控器的小哥。

就算繞著展台兜了一圈,沒找到人,很快也會發現,機器人來來回回演示的,多半還是提前編好的一套“公式動作”。

說到底,機器人雖然在動,但真正幹活的,很多時候還是人。

但今年的WRC,體感上已經明顯不一樣了。

各家展台上,自主幹活幾乎成了標配,後面拿著遙控器的人明顯少了,就算偶爾還能看到遙操作,多半也是在采資料。

老實說,雖然目前機器人自主幹活仍然不甚絲滑,而且難免會看到抖動、抽搐、失敗,但起碼,這活真是機器人自己幹的,實乃一大進步。

不過逛了一圈之後,我們又發現,事情顯然還沒結束。因為機器人自己把活幹起來,只能證明它有了“自主性”。

真要進工廠、倉庫、商超,變成生產力,後面還有更現實的一道考題:

換個東西還能不能幹?幹得夠不夠準?速度能不能跟上?

也就是——泛化、精度和效率。

而今年把這三件事擺得最直白的展台之一,恰好也是整個WRC最大的展台:

星海圖

500平方米,10組Demo,一排機器人同時開工。從前置倉、工業裝配、禮盒折疊,到雙足、輪式新品,幾乎把機器人真正進入生產現場之後會碰到的幾類問題,都搬到了一個展台上。

所以,看到星海圖的巨大展台後,我們真正好奇的,也不只是:

為什麼一向低調的星海圖,這次突然搞了個全場最大展台?

還有,當整個行業都開始強調“自主幹活”之後,星海圖又想把具身智能往前推到那一步?

走,進去看看!!

生產力覺醒,究竟是怎麼個覺醒法

走進展台,我們看到星海圖這次WRC的主題,叫生產力覺醒

為了一探究竟怎麼個覺醒法,我們也現場試了一下。

首先是現場圍觀人數最多的,星海圖和京東合作的前置倉。

在排了一會兒隊之後,我們直接在iPad上下單了兩瓶脈動。

機器人接單後,會自己排隊、找貨、取貨,再一路送到櫃檯。

有一說一,在第一次嘗試把脈動放到櫃檯時,機器人失敗了;

就在我們以為是瓶子太重、太粗不好夾的時候,機器人調整了幾次動作,最後還是成功放了上去。

拿回來之後,剩下的一切都變得相當絲滑,打包,拉袋,封口,一氣呵成~

整體看下來,這套前置倉已經基本復刻了一套真實的生產流程。

貨架沒有為了方便機器人抓取而刻意擺開,從下單、抓取,到移動、打包、交付,整套流程都由機器人端到端完成。

機器人在這裡既需要完成長程規劃,移動操作,“下蹲抓取”,也涉及到對不同SKU、塑料袋這類剛性和柔性物體的互動。

更關鍵的是,它並不是只會抓我們眼前這兩瓶脈動。

據現場工作人員介紹,這套系統背後的G0.5模型,已經能夠泛化到上萬種SKU

這其實對應的,就是機器人進入真實世界之後的第一道生產力門檻:泛化。

如果換個商品、換個擺法就得重新訓練,那再自主,本質上也還是一套更複雜的專機。

值得一提的是,打包機器人的加入,也把整個閉環進一步串了起來。

我們從下單到拿到商品,大概等了3-4分鐘,速度已經在可接受的範圍內。

再往裡走,是一套機器人組裝機器人的工業裝配場景。

雖然聽起來多少有點“物理RSI”那味兒,但這裡真正考驗的,其實是精度

畢竟工業裝配不像抓瓶子,零件差一點可能就裝不上。

為此,星海圖在基礎模型之上引入強化學習,將操作精度做到1mm以內、成功率99.9%,同時把工作效率提升了400%

也就是說,到了真正的工業現場,自主只是前提,精度和良率才決定它能不能上產線。

再往下,是一個看起來沒那麼唬人、實際卻挺難搞的任務:折禮盒。

我們現場隨手丟給它一個紙盒,機器人拿到之後,大概1分鐘就能折完。

這裡的難點在於,紙板和剛性零件不一樣:折過去會回彈,狀態一變,後面的動作也得跟著變。

以前很多靠背一套“小連招”的機器人,到這基本就歇了:中間一步被打斷,直接當機。

但G0.5可以根據紙盒的即時狀態調整動作,我們在現場站了一會,成功率已經沒的說了。

不光是紙盒,對於疊衣服這種柔性操作,G0.5也可以輕鬆拿捏。

除了這些依靠具身大腦的任務以外,星海圖這次還帶來了最新的通用小腦成果——

雙足機器人Kengo。

它遇到沒見過的地形時,不需要重新訓練,就能邊感知、邊調整步態。

這其實有點呼應了最近全身智能的研究熱點。

畢竟,以後機器人真進了家庭、工廠和倉庫,能不能走過沒見過的路,本身也是泛化的一部分。

值得一提的是,這也不是星海圖首次發力機器人運控。

早在2023年,聯合創始人趙行團隊的Robot Parkour Learning,就曾入選CoRL 2023 Oral,並躋身最佳系統論文候選Top 3;此後,他們又將這一路線推進到雙足人形機器人。

當然,500平米的展台上遠不止這些。

抓包裹、物料分揀、折衣服、長程送件……機器人幹的活五花八門,囿於篇幅,就不一一展開了。

但把前面這些Demo串起來看,星海圖這次真正想展示的東西,其實已經很清楚了:

機器人“能自主幹活”,只是生產力覺醒的起點。

再往下,至少還有三道更現實的考題。

第一是泛化。換個SKU、換個物體、換個環境,甚至中間狀態發生變化,機器人還能不能繼續幹,而不是重新訓練一套模型。

第二是精度。如果只是在Demo裡把動作做個大概,到了工廠裡精度不夠、良率不行,那依然幹不了真正的活。

再往前一步,就是效率。畢竟真正到了生產現場,機器人最後要比的,不是Demo漂不漂亮,而是能不能在相同時間裡完成一樣的工作,甚至把這筆帳算得比人更划算。

所以一圈看下來,星海圖這次至少做了一件挺有意思的事:

當整個行業開始從“遙操作”走向“自主幹活”,它又把考捲往前翻了一頁——把泛化、精度和效率,同時擺到了檯面上。

從“機器人能不能自己幹”,變成了:機器人能不能快、准、泛化地把活幹下來。

而這,可能才是真正的“生產力覺醒”。

那麼,這背後究竟是怎麼做到的?

十幾組demo背後的具身大腦

在前面的展示裡,機器人之所以能做到百萬SKU的物品與剛性柔性物體泛化,並把一整套長程任務自己串起來,背後用到的就是星海圖最新的VLA模型G0.5

在公開榜單測試中,G0.5已經在LIBERO、BEHAVIOR-1K、RoboTwin 2.0、DROID Zero-shot等8個權威Benchmark中登頂,覆蓋長程任務、精細操作、零樣本泛化等不同能力,整體位居第一梯隊。

在具體的架構方面,G0.5走的是一條統一自回歸路線,用G0.5背後研究者的話說就是,你可以把它理解成一個大語言模型:

它把視覺理解、具身推理和動作生成,都放進了同一個Transformer Decoder裡。

和不少“VLM負責看和想,Action Expert負責動”的VLA架構不同。G0.5更像是把“想”和“做”重新接在了一起:機器人一邊理解環境、一邊判斷下一步該幹什麼,然後繼續往下生成動作。

這樣做的第一個好處,就是過去幾年LLM已經學出來的理解、推理和任務拆解能力,能更順暢地接到機器人身上。

模型不用從頭再學一遍“怎麼想”,而是直接把已經會的思考變成動作。

所以到了前置倉這種任務裡,它面對的就不只是“抓一個東西”,而是可以先理解訂單,再把找貨、規劃、抓取、打包這一整串事情接著做下去。

而統一自回歸的第二個好處,就是思考和動作可以連續往下走。

在前面的折禮盒demo中,這就讓機器人能夠一邊執行,一邊根據紙盒的變化及時調整動作。

而在G0.5代表的VLA路線之外,星海圖還同時押了另一條路線:世界模型。

他們今年推出的Fast-WAM,最大的特點就是快。

針對以往世界模型推理過慢,難以實際部署的問題,Fast-WAM把推理延遲壓到了約190ms,相比傳統方案提升約4倍,發佈時做到了全球最快。

目前,Fast-WAM論文引用量已經位居世界模型領域第一,也得到了同為世界模型創業者謝賽寧的認可。

所以回過頭看,星海圖在“大腦”上的路線其實挺實用主義。

VLA也做,世界模型也做,不是先選一個技術信仰,然後證明另外一條路線是錯的。

而是反過來:那個東西能讓機器人把活幹得更好,就先用那個。如果都好,那就都用。

前面500平方米裡看到的那些Demo,某種程度上就是這套思路的集中展示。

但說到底,模型架構只是第一步,真正能在具身領域拉開身位的,還得是資料以及全端自研帶來的飛輪效應。

資料、本體、模型閉環

星海圖創始人、CEO高繼揚曾不止一次解釋過這套飛輪:

做過自動駕駛你發現:要做物理世界智能,就得有物理世界資料;要有資料,就得有一個收集資料的載體,整機。以前做自動駕駛最大的問題就是軟體供應商拿資料的鏈路不通暢,飛輪跑不起來,這就是致命的問題。

說白了,不掌握本體,就很難掌握資料閉環;資料閉環跑不起來,大腦也就很難持續迭代。

所以在資料上,星海圖一直押注真實資料。

早在去年9月,他們就開源了GOD真實場景資料集,下載量全球第一。與此同時,還通過投資簡智、元流等玩家繼續擴充資料來源,並計畫2026年將真實資料規模做到100萬小時。

而這些資料背後,是星海圖自己的本體體系。

包括最新的雙足機器人Kengo、輪式機器人Nexo在內,星海圖已經先後推出R1、R1 Lite、R1 Pro等一系列機器人。

整機握在自己手裡,帶來的不只是資料來源更可控,模型、控制和硬體也能一起迭代。

據現場工作人員介紹,G0.5這次表現背後,很大程度上就來自自研本體產生的高品質資料,以及模型和本體之間更高效的協同。

這也是具身智能和純軟體系統很不一樣的地方:

機器人最終面對的是物理世界,模型能力、控制演算法、執行器和本體設計彼此牽連,很難完全拆開最佳化。

模型發現新的能力邊界,本體就能針對性迭代;本體升級之後,又能採集更高品質的資料,反過來繼續訓練模型。

於是,一套完整的飛輪也就跑了起來:

資料推動模型,模型定義本體,本體再生產新的資料。

上一代機器人出去幹的每一份活,都有機會變成下一代繼續進化的燃料。

具身智能,開始參加生產力大考

所以再回到開頭那個問題:WRC最大的展台,為什麼是星海圖?

看完整個展台,答案已經很明顯:

星海圖想展示的,不只是機器人又學會了多少新Demo,而是當“自主幹活”逐漸成為行業標配之後,具身智能的考卷已經開始往下一頁翻。

過去,大家先解決的是機器人能不能脫離遙控器,自己把任務做起來。

而真到了工廠、倉庫和真實客戶現場,光“能自己幹”顯然還不夠。

接下來要比的,是換個東西還能不能幹,幹得夠不夠準,速度又能不能跟上。

也就是泛化、精度和效率。

換句話說,機器人真正成為生產力,不只是要“會幹活”,而是要能在真實現場快、准、穩地把活幹下來。

這次500平方米、十幾組Demo,從倉儲揀選、工業裝配,到柔性操作和雙足運動,星海圖某種程度上就是把這張新的考卷,集中攤在了大家面前。

而作為具身“大腦”第一梯隊玩家,它所展示的也不只是自己的能力邊界,更像是在給行業打一個樣:

接下來,不再只比誰的Demo更好看,而是比誰能真正把機器人變成生產力。

從“能不能自主幹”,到“能不能快、准、泛化地干”。

某種程度上,這可能才是具身智能下一階段真正要卷的東西。(量子位)