當地時間9月17日,人形機器人公司Figure發佈神經網路模型Helix 2.5,並公佈了一組零樣本全身自主實驗結果:在沒有任何新資料採集與環境適配的情況下,機器人的零樣本成功率從9%暴增至56%。
Figure創始人兼CEO佈雷特·阿德科克(Brett Adcock)表示,公司租下舊金山灣區的30套住宅,讓Helix 2.5在不採集新資料、不額外訓練、也不做環境適配的前提下直接執行任務。Figure要回答的是:機器人能否進入從未見過的家庭,直接開始做家務?
官方部落格將Helix 2.5稱為Figure迄今最先進的神經網路,旨在驗證人形機器人能否僅憑已有知識,在未經微調的環境中自主完成長時程任務。
人類能走進陌生房屋並立即投入工作,是因為對物理世界的認知具備跨環境遷移能力,無需因床高或家具佈局變化重新學習。傳統機器人通常依賴在具體環境中採集資料並做針對性訓練。Figure希望打破這一範式:先讓機器人從大規模人類行為經驗中學習,再將其通用能力直接遷移到陌生真實環境。
01
租30套房,不採資料,直接幹活
在官方演示中,Figure 03人形機器人進入一套完全陌生的房子,連續完成三項長時程全身任務:整理客廳、鋪床、折毛巾。
整理客廳時,散落各處的玩具被機器人逐一撿起放入籃子。阿德科克在相關視訊和帖子中強調,機器人此前從未進入這些房間,公司沒有為這些新環境採集資料。機器人需要一邊移動、一邊尋找目標物體、調整身體姿態,再完成抓取和放置。
鋪床任務更難。機器人從未進過這個房間,從未見過這張床,也從未見過這些床上用品。它必須抓起枕頭、拉動被子,把相關物體移動到指定位置,並將被子拉平。折毛巾則被Figure用來測試對可變形物體的操作能力:機器人需要抓起此前沒有見過的毛巾,完成摺疊,再將其放入籃子。
Figure表示,Helix 2.5是公司建構過的最先進神經網路。一個經過Index預訓練的基礎模型被用於三個不同任務,覆蓋移動、剛性與可變形物體操作、雙手協調以及主動感知。
這些任務之所以被選中,是因為它們要求同時解決多個經典機器人問題:感知、移動、操縱、雙手協調以及全身控制,而且必須即時完成。大部分機器人泛化研究都建立在圍繞機器建造的環境中,例如桌面機械臂侷限於固定工作空間,輪式機器人則需要足夠開闊的地面供底盤移動和轉向。但家庭環境不會配合機器人,人形機器人必須讓自己的身體成為任務的一部分,在狹窄、雜亂的空間中移動、觀察、伸手和操縱物體。
這裡還有一個需要特別說明的概念:Figure所說的“零樣本”,主要針對評估環境和被操作物體。30套評估住宅此前沒有採集資料,評估使用的玩具、毛巾和床上用品也沒有出現在任務指定資料中。機器人直接使用各個陌生家庭中的沙發、床和摺疊毛巾完成任務。
換句話說,Helix 2.5並不是完全沒有接受過“整理客廳、鋪床、折毛巾”的任務訓練。三個行為本身經過了在其他環境採集的任務指定資料適配,Figure真正想驗證的是:這些已經學會的行為,能否在從未見過的住宅和物體上直接泛化,而不需要到了現場再重新訓練。
評估標準極其苛刻:整理客廳要求把13至15個玩具全部收好,折毛巾要求完整摺疊入籃,鋪床要求枕頭與被角拉至床頂三分之一併平整。任務要求端到端完全成功,不提供任何部分得分;每個任務均使用同一個固定模型節點(測試版本),不針對新環境調整模型參數;過程只要出現一次人類安全干預,便直接判定失敗。
Figure表示,它將Helix 2.5部署到30套此前沒有進入過的灣區住宅。每次試驗開始前,評估物體都會被提前放置,並由AI模型結合人工稽核確認這些物體沒有出現在任務指定資料中。每一次試驗還使用獨立的初始配置,並對所有被評估策略採用相同的重設條件,以保證比較公平。
在試驗層面,官方部落格給出的關鍵資料是:零樣本成功率從9%提升到56%,即提升至原來的6倍以上。這裡的“成功”指完整任務成功,而不是完成其中一部分。
02
Index預訓練,人類經驗是機器人的“漏洞”
Helix 2.5的關鍵不只是模型,而是它背後的Index。
Figure的邏輯很簡單:大語言模型之所以能夠不斷擴大能力,一個重要原因是網際網路提供了海量人類資料,使預訓練能夠隨著資料和算力規模擴大而持續獲得收益。但機器人沒有網際網路規模的行為資料。Figure因此試圖建立一個大規模的人類行為資料集Index,讓機器人先從人類如何在真實世界中行動、抓取和操縱物體的經驗中學習。
Figure在此前關於Index的介紹中,將其定位為全球規模的人類行為資料集。Helix 2.5則進一步驗證:這些人類經驗能否轉化成真正的機器人行為能力。
Figure表示,目前Index每秒能夠產生約35分鐘的新的人類經驗資料。與此同時,公司已經承諾投入35億美元算力訓練Helix。
最關鍵的問題是:這些人類經驗,真的能轉化為機器人行為嗎?
Figure做了一組控制實驗:兩個模型使用完全相同的任務指定資料,架構、最佳化方式、超參數、下游資料和評估方法全部保持一致,唯一變數就是是否進行了 Index預訓練。
實驗對比了兩個模型:一個是從零開始隨機初始化權重的基線模型,另一個則是先經過Index海量資料預訓練的Helix 2.5模型。Helix 2.5本身完全是從隨機權重開始、僅依靠Index資料完成預訓練的,這與上一代Helix 02截然不同。Helix 02當初是基於現成的預訓練視覺語言模型進行初始化的。
結果非常明顯。沒有Index預訓練的策略,零樣本成功率只有9%;加入Index預訓練後,成功率達到56%,超過前者6倍。由於預訓練是唯一的實驗變數,Figure認為,這一差距可以直接衡量Index預訓練對零樣本能力的貢獻。
而且,Index的訓練資料並不是專門圍繞這三個測試任務建構的。Figure表示,沒有任何一個評估任務佔Index預訓練資料的比例超過1.90%。這意味著模型獲得的預訓練經驗並不是簡單地“反覆學習如何折毛巾、鋪床和收玩具”,而是試圖從更加廣泛的人類行為中形成可遷移的能力。
資料效率同樣發生變化。Figure將Helix 2.5與一個執行相同任務的Helix 02策略進行比較:後者使用在實際評估環境中直接採集的資料,而Helix 2.5 在達到相當成功率的情況下,只需要一半的適應資料,並進一步將行為泛化到30套此前沒有見過的住宅。
Figure因此將這一結果概括為:行為指定成本降低2倍,同時部署範圍擴大30倍。
另一個值得關注的變化,是Helix 2.5的全身自我糾錯能力。在長時程任務中,機器人並非每一步都能一次完成。如果抓取或者摺疊出現偏差,它可能後退重新定位、改變站姿,甚至繞到整張床的另一側繼續完成任務。Figure將這種“犯錯後恢復並繼續推進”的能力,視為Index預訓練帶來的重要效果之一。
更長遠看,Figure還報告了一條“人類到人形機器人”的遷移縮放定律。團隊在Index的巢狀子集上訓練四個模型,預訓練資料規模逐步擴大,最大跨度達到 8 倍,同時保持模型規模和下游訓練不變。實驗結果顯示,隨著 Index 資料量的每次翻倍,下游機器人對下一步動作預測的損失值(loss),均呈現出平滑且可預測的下降趨勢。
更為關鍵的是,這種下降趨勢展現出極高的可預測性。Figure 表示,僅憑較小資料量訓練得出的測試結果,便能在最大規模模型訓練啟動前,精準預測出其測試損失值至小數點後四位,預測誤差僅佔完整8倍資料量變化範圍的0.54%。
Figure稱,這是首次在人形機器人上測量“人類到機器人遷移縮放定律”。它意味著,一個此前主要存在於大語言模型領域的思路,通過擴大預訓練資料規模,預測未來模型能力的提升,可能也能夠延伸到人形機器人。
當然,這裡測量的只是資料規模的縮放關係,模型規模和下游訓練都保持不變。因此,它還不能直接證明“機器人模型越大就一定越強”,但至少說明:在當前實驗中,增加人類經驗資料與機器人動作預測能力之間存在可預測關係。
03
重新劃定“學習”與“部署”的邊界
從Helix02到Helix 2.5,Figure實際上在改變一個前提:機器人不必每進入一個新地方,就重新學習一次。
Helix 02曾展示全身長時程控制能力,從卸洗碗機到自主運行200小時物流任務,但這些系統學習的資料來自機器人將要運行的地方。Helix 2.5則試圖證明:全身智能可以從人類經驗中學習,並遷移到新場景,而不是每次進入一個新環境後重新建立。
這也是Helix 2.5與此前機器人系統之間真正值得關注的差別。
傳統機器人的資料閉環往往是“機器人進入環境採集資料,訓練模型,再進入環境”。這種方式可以不斷提高單一場景中的表現,但如果機器人最終要進入千家萬戶,就意味著每一個家庭都可能成為一個新的資料採集和訓練對象。
Figure想建立的則是另一條路徑:人類先在現實世界中積累經驗,Index將經驗規模化,Helix 2.5從人類經驗中預訓練,機器人把行為知識帶到陌生環境中。
如果這一模式繼續成立,那麼機器人資料的來源就不再侷限於機器人本身。人類已經在現實世界中積累了數百萬年的物理互動經驗,而Figure想做的是把其中一部分轉化為機器可以學習的訓練資料。
Figure在官方部落格中也明確強調,這並不意味著通用人形機器人問題已經被解決。它認為,Helix 2.5提供的只是第一個證據:全身智能可以從人類經驗中學習,並轉移到新的場景,而不需要每次重新建構。
Figure給出的結論非常直接:如果Helix 2.5驗證了這套邏輯,那麼未來投入更多的資料與算力,就能讓機器人在踏入任何新家庭之前,預先掌握更多關於物理世界的認知。
正如阿德科克在官方視訊結尾時所說:“是時候擴大規模了(It’s time to scale up)。”當預訓練汲取自海量的人類經驗,部署應用在陌生的真實家庭,具身智能的邊界正被重新定義:機器人不必每到一個新家就重學一遍,而是先向人類學習,再通往千家萬戶。 (騰訊科技)
