世界模型有觸覺了!50萬小時視訊,訓出首個隱式觸覺世界動作模型

AI速讀
BeingBeyond(智在無界)推出 Being-H0.8 模型,實現了將觸覺整合進世界動作模型的突破。透過 50 萬小時人類視訊資料及創新的隱式觸覺表徵技術,模型能讓機器人在缺乏顯式觸覺標註的情況下,學習對接觸與受力的判斷。藉由 MoT 模組與慢-快動作專家架構,機器人可完成毛筆寫字、擠牙 toothpaste 等精細操作。此次發布顯示該公司已建立起從資料收集、觸覺標註到機器人控制的完整鏈路,推動具身智能向更高物理精準度發展。

剛剛,BeingBeyond智在無界發佈首個基於人類視訊資料的隱式觸覺世界動作模型——Being-H0.8

作為一套帶有觸覺的隱式世界—動作模型,Being-H0.8在預訓練階段就教會機器人提前判斷將要怎樣接觸物體,並在真正接觸後,根據觸覺反饋及時調整動作。

相比於過去根據畫面決定做什麼動作的世界模型,Being-H0.8這次把觸覺放進了“預測—執行—反饋”的完整鏈路:

模型先根據當前畫面,預判接下來可能發生的接觸,執行過程中再讀取最新觸覺,重新生成下一小段動作。

具體來說,為了實現這一點,Being-H0.8從資料、模型和控制三層同時入手:

資料:彙總數十家合作夥伴的資料,建立超過50萬小時的原始資料池,形成高品質資料集UniHand-3.0 ,並通過TactoHand生成接觸和鄰近度標註。

  • 模型:預訓練時,把動作執行後實際記錄到的視覺和觸覺結果作為監督,讓模型學習僅憑當前指令和畫面,提前判斷接下來會怎樣接觸。
  • 控制:每個動作塊開始時,模型先生成完整動作計畫;每執行一小段,就讀取最新機器人狀態和觸覺,只重算下一小段動作。

基於這套方法,Being-H0.8在真實雙臂機器人實驗中,完成了包中取物、毛筆寫字、擠牙膏、夾薯片等依賴觸覺的高難度精巧任務。

首個基於人類視訊資料的隱式觸覺世界動作模型

要說Being-H0.8這次最值得關注的亮點,當屬創新的隱式觸覺世界動作模型架構和超50萬小時的超巨量資料集了,咱們先來看模型層面。

對於具身模型而言,觸覺不僅關係到精細操作,還能幫助它完成僅憑視覺難以實現的接觸推斷。

因此,過去兩年,圍繞觸覺如何賦能具身基礎模型,學界已經湧現出不少探索,李飛飛、徐丹飛、Wenzhen Yuan、宋舒然等研究者也都在推進相關方向。

但如果我們把問題進一步聚焦到世界模型,就會發現:觸覺究竟該如何進入世界模型,仍然是一個開放問題。

一方面,現有的世界模型大多以視覺為核心。它們可以看到物體如何移動、形變,卻很難精準判斷接觸是否發生、接觸發生在哪裡,以及物體正在承受怎樣的作用力。

另一方面,觸覺感測器雖種類繁多,但資料形態和表徵方式並不統一。更現實的問題是,絕大多數大規模人類視訊和機器人資料集,本身就沒有同步記錄觸覺資訊。

這就意味著,想要訓練一個具備觸覺能力的世界模型,不僅缺少統一的觸覺表徵,也缺少能夠規模化獲取的訓練資料。

Being-H0.8正是智在無界針對這一問題給出的解法。

Being-H0.8在Being-H0.7隱式世界—動作模型的基礎上,首次把觸覺模態納入隱空間表示中,將原本以視覺預測為主的建模方式,進一步擴展為隱式觸覺世界—動作模型(Latent Tactile World-Action Model),把觸覺預訓練擴展到可規模化的第一視角人類視訊資料。

這裡的關鍵在於,Being-H0.8並不試圖在像素層面完整重建未來畫面,而是在隱空間中預測與任務真正相關的互動後果,例如是否發生接觸、接觸可能帶來怎樣的狀態變化,並利用預測出的潛在狀態進一步調節動作生成。

換句話說,Being-H0.8試圖讓機器人不只“看到”接下來會發生什麼,還能從沒有顯式觸覺標註的人類視訊中,學習對接觸與受力結果的隱式判斷。

具體的,Being-H0.8由四個核心模組組成:負責預測互動後果的Mixture of Transformers (MoT)、負責執行與即時調整的慢—快動作專家、負責統一觸覺輸入的通用觸覺編碼器,以及負責統一動作空間的TopoHand

其中,通用觸覺編碼器首先將不同感測器採集到的觸覺訊號,轉換為統一的觸覺token,從而降低不同裝置、不同資料形態之間的差異。

而慢—快動作專家,則負責兼顧推理效率與接觸反饋。

慢速流快取視覺、語言和隱世界狀態等計算成本更高的上下文,負責維持整體任務與動作計畫;

快速流則在動作執行過程中,讀取最新狀態和觸覺反饋,只重新生成接下來的一小段動作。

這樣一來,機器人不必每次接收到觸覺變化都重新計算完整計畫,也能根據滑動、受力變化或接觸偏移及時調整動作。

在訓練階段,未來時刻的觸覺token會進入MoT的後驗分支,幫助模型理解真實接觸發生後,世界狀態會如何變化。

到了部署階段,MoT負責提前預測互動後果,慢速流維持整體上下文,快速流則根據最新觸覺即時糾偏。

由此,觸覺不再只是動作完成後的附加反饋,而是同時進入了機器人的“預測、執行與調整”過程。

超過50萬小時的資料池

聊完模型,一個很自然的問題是:那訓練模型的資料從哪裡來呢?

這就要進入Being-H0.8的另一項關鍵工作——資料。

作為國內最早一批利用大規模人類視訊預訓練具身基礎模型的企業之一,智在無界一直沿著人類視訊預訓練這條路線持續積累資料,並將其用於具身基礎模型訓練。

Being-H0.8的資料底座,正是這條路線長期積累的結果。

歷經Being-H0到Being-H0.8的持續迭代,智在無界已匯聚了超過500,000小時的第一人稱視訊資料,並與數十家資料供應商開展合作。

這些視訊資料覆蓋自然物體互動、長時程任務、豐富手部動作與多樣場景,為具身模型提供大規模人類互動經驗。

據智在無界團隊介紹,這也是目前國內規模最大的人類操作視訊資料池

但50萬小時原始視訊,並不等於50萬小時可以直接用於訓練的資料。

這些視訊中混有大量看不到手、缺少有效操作、鏡頭劇烈抖動、與桌面物體互動無關或內容高度重複的片段;不同資料來源在場景、任務、視角和動作分佈上,也存在明顯差異。

為此,團隊搭建了一套面向數十萬小時視訊的資料處理管線,對原始資料進行過濾、去重、切分、語言標註和分佈再平衡。

首先,團隊會剔除無效片段,並將長視訊切分為連續的短片段,再為其補充細粒度語言描述。

不過,只有畫面和文字還不夠。

具身模型不僅要知道畫面中發生了什麼,還要知道人的手處於什麼狀態、執行了怎樣的動作。

對於缺少精準動作標註的人類視訊,團隊使用MANO統一表示手部狀態,通過HMR(hand motion refinement,HMR)恢復和細化裸手運動軌跡,再利用Caliball補齊缺失的相機參數,從視訊中進一步恢復出可用於學習的手部動作資訊。

對於機器人資料,團隊重新整理了規範化URDF,並統一關節約定、相機坐標系和手腕位姿表示,再針對各個資料集完成校準、同步和驗證。

此外,團隊還會逐項檢查資料完整性、運動學一致性、跨模態同步情況,以及語言描述與視訊內容是否匹配。

經過過濾、重建和標準化後,來自不同來源的人類視訊與機器人軌跡,才被整理為相對統一的資料格式,最終形成UniHand3.0訓練資料。

不過,到這裡,這套資料仍然缺少最關鍵的一環——觸覺。

把沒有觸覺的視訊,變成可訓練的觸覺資料

經過前面的清洗、重建和標準化,模型雖然獲得了大規模運算元據,卻依然無法直接知道:接觸發生在哪裡、力度如何變化,以及物體在接觸後產生了怎樣的反饋。

Being-H0.8接下來的工作,就是把這些原本沒有觸覺記錄的視訊,轉化為可以參與模型訓練的觸覺資料。

整套pipeline可以分成四步:

第一步,利用TactoHand從普通人類視訊中恢復接觸位置和鄰近關係。

  • 第二步,引入壓力手套等真實感測器資料,為視覺推斷補充物理壓力資訊。
  • 第三步,通過通用觸覺編碼器,將不同來源、不同粒度的觸覺訊號統一成固定格式的觸覺token。
  • 第四步,利用TopoHand對齊人手、靈巧手和平行夾爪的結構與動作空間。

沿著這條路徑,沒有顯式觸覺記錄的人類視訊,最終被轉換成了能夠進入世界模型的統一觸覺與動作表徵。

第一步:從視訊中恢復接觸

Being-H0.8首先提出了TactoHand,用於從無觸覺標註的人類視訊中預測稠密的偽觸覺監督,從而解決大規模人類視訊普遍缺少觸覺訊號的問題。

TactoHand的核心思路是,不要求每段人類視訊都同步採集真實觸覺,而是先利用手與物體之間的三維幾何關係,推斷接觸是否發生。

在帶有三維標註的資料中,系統可以獲得已經配准的手部網格和物體網格。通過計算手部頂點與物體表面的距離,並結合二者表面方向,TactoHand可以判斷手部不同位置是否與物體發生接觸。

在此基礎上,TactoHand會在MANO手部表面的778個頂點上預測兩類資訊:

一類是接觸標註,判斷哪裡已經碰到物體;另一類是鄰近度標註,描述手指從靠近物體到真正接觸的連續過程。

這套模型使用21個人—物互動資料來源、共計3010萬幀資料進行訓練,並引入時序資訊輔助判斷。

畢竟,單張畫面中看似貼在一起的手和物體,也可能只是視角重疊;結合連續動作,才能更準確地判斷接觸是否真的發生。

訓練完成後,TactoHand便可以應用到普通第一視角視訊。UniHand3.0會先重建並跟蹤視訊中的手部運動,再將預測出的接觸和鄰近度資訊對應回統一的MANO拓撲。

對於重建結果不可靠的位置,系統會將其標記為無效,而不是直接判斷為“沒有接觸”。

第二步:用真實感測器補充壓力

不過,從視覺中推斷接觸,終究不能完全替代真實觸覺感測器。

幾何關係可以幫助模型恢復接觸位置和鄰近程度,卻很難完整獲得壓力、摩擦、剪下力、滑移和材質等更細緻的物理資訊。

因此,UniHand3.0還加入了約55小時、540萬同步幀的壓力手套資料,並將真實壓力訊號投影到同一套MANO手部表面。

兩類資料由此形成互補:大規模人類視訊負責覆蓋更多物體、場景和動作,真實觸覺感測器則負責提供更加精準的物理壓力資訊。

第三步:統一不同觸覺資料

但觸覺資料有了,格式仍然是亂的。

有些資料只標記是否發生接觸,有些來自少數幾個指尖感測器,有些提供逐頂點的鄰近度或壓力資訊,還有大量樣本完全缺失某一類觸覺通道。

為此,Being-H0.8設計了通用觸覺編碼器(Universal Tactile Encoder),在統一手部拓撲上建立了一套由粗到細的觸覺金字塔。

從整隻手是否發生接觸,到具體手部區域、指尖,再到逐頂點的壓力或鄰近度,不同來源的資料都可以被對應到對應的空間粒度。

每個觸覺token除了記錄接觸、鄰近度或壓力,還會攜帶三維位置、拓撲位置、左右手資訊和有效性標記。

其中,有效性標記尤其重要。因為“沒有壓力感測器”和“壓力讀數為零”,顯然不是一回事。

最後,模型通過Perceiver結構,將長度不同、密度不同的觸覺輸入,壓縮成固定數量的觸覺token。

第四步:對齊人手與機器人動作

觸覺表示統一之後,還要跨過人手與機器人之間的動作鴻溝。

人手、靈巧手和平行夾爪在幾何結構、自由度和控制空間上都存在明顯差異。同一個“捏住”“抓取”或“鬆開”動作,在不同本體上可能對應完全不同的表示方式。

為此,Being-H0.8設計了TopoHand,將手部表示拆分為手腕位姿、形態編碼、20個規範關節角和夾爪張開量,讓語義相近的動作進入相同的表示槽位。

它並不沒有把所有手改造成同一種結構,而是將人手、靈巧手和夾爪開始使用一套可以相互對齊的動作語言。

至此,從普通視訊中恢復的隱式觸覺、真實感測器採集的壓力訊號,以及不同本體的動作資料,才真正被統一到同一套表示體系中。

這套資料pipeline解決的是觸覺“從哪裡來、如何統一”的問題:

TactoHand負責從大規模視訊中補出接觸監督,真實感測器提供更準確的壓力資訊,通用觸覺編碼器將不同訊號轉化為統一的觸覺token,TopoHand則進一步對齊人手與機器人動作。

完成這些準備後,觸覺才真正進入Being-H0.8的“預測—執行—反饋”鏈路:訓練時幫助Being-H0.8學習接觸會帶來怎樣的狀態變化,部署時則作為即時反饋,持續修正機器人接下來的動作。

團隊介紹

最後,讓我們簡單介紹一下Being-H系列背後的團隊——

BeingBeyond(智在無界)。

BeingBeyond成立於2025年5月。創始人盧宗青是北京大學電腦學院長聘副教授、智源學者,長期從事強化學習和多模態模型研究。

在學術界,他最早開始探索利用大規模人類視訊訓練具身模型,這也成為BeingBeyond此後技術路線的起點。

回看Being-H系列的發展,這條路線大致經歷了三個階段。

第一階段解決的是“人類視訊怎麼用”。從Being-H0到Being-H0.5,團隊首先驗證了利用人類視訊預訓練具身模型的可行性,讓機器人能夠從人類操作中學習可遷移的動作經驗。

第二階段關注的是“怎麼規模化地用”。從Being-H0.5到Being-H0.7,團隊不斷擴巨量資料規模,並進一步解決跨本體學習和隱式世界建模問題,讓海量、異構的人類視訊能夠真正參與具身模型訓練。

到了Being-H0.8,問題則進入第三階段:人類視訊怎麼高品質地用。重點不再只是繼續增加資料量,而是通過清洗、動作恢復、觸覺標註和表徵統一,從海量原始視訊中提取更準確、更具物理意義的訓練訊號,以高品質資料推動模型能力進化。

因此,Being-H0.8補上的不只是一個具備觸覺能力的世界模型,更標誌著Being-H系列的資料路線完成了一次轉向:從驗證人類視訊能不能用,到解決海量視訊如何規模化使用,再到進一步追問,能從這些視訊中提取出多少真正有價值的物理經驗。

對BeingBeyond而言,核心壁壘也不再只是擁有多少視訊,而是能否把資料收集、清洗、動作恢復、觸覺標註、世界建模與機器人控制接成一條完整鏈路,持續將原始視訊轉化為機器人可以學習和復用的物理經驗。(量子位)