8月21日,2026世界機器人大會主論壇上,進行了一場關於"世界模型到服務人類的現實距離"圓桌對話。就在這場對話開始前,中國電子學會世界模型專家委員會宣佈正式成立,中國工程院院士、之江實驗室主任王堅出任主任委員。這一動作強化了一個訊號:世界模型——這個被寄望於讓AI真正理解物理世界的核心技術,正從學術概念走向產業共識。
世界模型被公認為具身智能走向落地的"核心基座",但它究竟卡在那裡?正如浙江人形機器人創新中心首席科學家熊蓉在演講中指出的——“物理世界具有不可約簡性”,這就是世界模型當前面臨的困境。結合大會多位嘉賓的觀點,世界模型從實驗室走向現實必須跨越三道檻。
世界模型不是大模型的延伸
要理解世界模型的卡點,首先要釐清一個認知誤區:世界模型不是大語言模型的延伸。
大語言模型基於網際網路文字資料訓練,擅長語言理解和生成,但它不理解物理世界。它知道"杯子"這個詞,但不知道杯子是圓的、易碎的、會被打翻的。
世界模型則要讓機器人理解物理世界,理解空間關係、物體屬性、因果推理和行動後果。
奧比中光創始人黃源浩提出,大語言模型只能做語音互動,GPT指向“詩和遠方”,世界模型才能落地幹活;“幹活”這件事需要空間智能,也需要視覺、觸覺等高品質同步資料作為訓練養料。大曉機器人董事長、商湯科技聯合創始人王曉剛將世界模型的發展劃分為三個階段:第一階段是資料增強,通過世界模型生成多樣化訓練資料;第二階段是模擬閉環,結合機器人控制在虛擬環境中試錯;第三階段是具身智能,讓機器人真正感知、理解物理世界並指導行動。
從嘉賓發言看,行業目前仍處於第一階段向第二階段過渡的處理程序中。要達到第三階段,至少面臨三大卡點。
卡點一:真實世界資料的獲取成本
世界模型落地的第一道檻是資料。世界模型需要大量真實世界資料來訓練——不是網際網路上的圖片和文字,而是來自感測器、攝影機、機器人本體的多模態物理資料。
問題在於,這類資料的獲取成本極高。
資料問題有多棘手?熊蓉直言——低成本、大規模、高品質。她指出,目前已有多管道的資料採集方法,但如何提升資料質量,仍需持續最佳化。
英特爾物理AI與機器人業務總經理Nagesh Puppala也提出了類似觀點:"物理AI需要感測器資料、真實世界資料,而不僅僅是網際網路資料。"
這與大模型的訓練邏輯截然不同。大模型可以從網際網路上抓取海量文字,但世界模型的資料必須來自真實物理環境——機器人在工廠裡抓取物體的力反饋、在倉庫裡行走的視覺流、在裝配線上操作的運動軌跡……這些資料採集成本高、標註難度大、隱私約束多。
如何低成本獲取大規模高品質的真實世界資料,是世界模型面臨的第一道檻。
卡點二:Sim2Real——模擬與真實的鴻溝
但有了資料,不等於模型就能直接可用。第二個卡點,來自模擬與真實之間的鴻溝。在模擬環境中訓練的模型,部署到真實世界後往往表現不佳。這就是業界常說的"Sim2Real"(即simulation to reality)問題——在模擬裡面去學習,就會面臨模擬和現實的鴻溝。"
為什麼模擬訓練出來的模型,到真實世界會"水土不服"?
熊蓉分析了深層原因:"物理世界具有不可約簡性。我們的專家模型無法用一套總結學習出來的規則去描述物理世界的複雜性。同樣,現在的資料和模型能力,也沒辦法讓它涵蓋物理世界的豐富性和複雜性。"
具體而言,模擬環境很難完整復刻真實世界的物理規律——摩擦力、彈性、流體動力學的模擬都存在近似誤差;現實裡的光照變化、物體遮擋、環境反射又會給感測器帶來噪聲和不確定性;現實中大量長尾、罕見場景,也很難在模擬環境中全部窮舉。
為解決這一問題,業界正在探索多條路徑。浙江人形機器人創新中心提出了"Real→Sim→Real資料飛輪"方案:先在真實環境中採集資料,通過高保真重構匯入模擬環境,在模擬中增強訓練,再部署到真實環境進行校正。
熊蓉也提出"噪聲注入訓練"的思路——在模擬環境中主動向感測器資料注入光照變化、運動模糊、物體遮擋等各種噪聲,使模型學會在不確定的環境中做出魯棒決策。
但這些方法仍處於探索階段。Sim2Real的鴻溝,是世界模型走向落地的核心障礙。
卡點三:感知與表徵——從看世界到懂世界
世界模型的第三道檻,在於"理解"。即便拿到了資料、跨過了模擬與真實的鴻溝,模型仍要真正"懂"物理世界——而這恰恰是當前世界模型表徵層與感知層共同的短板。
今天的多數世界模型,本質上是"看世界"而非"感受世界"。它們靠視覺表徵學習,能識別物體的形狀和位置,卻難以表達物理互動的本質。熊蓉在主題演講中指出,具身智能的核心在於與環境發生互動,這種互動"並不僅僅體現在視覺上面","互動一定涉及力觸覺,並且這種力觸覺會跟形狀、重量、材質、行為都是強相關的",僅靠視覺很難還原這種物理互動的本質。
XELA Robotics 的Alexander Schmitz 也強調:"視覺資料不足以抓取和操作物體,需要觸覺資料來解決這個問題。"這意味著,抓取、裝配、插入這類物理互動,依賴的恰恰不是"看見"而是"感受"。業界正在探索將視覺、力覺、觸覺融合的通用表徵方法,但距離成熟落地仍有距離。
更進一步,模型即便"看見"了環境,也未必"理解"。熊蓉直言,語言視覺大模型"缺乏空間理解和物理常識,在開放混雜場景下精準性顯著下降","當它看不清、測不準的時候,就會直接影響行為的生成"。
無界動力創始人張玉峰談到,世界模型的核心不僅是看到物體,更要理解物體的物理屬性以及如何與之互動。但從3D空間感知到完備的物理常識,感知層要走的路還很長。
表徵與感知這兩層一旦補全,世界模型才真正從"看世界"走向"懂世界"——而這,也是它服務人類的前提。
卡點雖多,並不意味著中國在這一領域沒有機會:中國已有近200家人形機器人整機企業,服裝倉簽約百台級、服裝細分領域拿下2000台訂單,這些正在運行的機器人,既是世界模型的使用者,也是其資料來源。
世界模型不是大語言模型的延伸,而是一場關於物理世界認知的範式革命。它的難度遠超語言理解,但它的價值也遠超語言理解。卡點即機會——誰先突破這些卡點,誰就有機會在具身智能時代佔據先機。(中國電子報)
