2026年8月19日,“人形機器人第一股”宇樹科技(688836.SH)正式登陸上交所科創板。發行價150.80元/股,開盤即報1100元/股,暴漲629.44%,總市值一度突破4449億元。截至收盤,股價報845元/股,漲幅460.34%,總市值超3400億元。(拓展閱讀:宇樹敲鐘:王興興身價1400億成科創板90後新首富,多家機構回報超百倍)
這場IPO的造富效應極為顯著。宇樹科技創始人、董事長兼首席技術官王興興直接與間接合計持有公司約30%的股份,以上市首日收盤價計算,其持股市值超千億元,一舉超越影石創新創始人劉靖康,成為科創板“90後”首富。
上市次日,8月20日,王興興現身2026世界機器人大會主論壇。他身著白襯衫、步履輕盈走上台,發表了主題為《從展品到產品:人形機器人產業的下一個十年》的演講。以下為演講全文,創業邦整理髮布。Enjoy
宇樹全系黑科技矩陣
我們公司成立於2016年8月,到現在剛好差不多十年的時間。公司最早是做四足機器人,最近幾年開始做人形機器人。
我們這幾年推出了一款非常成功的機器人——東方機器人。這款產品推出後,基本上成為了全球標竿性的產品。目前大家看到的、或者全球廣泛在用的絕大部分機器人產品,外觀和設計基本上都與它非常相似。
今年年初非常有代表性的《武BOT》節目,融合了中國非常經典的傳統功夫文化。我們提前採集了幾十個非常經典的中國功夫動作,進行 AI 訓練,最終將這些精彩動作展現到了舞台上。這個節目最大的亮點,就是將中國傳統功夫文化與當前全世界最頂尖的人形機器人技術結合在了一起。
這件事在海外的傳播效果非常好,大概有幾百億次的播放量,深受大家喜愛。我認為這是一個非常好的科技與文化交流的範例。
同樣是今年2月份,我們也曾在天壇做過一次簡單的演示,當時現場大概有49台人形機器人同時進行表演,場面非常震撼。天壇擁有幾百年的歷史文化,當機器人出現在現場時,有一種非常強烈的穿越感,將中國幾百年的傳統文化與當前最新的前沿技術融合在一起。
過去幾年,我們公司一直致力於推動機器人真正走進生活、走進工廠幹活。比如在2024年,我們就與汽車工廠合作,推進汽車生產線上的落地應用;此外,我們也在自己的工廠部署了機器人,進行一些簡單測試和落地應用。目前,我們公司絕大部分 AI 團隊都在為此努力,推進機器人真正進入家庭和工廠中使用。
這部分事情我們現在沒有大規模推廣,最主要的原因是目前的效率和泛用性能力還不夠高。簡單來說,雖然目前我們的機器人能做一些簡單裝配,但效率仍比人工更低;另外,每次有新任務時都需要重新調整,效率相對更低。我們希望把技術做得更加泛化、能力更好後再進行大規模推廣,這是目前全球大家共同面臨的最大問題。
今年4月份,宇樹科技刷新了當時人形機器人的最快奔跑紀錄,超越了2016年的奔跑速度。做這些展示的是我們的第一代人形機器人,當年這款售價100萬元的人形機器人,也是中國的第一款,非常經典,同時也是我們後續研發的基礎。
這部分都是由 AI 驅動的。目前來看,基本上是有多少資料、有多少高品質資料,就有多少 AI 能力。我們也在自己採集,或者與第三方公司合作採集資料,既提供給外部使用,也供我們自己使用,資料驅動在其中是非常重要的一環。
目前我個人感覺,真正的 AI 主要以海量的金融資料或網際網路資料作為基礎必須資料,再加上部分真機採集的資料,這是我認為的兩個核心資料來源。從資料量的角度來看,真人資料會更多、更重要;而真人的實際資料也同樣關鍵,因為我們需要將機器人真正與物理世界進行匹配。
今年5月份,我們發佈了一款非常經典且有意思的機器人,它的身高大概有3米高,如果從窄處來看,重量大概在500公斤左右。某種意義上,大家可能會好奇這款產品的實際應用場景。
做一個簡單的比喻,它其實有點像越野車,並不是設計給家庭或在城市日常使用的。很多情況下,比如去戶外徒步,或者在一些非常複雜的環境下進行運輸,都可以使用它。
另外比較有趣的一點是,它可以進行變形,變形後穩定性會更好一些。這也是為什麼我們要把它拿出來真正作為預售機器人來做,因為在四條腿的模式下,它的穩定性相對更好,運輸能力也非常好,簡單來說就是一款類似於“越野車”的產品。
大家知道,很多常規的動作演示,都是提前做好訓練的。而這部分的動作則是基於即時語音生成的。正因為是基於即時語音生成,所以中間會有一點延遲:每句話說完後,需要先進行語音識別,識別後上傳到雲端進行AI 動作生成;動作生成後再進行動作驗證,驗證沒有問題後才下發給機器人。因此,這個過程需要幾秒鐘的延遲。
我們希望未來機器人真正應用落地時,動作都是完全自動生成的,而不是提前進行程式設計。因為中間存在語音處理的過程,所以會帶來延遲。
這種自動生成的方式有一個缺點(或侷限):因為它每次都是自動生成的,所以動作會存在一定的差異性。也就是說,即使是同一句話,它今天和明天做出來的動作可能還是會有略微差異。
不過,我們也正在推動機器人真正走進會議室等場景去幹活。
我認為這也是一件非常重要的事情。比如我們公司的會議室有時會亂糟糟的,在會議室進行整理,其實也是非常重要的一件事。每個公司都有很多會議室,如果比較雜亂處理起來就會很麻煩。而在這裡,任意一個雜亂的會議室,我們都可以讓機器人將其恢復到乾淨整潔的狀態。
這個過程完全是端到端實現的,雖然目前它的運動效率相對還有提升空間。它是多工的,我們在場景中大概佈置了7~8 個不同的任務,使用同一個模型讓它自動切換,不同任務都能直接執行,特別是還具備抗干擾能力。
正因為是AI 即時生成和即時執行,動作絲滑度可能會稍微差一點,因為它每走一步,動作都需要重新進行推理。另外說明一下,我們這個視訊本身是一倍速的原速播放,沒有經過任何加精或加速處理。
因為時間關係,這部分就不多放了。大家如果有什麼問題,後續可以交流。
我們希望像會議室整理這種場景,相對來說具備比較高的實用價值,且難度不是特別大。
另外,剛才演示的自動生成動作只是單純的動作展示,不帶互動或實際幹活的能力;而現在展示的,則是搭載了多模態大模型後,在動作驅動的同時具備了實際幹活的能力。
它們表現得非常自然,比如基本上可以完成裝水等操作。它也比較輕量化,在日常生活中使用會非常方便。非常希望將整個技術落地應用到實際場景中,比如融入家庭生活或進行跨場景的傳承。
2025 年,我本人、我們公司的產品以及我們公司,都登上了《時代》周刊的榜單。
另外,回顧一下最近幾年整個具身智能AI 模型的發展,最主要的流派目前是VLA(視覺-語言-動作)模型和世界模型。當然,今年大家聽到最多的可能是世界模型這個方向。
我們公司在AI 模型上的投入一直非常大,這也是我們目前資金和人力投入最大的方向。早在2024 年初,我們就開始研發基於視訊生成的世界模型方向,但當時在2024 年底做出來的效果不夠理想,中間稍微擱置了一段時間;直到去年,我們又開始大力發展基於視訊生成的世界模型方向。
破解具身智能“ChatGPT時刻”:
如何跨越物理世界的最後1毫米?
大家可能很多人都會問到:真正的通用機器人,無論是人形還是半人形,到底什麼時候能真正走進生活、走進家庭?
目前全世介面臨的最大問題和最大瓶頸,就是泛化能力還不夠。簡單來說,目前的很多AI 模型在固定場景和特定任務下,成功率基本上可以做到接近100%;但如果操作的物品或所處的環境稍微發生變化,它的成功率就會發生非常嚴重的下降。
我希望未來快的話可能兩到三年,或者三到五年,如果那一天大家看到把一台機器人帶到任意的陌生工作環境中,它基本上可以自主完成80% 左右的任務,我認為那就差不多到了具身智能的“ChatGPT 時刻”,而這也就是未來整個產業真正的爆發點。
評價指標其實也沒有那麼簡單。正如剛才提到的,當一台機器人在一個全新的陌生場景中,僅通過語音或語言指令就能完成80% 左右的任務時,我認為這就是一個非常重要的臨界點。
為什麼要達到這個臨界點?要實現這一點,目前最大的瓶頸在於:現在的AI 模型思路與輸出跟機器人的物理控制對齊程度還不夠。
以目前的機器人模型為例,如果你吩咐它去將某些東西歸類分揀在一起,它理解的整體趨勢是沒有問題的,當場也能夠拆解並執行任務。但問題在於,到了最後幾釐米甚至最後幾毫米的微操階段,它的偏差會變大,導致最終的成功率下降。
它沒辦法很好地跟真實世界匹配。當機器人去拿這個東西時,看起來已經快要拿住了,但由於最後一點點觸覺反饋或誤差沒辦法很好地修正,最終誤差不斷累積,導致它的成功率暴跌,東西就掉了下來。
這是目前全世界具身智能面臨的最大問題——AI 模型的輸入和輸出與真實物理世界存在偏差。為什麼機器人上會有這個問題,而一般的語言模型卻沒有?因為語言模型的輸入輸出完全是數字編碼的,無論是輸入還是輸出一個文字,都嚴格限制在固定的向量空間裡,基本上不會有大的偏差。簡單來說,它是沒有損耗的,資料輸入輸出再倒回去沒有任何損失。
但對於機器人來說,它的每一次輸入和輸出都存在偏差和損耗,這就是導致目前機器人泛化能力和成功率相對偏差的核心原因。不過我認為,在未來幾年內這必然是一個可以解決的問題,只是需要一些時間。
另外,我在這裡介紹一下我們昨天剛剛提到的,在過去幾年裡,大家已經在使用AI 進行許多程式設計和軟體開發工作,但對於AI 在硬體和機械開發上的真正應用,則是我們公司最近一段時間一直在推動的事情——即直接讓AI 大模型來驅動物理世界的機器人計算與進化。
簡單來說,就是使用目前最前沿、頂尖的AI 大模型,由我們來設定一些規則、經驗約束以及工具介面。隨後,讓AI 自己去網上搜尋最新的學術論文、最優質的研究成果以及各種開源方案,自主編寫並生成機器人的控制程式碼。
控制程式碼生成後,它可以先在模擬環境中運行偵錯,也可以呼叫大模形狀態,直接去操控一台實體的物理機器人。
生成控制程式碼後,我們會在實物機器人上進行部署測試,並對此進行評價和打分。其中,一部分評價打分由機器的AI模型自主完成;另一部分則可以由人工參與評價打分,因為人類的經驗非常重要,能夠非常直觀且容易地判斷出結果的好壞。
這套邏輯體系一旦成功運行起來,整個機器人的開發效率就會大幅提升,迭代速度也會非常快。流程一旦穩定運行一段時間,就能真正實現機器人自我進化能力的提升。
這裡有一個簡單的示例展示其運作方式:左下角就是程式碼編寫介面,它能夠自主生成機器人的控制程式碼(包含許多複雜的程式碼),感興趣的朋友可以嘗試一下。
目前的許多簡單強化學習演算法以及自動程式設計項目,其實在程式碼生成方面表現得已經相當不錯。
我們把生成的程式設計效果放到模擬環境中進行驗證與訓練;訓練完成後,再部署到實物機器人上進行測試;測試後由AI模型以及人工進行效果評估與檢查,最後將結果反饋給程式設計智能體,從而形成正向閉環。
這裡展示的是一個最基礎的簡單示例,實際應用時會比這複雜得多。我認為這是當下及未來幾年全球最值得探索和投入的方向之一,感興趣的朋友可以關注一下。
為什麼要這麼做?主要有幾個簡單的原因:
第一點,隨著基礎模型的能力在每月、每年持續提升,這種自我進化的閉環能力也會隨之進一步增強。因此它是一個非常良性的循環,某種意義上能夠直接跟隨全球AI 技術的進步而共同進化。
另外,這種方式可以更高效地利用多中繼資料。大家都知道,人工處理資料的效率非常低;而採用自循環體系,我們可以把訓練資料、真實世界資料以及人類資料等各種資料充分利用起來,從而提升整體的使用效率,並支援更大量的真機部署。
隨著真機部署數量越來越多,我們將積累更多的測試資料以及更豐富的評價指標。這樣一來,整個資料的利用率和增長速度就能得到保障,從而實現資料的規模化。同時,我們也可以按天或按月不斷累積和沉澱技能,而不是今天開發完一個技能、明天就把這個技能浪費掉,我認為這是非常關鍵的一點。
真正利用AI 來大幅提升機器人的開發效率與進化速度,是未來非常值得探索的方向。這也將開啟物理世界AI 對話的新時代,相信未來會有越來越多的人共同推動這個方向的發展。
Physical AI開啟人機共生的
下一個黃金十年
回顧過去這近十年的時間,我們公司最早在2017、2018 年就一直在參加世界機器人大會,一路走來感受非常深刻。
我認為未來十年將是一個全新的起點和開始。尤其是在當下AI 大爆發、全球關注度極高的時間節點上,整個機器人的進化速度已經大幅提升,未來的發展速度甚至會比預估的還要更快。
(創業邦)
