Part I 世界模型之戰,面向豪賭的瘋狂下注
2026年6月,北京、上海、深圳。過去三個月裡,幾乎每一個頭部VC都在做同一件事:尋找世界模型。一些基金開始要求投資經理重新梳理項目庫;一些機器人公司突然被重新定價;一些原本做視訊生成的團隊,被貼上了新的標籤--世界模型
一位創業者說:"今天大家講世界模型的時候,腦子裡大機率都不是同一個東西。" 所有人都說自己在看世界模型。一位投資人笑著說:"現在不是搶項目。是在搶船票。" 因為沒有人知道,下一個OpenAI 或DeepSeek會不會從世界模型裡誕生。但所有人都知道,如果真出現了,不能沒上車。於是,一場新的 FOMO 開始了。這裡沒有贏家,只有面向豪賭的瘋狂下注
Part II 一場數百億融資背後的集體共識
2026年以前,世界模型還只是研究方向,2026年之後,世界模型已經變成一級市場最擁擠的賽道之一。我們先來看看海外市場資料:截至2026年,僅美歐市場對世界模型公司的投資已超50億美元,機器人行業2022至2025年間融資超過180億美元,美國新一代機器人公司合計估值突破1000億美元。而國內,根據IT橘子統計,截至2026年6月,中國已出現33家以世界模型為核心方向的創業公司,累計融資超260億元,其中7家公司估值超百億元,85%的公司成立於2023年之後,中國幾乎所有頭部VC都已經入場(我們Top華人科創社也簡單統計了部分World Model概念相關公司,如上圖)
過去十年,AI 創業的固定路徑。畢業,進入大廠,做到負責人,再出來創業。今天,這條路徑已不是唯一,越來越多創業者,直接從高校/實驗室走向創業。與此同時,自動駕駛公司賽道已經成熟,公司紛紛上市,其核心技術負責人開始重新創業;視訊模型公司開始重新定義自己,基礎模型團隊也陸續走向獨立。四撥人,四場斥資數百億的豪賭。一位人民幣基金投資人形容得很直接:“現在一線美元基金負責攢局,市場負責重新定價,其他基金接盤。”
Part III 第一類豪賭:高校實驗室,開始成為創業工廠
世界模型這波創業潮裡,高校實驗室顯得格外矚目!清華李一鳴|封碩、北大楊超|盧宗青、交大李永露|鄒應天…。越來越多創業者,直接從實驗室走向融資桌
01.逆矩陣:三個月,估值漲了超過十倍
逆矩陣,是今年討論最多的團隊之一,融資堪稱神速! 第一輪融資時,楊耀東(北京大學人工智慧研究院AP)親自帶著團隊面見投資人。高瓴和真格都很積極,最後團隊選擇了高瓴,以約8000 萬美元估值完成首輪融資。之後不到三個月,經緯、BAI等機構相繼入場,估值一路狂飆到約12 億美元,漲幅超10 倍。楊耀東的推動本身也是一個關鍵訊號,他是靈心巧手首席科學家,也是北大強化學習方向的重要學者。除了逆矩陣,他的另一位學生也已經出來創業
過去 VC 研究公司,今天,很多人開始研究導師。唐傑培養出了智譜,劉知遠培養出了面壁。現在,楊耀東實驗室也開始被基金反覆研究。清華電腦系、叉院,北大信科,可謂被VC踏破了門檻。現在最新一波趨勢,是看清華人工智慧學院的老師們
逆矩陣真正讓 VC 感興趣的,還不只是融資速度,而是人。CTO 陳博遠出生於2004年,2025年榮膺北大年度人物,亦是北大風雲人物,過去幾年主要研究強化學習、後訓練和對齊。所以很多投資人第一次聽說逆矩陣做世界模型,都會問一句:“你們為什麼也來做世界模型?”CEO 吉嘉銘負責融資、組織和對外溝通。很多投資人第一次見他們,都能明顯感覺到,這是一支還在快速成長中的年輕團隊。聊技術,陳博遠回答,聊融資和公司,吉嘉銘接過去。有些時候,陳博遠甚至會下意識看向吉嘉銘,這種略顯青澀的配合,反而讓不少投資人覺得真實
還有一個更現實的原因。今天 AI 公司最難的,不是融資,而是招人。逆矩陣三十多人團隊裡,將近一半仍是在校學生。很多人是衝著陳博遠來的。這意味著一條大公司很難複製的人才供給鏈,也是很多vc找創業一號位的篩選標準:有leadership的researcher。有的基金開始專門整理一張新的地圖,不是《中國AI 公司地圖》,而是:《中國AI 學術譜系圖》。“今天投一個 AI 項目,有時候,也是投一個老師。”
02. LiberAI:清華特獎 00 後開始接棒
逆矩陣代表北大系創業,LiberAI 則代表清華系創業者。CEO 劉松銘是清華大學 00 後特獎獲得者,這家公司融資節奏同樣極快。從真格基金獨家投資種子輪,到紅杉中國領投天使輪,再到真格、紅杉、美團龍珠、順為資本等持續加注,LiberAI在很短時間內完成了多輪融資,估值已達10億美金
關於投資LiberAI和劉松銘,某投資人很篤定的表示,松銘年紀雖小但卻異常成熟,兼具氣場與親和力,且思路敏捷。是其見過創業者裡最具創業精神和leadership的人之一。他在機器人領域很有號召力,已快速聚集起了一支建制完整&非常能打的團隊(約100人),不只有小天才還有很多業內資深工程化人才,公司裡軟硬體團隊高度配合。算是很快完成了從Researcher到企業家的轉變,不只追求技術上的成功,對於產品和商業成功也有卓越的追求
這幾家明星世界模型公司的出現,正在清華和北大的校園裡製造一場不小的震盪。據說,已經有同學開始認真考慮休學:“如果他們行,why not me?”
其他高校教授創業代表,如清華大學人工智慧學院助理教授李一鳴(97年),是該院唯一工程學背景教授。其創辦的具身智能世界模型公司釐清智能,種子輪便獲諸多頭部基金及機器人產業方數億人民幣種子輪,整個團隊幾乎都是00後,典型的高校老師學生創業(目前兼職創業人數較多)。該團隊學術資源豐富,團隊成員曾與NVIDIA、World labs、AMI labs等頂尖機構學者有深度合作
某高校相關知名基金投資人表示,名校學生世界模型創業趨勢呈現強頂刊(一作)、強導師、強科研成果的前沿學術特徵,以及弱營運管理、弱產業經驗、弱商業落地的行業特徵。資本容忍度相對高,能容忍老師、學生短期非全職情況(可充分利用高校科研資源)。這類創業公司總體呈現出以公司形式做前沿技術科研並計畫嘗試商業化落地的特性。這些特徵與世界模型技術方案仍未收斂,且其比肩“chatGPT時刻”的革命性價值高度相關
Part IV 第二類豪賭:自動駕駛戰場收尾,二號位的再創業
自動駕駛上市潮之後,VC 又重新拜訪了一遍自動駕駛公司。不是為了投自動駕駛,而是為了找下一位機器人創業者。一位美元基金投資人說:“CEO一般不會出來。真正值得看的,是二號位。”
03. 星海圖:把 Momenta 自動駕駛方法論搬進機器人時代
星海圖最新估值約 200 億元,據說已經交表,準備港股 IPO(這裡祝賀下momenta財務自由的朋友)。商業化也進展快速,2025年收入超5千萬,2026年預計4-5億。創始人高繼揚畢業於清華電子系,曾任職Waymo,後回國加盟Momenta負責自動駕駛感知演算法
Momenta 最早的核心敘事,是“一個飛輪,兩條腿” : 用量產輔助駕駛積累真實資料,再反哺 Robotaxi 和更高等級自動駕駛。星海圖則講的是機器人版的資料飛輪。它不押注某一種機器人本體,而是強調“一腦多形”“在腦不在形”。很多投資人聽完這個故事,第一反應都是:“這不就是機器人版 Momenta嗎?”
高繼揚本人也很有爭議。有人說他目標感極強,執行力非常狠;也有人說他 ego 很強,要求高,節奏快,不太容易被說服。但在今天這個賽道,未必是缺點。世界模型和機器人,都不是溫和創業,它需要融資、產品、模型、交付同時推進。太平衡的人,很難打這種仗。所以星海圖真正被下注的,不只是機器人,而是一個從自動駕駛戰場出來的人,能不能把同一套戰爭方法,複製到機器人時代
提及星海圖,就不得不提及另一位代表性人物—前星海圖首席科學家許華哲。2026年2月,清華叉院AP&星海圖首席科學家許華哲做出了一個驚人的決定:正式離開星海圖,創立新公司 “破殼機器人”。 破殼機器人在世界模型創業領域的選擇清晰而獨特:“不做本體只做世界模型在具身不work”,結合世界模型最大的應用場景--家庭具身,作為創業的下一站。更令人矚目的是,他放棄了在星海圖的全部股份,包括最初的10%和後來的3%,且未進行任何套現。據聞,破殼機器人後續多輪融資已在交割中,最新估值已達12億美元
許華哲創立破殼機器人(Breakout Robotics),源於一次對AI技術本質的深刻反思。2025年底,許華哲在知乎撰文,回望整個領域的發展。他看到,儘管行業無法像大模型那樣一步登天,但美國公司的AI進展已清晰可見,而中國公司在核心AI上的突破卻顯得不足。他寫下這篇文章,既是自勉,也是希望 “戳一戳大家”,讓中國具身智能公司一起發力,做出世界第一的物理世界AGI模型。他認為, 中國的AI不應比美國更落後,尤其在具身場景資料和硬體是瓶頸的領域,當前行業陷於工業落地與物理AGI追求的 “南轅北轍”,需要有人挺身而出,追求真正的通用智能
04. 極佳視界:世界模型到通用機器人
極佳視界是另一類更典型的 Physical AI 公司,目前估值200億人民幣。它的敘事非常符合今天資本市場對世界模型的想像:世界模型,具身基礎模型,通用機器人。這是一條從模型到身體、從大腦到終端的全端閉環路線
創始人黃冠來自清華自動化系,曾任地平線視覺感知負責人,也有智能駕駛和視覺演算法背景。不是從零開始想像物理世界,而是長期在真實場景中和感知、控制、工程交付打交道。所以,極佳視界被很多投資人視為中國Physical AI 敘事中最強勢的代表之一
05. 流形空間:不只是看見世界,而是推演世界
流形空間則是另一種具身智能路線。創始人武偉,是商湯科技早期核心成員,曾主導商湯“開悟”世界模型研發。這家公司最被反覆提起的一句話是:“不只是看見世界,而是推演世界。”流形空間聚焦將世界模型用於物理 AI 的落地場景,比如機器人和 XR 裝置,長期可擴展到開放場景遊戲中
它的創業基因來自產業實踐,而不是單純的論文路線。這也是世界模型賽道一個很重要的變化:過去,模型公司往往從演算法出發尋找應用;而今天,越來越多公司從真實物理場景出發,反過來定義模型
Part V 第三類豪賭:視訊公司,集體改寫自己的故事
這一類公司最初從AI視訊生成技術切入--做"好看的、可控的、物理一致的視訊"。視訊可能不是世界模型的終點,但它很可能是世界模型最重要的入口。因為視訊是目前資訊密度最高、最接近真實世界的資料形態之一
06. Sand.ai:清華特獎,可以閉眼投?
一位投資人曾半開玩笑地說:"清華特獎,可以閉眼投" 。在中國 AI 創投圈,這句話不完全是玩笑。清華特等獎學金,每年本科生十人、研究生十人。能拿到這個獎的人,往往不是"學習好",而是在同齡人裡已經展現出某種異常突出的能力。如今世界模型這張牌桌上,劉松銘是一個,曹越也是其中一個
曹越的履歷太容易讓投資人心動:清華特獎、ICCV Best Paper、微軟亞洲研究院、智源研究院、光年之外聯創。放在任何一張 AI 創業牌桌上,都是一副很漂亮的起手牌。但漂亮的起手牌,不等於一定能贏。2025 年,視訊模型賽道開始變得艱難。有人質疑 Sand.ai 的模型進展,也有人懷疑,繼續硬卷基礎視訊模型,會不會變成一場越來越貴、越來越慢的消耗戰
但曹越沒有繼續死磕原來的打法,他換了一張牌。曹越最近接受採訪時,說了一句話:"世界模型已經變成了一個 Buzzword。很多人討論的,其實根本不是同一個東西"。在他看來,世界模型今天還處於 GPT-1 時代。很多人後來才發現,Sand.ai 想做的,從來不只是一個視訊生成模型。視訊只是現實世界在攝影機裡的投影,是目前資訊密度最高、最接近真實世界的資料形態,也是通向世界模型的一座"加油站"。於是,Sand.ai 開始重新組織自己的路徑
一方面,Sand.ai堅持押注自回歸架構,希望模型能夠學習時間連續性、因果關係和物理規律,而不僅僅是生成更漂亮的視訊。另一方面,把重心放到真正有使用者的 Agent 產品上。使用者在創作、編輯、生成過程中的每一次互動,都在不斷產生新的行為資料。這些真實資料反過來訓練模型,讓模型越來越理解真實世界。模型能力提升之後,又進一步最佳化產品體驗,吸引更多使用者進入這個循環
一個新的故事開始形成:Agent 獲得資料,資料訓練模型,模型最佳化產品,產品再帶來更多使用者。後來的結果證明,這條路開始跑通。最新一輪融資後,公司估值約 8 億美元,宿華、王慧文等大佬持續下注,九坤創投也參與了投資
07. 生數科技:最接近 IPO 的世界模型公司
如果說很多世界模型公司還在講未來,那麼生數科技已經開始回答另一個更現實的問題:一家世界模型公司,什麼時候能夠賺錢?
生數科技由清華大學教授朱軍創立,是國內最早佈局 AI 視訊生成與擴散模型的團隊之一。創業初期,唐家渝擔任CEO,公司很快憑藉視訊生成能力成為行業焦點。但隨著行業競爭加劇,公司也經歷了組織和戰略調整,CEO更換為駱怡航,部分核心產品負責人離開創業,一度還傳出與京東接觸的消息,不過最終並未達成交易
這家公司最特別的地方,是速度。融資速度快,產品推進快,資本化預期也快。近期完成新一輪5億美金融資,是迄今為止國內通用世界模型領域最大單筆融資。公司計畫年內啟動港股IPO。聽聞,生數科技去年收入不到1個億,今年預計6-8個億。在很多投資人眼中,生數科技代表的是視訊模型公司走向世界模型的一條主流路徑:先用視訊生成建立技術和產品優勢,再向更底層的多模態世界建模能力延伸。如果它能順利進入資本市場,可能會成為國內世界模型賽道最早被公開市場檢驗的公司之一
08. 愛詩科技:從視訊生成走向即時互動
愛詩科技則代表了另一種視訊生成路徑。它的產品 PixVerse 擁有非常大的全球使用者規模,是國內 AI 視訊公司中商業化和使用者增長都較突出的玩家之一
創始人王長虎曾任字節跳動視覺技術負責人,有深厚的 CV 和視訊技術背景。愛詩科技最新推出的 PixVerse R1 即時世界模型,把視訊生成進一步推向即時互動。其商業化進展也頗為快速,2025年2個億收入,202年據說收入可達8個億。近期剛Close C輪,C輪共計融資近30億,有傳愛詩將以50億美金估價IPO。這也是為什麼視訊生成公司越來越不願意只被定義為"AI 視訊工具"。它們想爭奪的是一個更大的入口:未來視覺世界的生成和理解層
PS: 這裡補充介紹一些互動內容/遊戲領域世界模型明星初創,如:劉威的Video Rebirth、宋亞宸的VAST Tripo、劉宇的Vivix AI;其它知名初創如史佳欣的XMax.ai、張家聲的Philo AI、戴勃的Feeling AI、田柯宇的Arrival AI、陳天澤的魔芯科技、章國鋒的影溯;還有高校學者一眾創業者,如上海交大李永露的RHOS、上海交大AP鄒應天的Sreal AI…。其中,Arrival AI CEO田柯宇便是字節索賠800萬的那位實習生,公司目前估值約2億美金,幾家頭部基金押注。投資人大致還是覺得田柯宇是outlier值得押注,且認可他在自回歸上的成果
Part VI 第四類豪賭:Foundation Model 創業者,從語言智能到物理智能
這類創業者,來自大模型和網際網路大廠。他們不是從視訊出發,也不是從機器人本體出發,而是從 Foundation Model 出發。在他們看來,世界模型不是一個孤立方向,而是大模型能力繼續外延的必然結果。當語言模型已經能理解文字、程式碼、圖像、音訊,下一步自然會走向:理解物理世界。這一路線目前最有代表性的,是林俊暘實驗室,以及一批來自大廠自動駕駛、機器人和基礎模型團隊的創業公司
09. 林俊暘:Qwen 之後,沒人知道他的下一張牌
如果說世界模型創業是一場牌局,那麼林俊暘,可能是今年最讓投資人猜不透的一張牌。據多位投資人透露,林俊暘的公司估值已達到約20 億美元,高榕、紅杉、騰訊等機構相繼參與,上海也有國資入局,幾乎所有關注基礎模型的頭部美元基金,都曾和團隊有過深入交流。據聞,目前已開啟新一輪融資,對外報價30億美金左右
但真正有意思的是,沒有人能完全說清楚,林俊暘到底在做什麼。有人聽到的是基礎模型;有人聽到的是 AI 自學習系統;有人聽到的是具身智能。而最近,越來越多人聽到的答案變成了:世界模型。一位長期關注林俊暘的投資人笑著說:“他跟不同的人,講的是同一件事,但角度都不太一樣”。聽起來像是在不斷變化,但如果把這些關鍵詞放在一起,會發現它們其實都指向同一個終點:不是做一個更大的模型,而是建立一個能夠持續學習、持續進化、持續理解現實世界的智能系統。某種意義上,世界模型只是這個故事在今天最容易被理解的一種表達
也有不少投資人提到,林俊暘是一個非常有個人風格的人。有人形容他“目標感極強”,也有人評價他“ego 很強”。但幾乎所有和他交流過的人,都承認一點:他對自己要做什麼,有著非常堅定的判斷。林俊暘更像是先認定了一條路,再不斷調整到達終點的路徑。至於這條路最終會落在世界模型、基礎模型,還是另一種今天還沒有名字的新範式,也許連他自己都還在持續演化。但對於投資人來說,他們真正下注的,並不是某一個技術概念。而是相信:如果下一代基礎模型還會誕生新的變數,那麼林俊暘,也許會坐在那張牌桌上
10. 它石智航:大廠技術高管的具身智能戰爭
它石智航是另一種大廠派創業。CEO 陳亦倫,曾任華為車 BU 首席科學家;聯合創始人李震宇,曾任百度智能駕駛業務總經理。這兩位的背景決定了,它石智航從一開始就不是學生創業,也不是單點技術創業,而是一支自帶大廠工程經驗和產業資源的隊伍。它的融資也極其誇張。2026年3月完成1.2億美元天使輪融資,一個月後又完成4.55億美元Pre-A 輪,刷新中國具身智能賽道紀錄。它要做的是具身領域自有大模型,用世界模型支援長時程任務預測。簡單說,就是讓機器人不僅能“看見”世界,還能“預判”世界
這一類公司代表的是另一種世界模型創業邏輯:不是從論文出發,也不是從單一產品出發,而是從大廠積累過的系統工程能力出發。這類創業者的問題不是“能不能講出一個故事”。而是:能不能把一個極其複雜的系統真正交付出來
值得一提的是,它石和星動紀元算是國內最早(2024年)開始講世界模型的具身智能公司。所以當世界模型的風吹到2026,這兩家公司的融資勢頭更是扶搖直上,兩家光2026年上半年便各自融資超30億
Part VII 國內大廠正悄悄重倉世界模型
某國內頭部大模型Researcher曾為我們簡單梳理了世界模型技術流派和大廠相關佈局。他說,李飛飛曾按照功能層把世界模型分成渲染器、模擬器、規劃器。其中渲染器又細分為視訊渲染和3D渲染;模擬器是目前最擁擠的一層,包括視訊模型模擬(代表是Genie 3、騰訊HY WorldPlay、阿里HappyOyster、螞蟻Lingbot-World)、3D模型模擬(李飛飛團隊的World Labs Marble、騰訊HY World 2.0)、抽象空間模擬(Yann LeCun提出的JEPA框架);規劃器主要有兩個門派,一是VLA(代表π0、OpenVLA)、二是WAM(代表是Jim Fan團隊的WAM及國內大量具身公司&遊戲公司的技術路線)。這三層並非割裂,最終趨勢是走向融合,模擬|渲染|規劃將在一個統一框架裡端到端協同
國內字節seed、阿里wan、騰訊hunyuan和快手Kling都在做視訊基模。當前世界模型就是用視訊基模做後訓練,國內很多創業團隊都是微調wan。未來wan和happyhorse可能會合併成一個基模團隊,字節之前有幾個視訊基模團隊,只是Seedance跑了出來。據瞭解,字節Seed的世界模型是范浩琦bagel項目擱置,然後今年4月整組轉去做世界模型,也是做遊戲場景的視訊世界模型,且內部也存在曾妍的賽馬(曾妍團隊:視訊預訓練+WAM具身融合路線)。 阿里的世界模型團隊則是收購了智源的王鑫龍團隊,HappyOyster也是遊戲場景的視訊世界模型。騰訊的世界模型HY WorldPlay則是由王騰飛帶隊,專攻遊戲場景。快手則有太多故事,包括蓋坤極力推動可靈獨立,期間也因為一些分歧導致部分高層離開。好在經過董事會商議,敲定了融資20億美元估值200億美元的方案,並計畫於2027年IPO。最新消息是,完成後的方案估值會降低,融資額有所提高。這將為可靈備戰世界模型提供充足彈藥和資源,依託成熟視訊能力,漸進式探索具身智能通用策略
大廠當前世界模型主要從遊戲切入,原因是容易落地,具身智能目前還在畫餅階段,沒辦法商業閉環。值得一提的是,有不少朋友對螞蟻靈波還是頗為讚賞,認為其做了不少本質工作,解決了世界模型在具身應用上的很多問題
大廠和創業公司的關係,在這個賽道上有點像大模型時代:大廠有算力、資料、場景和組織能力,創業公司有速度、聚焦和背水一戰的緊迫感。創業公司與大廠競爭,核心要關注:一是有真實應用場景,決定技術投入可持續性;二是有人才密度和技術厚度,決定能否真正為應用保駕護航。作為初創公司,找到Killer Application,把一個賽道吃透將是生存關鍵。譬如視訊生成公司活下來的生數和愛詩,便是早早錨定短劇、漫劇具體賽道,把營收做了起來,形成了自己的資料和產品飛輪。最後疊加組織扁平+決策靈活,可在新興方向建立優勢
VIII 新入局者,如何拿到核心入場券
對於想加入世界模型之戰的創業者,某知名基金投資人表示,當前會比較關注:
1.是否有清晰的具體應用場景
2.創始人Top人才吸引力/凝聚力(譬如Neo Lab模式創業早期匯聚了所在實驗室優質人才,但長期穩定性有很大風險:實驗室小天才們學業結束後如何保持穩定性?團隊壯大後需要吸引外部人才,非實驗室師門嫡系如何立足?核心層是否因為患不均而分崩離析、自立門戶?)
3.Infra能力(技術未收斂,各有技術品位和哲學,但技術範式跳不出scaling law,核心工程能力的積澱在於Infra,就好比DeepSeek)
4.融資能力
另一知名基金投資人則表示:"世界模型投資策略跟其它賽道差別不大,核心還是在投團隊。當然投人也很有講究,你得是行業最Top的人。譬如投機器人公司,需要創始人有技術前瞻性、有訓練大模型的經驗、懂硬體,同時希望創始人是企業家或有企業家精神,而不僅僅是個Researcher,最後需要有極強領導力,敢於All In。"
IX 誰會成為Physical AI版DeepSeek
現在下結論還太早。如果只看估值和融資速度,具身智能獨角獸們(人均世界模型)已經站在第一梯隊;如果看技術想像力,逆矩陣、LiberAI、林俊暘實驗室等代表著更年輕、更不確定,也更可能產生變數的一批人;如果看產品和資料飛輪,Sand.ai、愛詩科技、生數科技這類視訊背景公司,可能擁有真實使用者和行為資料帶來的長期複利。當然巨頭仍是大多數創業公司難以踰越的山海
但世界模型最終會以什麼形態出現,現在沒有人十分篤定。它可能是一家機器人公司,可能是一家視訊模型公司,可能是一家大模型公司,也可能是一家今天還沒有被嚴肅看見的小公司。大模型教AI 讀書,Agent教AI 做事,世界模型要教AI 理解現實。如果前者創造了ChatGPT,那麼後者創造的東西,會比 ChatGPT 更大。而這,或許就是 2026 年最值得下注的故事—誰會是Physical AI版DeepSeek
後記:
原計畫寫一些海外世界模型內容,奈何資訊蒐集和工作量過於艱巨,只得暫時作罷!(歡迎海外華人投稿)。權且補充一些海外投資人的分享:關於World Model的技術收斂、挑戰與投資策略
一、世界模型技術路線分歧,目前行業在三個維度尚未收斂:
1.模型架構之爭:VLA與世界模型路線平行。NVIDIA DreamZero在未見任務上比主流開源VLA高出2倍,但VLA隨資料量增加也在追趕。目前尚無明確勝者
2.資料策略之爭:各家路線截然不同。Gen-1用50萬小時UMI穿戴裝置資料、PI用多樣化機器人+人類資料、LingBot-VLA用2萬小時遙運算元據、Rhoda用數億小時網際網路視訊。共識只有一條:資料質量與多樣性比模型架構標籤更重要
3.表示空間之爭:像素空間(高保真但計算貴)、顯式3D幾何(結構優先)、隱空間/JEPA(效率高、泛化強)三種路線並存,新興方向是多層混合表示
二、收斂未到來的兩大瓶頸
一是缺乏統一評測標準:機器人任務多樣,成功標準模糊,真實環境測試成本高且難以規模化,現有benchmark存在過擬合,RoboArena(類Chatbot Arena的盲測機制)是有希望的方向但仍受硬體限制
二是資本結構維持分歧:AMI Labs押注JEPA、World Labs押注3D顯式表示、Rhoda押注直接視訊動作模型,每家都有足夠的runway讓自己的thesis跑幾年,短期內沒有收斂的外部壓力
三、主要挑戰
超過80%的生成視訊存在人類可識別的物理違規(碰撞、力、因果關係)。推理開銷極大:1X的世界模型生成5秒視訊需11秒;Odyssey實現即時影格率但每位使用者消耗一塊H100;DreamZero僅運行在7Hz,而傳統VLA可在消費級GPU跑20Hz以上。長時序生成也是難題,自回歸誤差累積、擴散模型計算隨序列長度二次增長
四、投資機會判斷
收斂前(近期):
01.全端垂直整合者——同時掌握模型開發與前向部署,建構資料飛輪
02.機器人控制策略評測基礎設施——類似LLM時代的Arena
03.高品質資料精煉平台——多樣化預訓練語料、具身特定軌跡與觸覺資料、物理失效標註資料集
收斂後(長期):
推理最佳化與邊緣計算加速
模型專用晶片(模型與晶片協同開發)
開源模型+平價硬體催生的垂直行業最後一公里部署 (Top華人科創社)
