字節秘密攻堅世界模型,對標Google Genie:為什麼所有大廠都要搶著 “造世界”

AI速讀
字節跳動據傳在張一鳴督導下研發即時空間世界模型,對標Google Genie,目標是創造可互動的三維虛擬環境。與僅能觀看的文生視訊不同,世界模型能模擬物理規則,將為人形機器人訓練、互動式短劇及XR硬體提供核心底座。儘管面臨算力成本與物理一致性挑戰,但全球科技巨頭(含Meta、輝達、阿里、騰訊)均將其視為實現AGI的關鍵路徑。AI競爭正由語言推理轉向物理世界的理解與模擬,字節試圖利用其內容生態與硬體鏈條建立競爭優勢。

大語言模型教會 AI “讀懂文字”,視訊模型教會 AI “看懂畫面”,而世界模型,是要教會 AI理解整個物理世界如何運轉

近日據彭博社、科創板日報等多家媒體的業內消息,字節跳動正在秘密研發一款即時空間世界模型,技術路線直接對標Google DeepMind 的 Genie 世界模型,項目由張一鳴親自督導,跨部門調集算力與研發資源,最快預計下個月迎來亮相,字節官方暫未對此消息做出正式置評。

不同於字節已經出圈的 Seedance 電影級視訊生成模型,Seedance 輸出的是一段寫死的成片視訊,播放完畢就結束。而這款新模型,目標是生成可以即時互動、可以自由漫遊的三維虛擬空間。使用者移動視角、發出語音指令,整個環境就會即時發生變化,不再是預先渲染好的固定片段。

未來這套模型計畫打通火山雲、抖音內容生態、Pico XR 硬體。落地場景直指互動式直播、觀眾可參與劇情的 AI 短劇、AI 原生遊戲;戴上 Pico 頭顯,使用者可以直接走進 AI 生成出來的虛擬世界,大量渲染計算放在雲端運行,以此降低 XR 終端的硬體門檻。

消息一出,再次把 “世界模型” 推到行業聚光燈下。Google Genie、Meta、輝達、李飛飛 World Labs,國內字節、騰訊、阿里,幾乎所有頭部科技企業全部重兵押注。

很多人會疑惑:大模型還沒完全商業化落地,為什麼大家又集體 all in 世界模型?

01 什麼是世界模型,和普通文生視訊到底差在那?

很多人容易混淆文生視訊與世界模型,兩者存在本質鴻溝。

文生視訊(例如 Seedance、Sora):輸入提示詞,輸出一段完整視訊。畫面是預先生成,你只能觀看,不能干預。你不能往前走、不能轉頭看側面,世界不會響應你的動作。

世界模型(以Google Genie 為代表):輸入文字,生成一個可玩、可探索的動態環境。你像玩遊戲一樣移動視角、發出指令,模型即時推算下一幀畫面,模擬重力、碰撞、物體之間的相互作用。它輸出的不是 “一段片子”,而是一套遵循物理規則的模擬世界。

簡單一句話總結區別:文生視訊,給你看已經發生的故事;世界模型,讓你走進可以隨時改變的世界。

現階段包括Google Genie、字節在研項目都仍然屬於實驗原型。行業普遍痛點非常突出:長時間場景一致性難以維持、複雜物理邏輯容易穿幫、即時生成會吞噬巨量算力,距離消費級大規模商用,還有很長距離要走。

02 大廠集體押注世界模型,背後四個底層邏輯

邏輯一:大語言模型已經摸到天花板,缺 “物理常識”

現在的大模型擅長文字推理、寫文案、寫程式碼,但它沒有真正理解現實世界

大模型知道 “玻璃杯摔到地上會碎”,是閱讀千萬篇文字記住這個結論,它沒有在腦子裡模擬過墜落、撞擊的全過程。放到人形機器人、自動駕駛身上就會暴露短板:AI 能看懂說明書,但面對現實世界千變萬化的物體、位置、突發狀況,很容易出錯。

世界模型就是用來補齊這一塊短板:讓 AI 在內部建立一套對現實世界的模擬器,在行動之前,先推演 “我這麼做,世界會變成什麼樣”,這是物理 AI、具身智能必不可少的底層底座。

邏輯二:解決機器人最大痛點:真實世界資料太貴、試錯風險太高

人形機器人、智能體最大的卡點,是訓練資料。 現實世界採集機器人作業資料成本極高,摔機器、損毀裝置,很多危險場景根本沒法反覆實測。

而世界模型可以無限生成虛擬訓練環境。機器人可以在虛擬世界裡,無數次練習抓取、行走、作業,無限試錯,把模擬中學習到的能力遷移到真實硬體上。輝達黃仁勳多次公開表態,世界基礎模型是機器人與自主智能體的根基所在。

沒有高品質的世界模型,通用人形機器人的規模化迭代就無從談起。

邏輯三:下一代內容、硬體生態的入口爭奪戰

除了機器人賽道,消費端的想像空間同樣巨大。

互動式短劇、AI 遊戲、虛擬直播、XR/VR,下一代內容形態不再是單向觀看,而是使用者深度參與、劇情隨選擇即時改變。誰掌握世界模型底座,誰就掌握新內容形態的生產工具。

字節做這件事,有自己得天獨厚的稟賦:海量短影片視覺資料、成熟的 Seedance 視訊底座、抖音創作者生態、Pico XR 硬體、火山引擎雲端算力,整套業務鏈條全部握在自己手裡。一旦跑通,就形成 “模型‑雲‑內容‑硬體” 完整飛輪。

騰訊 HY‑World 瞄準遊戲 3D 資產;阿里 Happy Oyster 主攻互動式敘事;海外Google Genie、Meta 押注 VR 元宇宙,本質都是搶佔下一代互動的標準定義權。現在行業對世界模型還沒有統一標準,誰率先落地,就有機會把自身技術路線變成行業範式。

邏輯四:AGI 的必經中間節點

行業普遍共識:真正的通用人工智慧,不能只活在文字對話方塊裡。它必須具備感知環境、預判行為後果、在物理環境做規劃的能力。

世界模型,就是 AGI 重要的中間里程碑。它不是 AGI 的終點,但繞不開。這也是為什麼幾乎所有佈局 AGI 的團隊,都必須投入資源做世界模型的核心原因。

03 理性看待:熱潮之下,現實瓶頸同樣突出

我們不能被概念熱度裹挾,世界模型今天依然處在原型階段,有幾道大山橫在面前。

第一,算力成本極高。即時生成高影格率可互動三維環境,每一秒都在瘋狂消耗算力,如果不能最佳化壓縮成本,普通使用者很難規模化使用。

第二,物理一致性難題。長時間漫遊下,物體位置、材質、邏輯很容易崩壞穿幫,這是Google Genie 同樣沒有完全解決的技術難題。

第三,商業化路徑尚不清晰。是先服務機器人模擬,還是先做消費端 XR 內容?全球各家大廠都還在摸索最優落地路徑。

字節這次的項目,優勢在於有海量視訊資料與完整消費硬體、內容場景;但同樣要面對上述全行業共同的技術難關。原型項目距離正式產品,中間還要跨過工程化、成本、穩定性多重考驗。

04 AI 的競爭,從 “語言” 走向 “世界”

過去幾年 AI 競賽,主戰場是大語言模型,比拚誰回答問題更聰明。而 2026 年,競爭正在悄然切換賽道:比拚誰能夠更好地模擬、理解真實世界。

世界模型不只是又一個花哨的 AI 概念。它一邊向上支撐互動式內容、XR 體驗,一邊向下為人形機器人、自動駕駛、物理 AI 提供模擬訓練底座,橫跨消費與產業兩大市場。

字節入局,只是全球競賽的一個縮影。中美大廠正在同一條新起跑線上賽跑。未來兩三年,我們會持續看到大量原型發佈,但真正能夠跨過原型,走到大規模產品落地的玩家,註定只會是少數。 (未來機器人網)