大語言模型教會 AI “讀懂文字”,視訊模型教會 AI “看懂畫面”,而世界模型,是要教會 AI理解整個物理世界如何運轉。
近日據彭博社、科創板日報等多家媒體的業內消息,字節跳動正在秘密研發一款即時空間世界模型,技術路線直接對標Google DeepMind 的 Genie 世界模型,項目由張一鳴親自督導,跨部門調集算力與研發資源,最快預計下個月迎來亮相,字節官方暫未對此消息做出正式置評。
不同於字節已經出圈的 Seedance 電影級視訊生成模型,Seedance 輸出的是一段寫死的成片視訊,播放完畢就結束。而這款新模型,目標是生成可以即時互動、可以自由漫遊的三維虛擬空間。使用者移動視角、發出語音指令,整個環境就會即時發生變化,不再是預先渲染好的固定片段。
未來這套模型計畫打通火山雲、抖音內容生態、Pico XR 硬體。落地場景直指互動式直播、觀眾可參與劇情的 AI 短劇、AI 原生遊戲;戴上 Pico 頭顯,使用者可以直接走進 AI 生成出來的虛擬世界,大量渲染計算放在雲端運行,以此降低 XR 終端的硬體門檻。
消息一出,再次把 “世界模型” 推到行業聚光燈下。Google Genie、Meta、輝達、李飛飛 World Labs,國內字節、騰訊、阿里,幾乎所有頭部科技企業全部重兵押注。
很多人會疑惑:大模型還沒完全商業化落地,為什麼大家又集體 all in 世界模型?
01 什麼是世界模型,和普通文生視訊到底差在那?
很多人容易混淆文生視訊與世界模型,兩者存在本質鴻溝。
文生視訊(例如 Seedance、Sora):輸入提示詞,輸出一段完整視訊。畫面是預先生成,你只能觀看,不能干預。你不能往前走、不能轉頭看側面,世界不會響應你的動作。
世界模型(以Google Genie 為代表):輸入文字,生成一個可玩、可探索的動態環境。你像玩遊戲一樣移動視角、發出指令,模型即時推算下一幀畫面,模擬重力、碰撞、物體之間的相互作用。它輸出的不是 “一段片子”,而是一套遵循物理規則的模擬世界。
簡單一句話總結區別:文生視訊,給你看已經發生的故事;世界模型,讓你走進可以隨時改變的世界。
現階段包括Google Genie、字節在研項目都仍然屬於實驗原型。行業普遍痛點非常突出:長時間場景一致性難以維持、複雜物理邏輯容易穿幫、即時生成會吞噬巨量算力,距離消費級大規模商用,還有很長距離要走。
02 大廠集體押注世界模型,背後四個底層邏輯
邏輯一:大語言模型已經摸到天花板,缺 “物理常識”
現在的大模型擅長文字推理、寫文案、寫程式碼,但它沒有真正理解現實世界。
大模型知道 “玻璃杯摔到地上會碎”,是閱讀千萬篇文字記住這個結論,它沒有在腦子裡模擬過墜落、撞擊的全過程。放到人形機器人、自動駕駛身上就會暴露短板:AI 能看懂說明書,但面對現實世界千變萬化的物體、位置、突發狀況,很容易出錯。
世界模型就是用來補齊這一塊短板:讓 AI 在內部建立一套對現實世界的模擬器,在行動之前,先推演 “我這麼做,世界會變成什麼樣”,這是物理 AI、具身智能必不可少的底層底座。
邏輯二:解決機器人最大痛點:真實世界資料太貴、試錯風險太高
人形機器人、智能體最大的卡點,是訓練資料。 現實世界採集機器人作業資料成本極高,摔機器、損毀裝置,很多危險場景根本沒法反覆實測。
而世界模型可以無限生成虛擬訓練環境。機器人可以在虛擬世界裡,無數次練習抓取、行走、作業,無限試錯,把模擬中學習到的能力遷移到真實硬體上。輝達黃仁勳多次公開表態,世界基礎模型是機器人與自主智能體的根基所在。
沒有高品質的世界模型,通用人形機器人的規模化迭代就無從談起。
邏輯三:下一代內容、硬體生態的入口爭奪戰
除了機器人賽道,消費端的想像空間同樣巨大。
互動式短劇、AI 遊戲、虛擬直播、XR/VR,下一代內容形態不再是單向觀看,而是使用者深度參與、劇情隨選擇即時改變。誰掌握世界模型底座,誰就掌握新內容形態的生產工具。
字節做這件事,有自己得天獨厚的稟賦:海量短影片視覺資料、成熟的 Seedance 視訊底座、抖音創作者生態、Pico XR 硬體、火山引擎雲端算力,整套業務鏈條全部握在自己手裡。一旦跑通,就形成 “模型‑雲‑內容‑硬體” 完整飛輪。
騰訊 HY‑World 瞄準遊戲 3D 資產;阿里 Happy Oyster 主攻互動式敘事;海外Google Genie、Meta 押注 VR 元宇宙,本質都是搶佔下一代互動的標準定義權。現在行業對世界模型還沒有統一標準,誰率先落地,就有機會把自身技術路線變成行業範式。
邏輯四:AGI 的必經中間節點
行業普遍共識:真正的通用人工智慧,不能只活在文字對話方塊裡。它必須具備感知環境、預判行為後果、在物理環境做規劃的能力。
世界模型,就是 AGI 重要的中間里程碑。它不是 AGI 的終點,但繞不開。這也是為什麼幾乎所有佈局 AGI 的團隊,都必須投入資源做世界模型的核心原因。
03 理性看待:熱潮之下,現實瓶頸同樣突出
我們不能被概念熱度裹挾,世界模型今天依然處在原型階段,有幾道大山橫在面前。
第一,算力成本極高。即時生成高影格率可互動三維環境,每一秒都在瘋狂消耗算力,如果不能最佳化壓縮成本,普通使用者很難規模化使用。
第二,物理一致性難題。長時間漫遊下,物體位置、材質、邏輯很容易崩壞穿幫,這是Google Genie 同樣沒有完全解決的技術難題。
第三,商業化路徑尚不清晰。是先服務機器人模擬,還是先做消費端 XR 內容?全球各家大廠都還在摸索最優落地路徑。
字節這次的項目,優勢在於有海量視訊資料與完整消費硬體、內容場景;但同樣要面對上述全行業共同的技術難關。原型項目距離正式產品,中間還要跨過工程化、成本、穩定性多重考驗。
04 AI 的競爭,從 “語言” 走向 “世界”
過去幾年 AI 競賽,主戰場是大語言模型,比拚誰回答問題更聰明。而 2026 年,競爭正在悄然切換賽道:比拚誰能夠更好地模擬、理解真實世界。
世界模型不只是又一個花哨的 AI 概念。它一邊向上支撐互動式內容、XR 體驗,一邊向下為人形機器人、自動駕駛、物理 AI 提供模擬訓練底座,橫跨消費與產業兩大市場。
字節入局,只是全球競賽的一個縮影。中美大廠正在同一條新起跑線上賽跑。未來兩三年,我們會持續看到大量原型發佈,但真正能夠跨過原型,走到大規模產品落地的玩家,註定只會是少數。 (未來機器人網)
