大語言模型教會 AI “讀懂文字”,視訊模型教會 AI “看懂畫面”,而世界模型,是要教會 AI理解整個物理世界如何運轉。
近日據彭博社、科創板日報等多家媒體的業內消息,字節跳動正在秘密研發一款即時空間世界模型,技術路線直接對標Google DeepMind 的 Genie 世界模型,項目由張一鳴親自督導,跨部門調集算力與研發資源,最快預計下個月迎來亮相,字節官方暫未對此消息做出正式置評。
不同於字節已經出圈的 Seedance 電影級視訊生成模型,Seedance 輸出的是一段寫死的成片視訊,播放完畢就結束。而這款新模型,目標是生成可以即時互動、可以自由漫遊的三維虛擬空間。使用者移動視角、發出語音指令,整個環境就會即時發生變化,不再是預先渲染好的固定片段。
未來這套模型計畫打通火山雲、抖音內容生態、Pico XR 硬體。落地場景直指互動式直播、觀眾可參與劇情的 AI 短劇、AI 原生遊戲;戴上 Pico 頭顯,使用者可以直接走進 AI 生成出來的虛擬世界,大量渲染計算放在雲端運行,以此降低 XR 終端的硬體門檻。