實測MiniMax Design:視訊生成之後,開卷組織生產

AI速讀
MiniMax 正式發佈多模態創作 Agent 工作台「MiniMax Design」,旨在解決 AI 視訊生成在商業場景中缺乏流程控制的痛點。該工具透過 3D 導演台與 Skill 範本,將策劃、分鏡與生成整合於同一環境,提升了複雜動作場景的可控性與批次生產效率。對比測試顯示,MiniMax Design 在分鏡完整度與角色一致性上優於 LibTV,但生成速度較慢。分析認為,AI 視訊競爭已進入「流程之爭」,厂商需在底層模型與應用層工作流之間找到平衡,以提高用戶留存與商業價值。
能力上來了,開始拼流程。

8月20日,MiniMax發佈多模態創作Agent工作台MiniMax Design。

它並不是一款單純的視訊生成器。使用者給出一個創作需求後,主Agent會先理解目標、拆解任務,再呼叫文字、圖片、視訊、音訊等能力完成不同環節。使用者也可以進入Canvas畫布、Skill、3D導演台和ComfyUI工作流,對中間過程繼續調整。

MiniMax Design的前身是今年6月底亮相的MiniMax Hub,此後更名並接入H3。到了這次正式發佈,MiniMax更明確地把它放到了“商業內容生產”的位置上。

為什麼現在越來越多公司開始做視訊生成Agent?原因在於單靠生成一段視訊,已經無法滿足真實創作需求。

文生視訊、圖生視訊、人物一致性、鏡頭控制和視訊編輯能力不斷提升,模型已經能夠生成越來越接近成片的視訊內容。但進入商業場景,品牌宣傳、電商素材、短劇等任務,往往還需要完成指令碼策劃、分鏡設計、素材整理等環節。真正影響效率的,是這些環節能否被組織成一套連續流程。

所以,Runway、Pika等AI視訊平台都在補充編輯、控制能力。MiniMax Design也是如此,依託MiniMax H3的視訊生成能力,它嘗試把模型、工具和視訊創作流程放到同一個環境中。

我們也體驗了一下MiniMax Design,重點看兩個問題:它到底能替創作者接走多少重複工作,以及當Agent負責規劃之後,底層視訊生成能力能不能跟得上。

01. 一句話出片:規劃夠專業,成片掉鏈子

我們先從最接近商業場景的品牌宣傳視訊開始,讓它做一個以陪伴為主題的家庭服務機器人品牌宣傳片。

這個任務需要它理解需求後進行創意策劃、角色設計、分鏡規劃,最終生成視訊。

MiniMax Design規劃頁面

接到需求後,MiniMax Design先生成創意簡報和故事方向。確認方向後,再進一步做視覺調研,然後交出完整的分鏡指令碼。整個流程比較接近傳統視訊製作中的前期策劃階段,它沒有馬上開始生成,而是先確定主題、人物關係和視覺方向,再把故事拆成具體鏡頭。

單看分鏡指令碼,它對需求的理解比較準確。圍繞“陪伴”這個主題,它設計了家庭場景,也能夠規劃人物關係、鏡頭變化和情緒推進。

但最終成片到了後半部分,場景和人物都發生了變化,和前面的敘事沒有完全接上。指令碼裡已經規劃好的角色關係和劇情連續性,到了實際生成環節沒有完全保持下來。

在這一輪任務裡,MiniMax Design已經具備相當完整的視訊策劃能力,但從分鏡到成片之間存在明顯的執行落差。對於需要連續敘事的商業視訊來說,如何穩定還原前期創意,仍是影響交付質量的關鍵。

02. 3D導演台:先綵排,再開機

第二輪我們專門測試更難控制的動作場景。

過去做這類鏡頭,常見的方法是不斷改提示詞、重新生成,再從多個結果裡挑一個接近預期的版本,也就是創作者常說的“抽卡”。當人物需要在固定空間中移動,或者鏡頭需要完成連續運鏡時,單靠文字描述很容易出現問題。比如,角色位置飄忽、動作方向不一致、前後鏡頭接不上。對於動作戲、電影片段這類內容來說,畫面好看只是及格線,人物關係和鏡頭語言更加重要。

MiniMax Design給出的工具是3D導演台。它提供了另一種方式,先搭建三維場景,在空間裡可以直接調整角色位置、動作和鏡頭運動,把確定好的運鏡方案作為參考,再生成最終視訊。相當於先綵排,再開機。

我們也用一個動作場景的生成測試它的實際效果。原本我們想直接用蜘蛛俠做測試,但涉及IP形象無法通過稽核,於是改成一個類似設定的原創角色,讓一個擁有蛛絲移動能力的角色,在城市建築之間穿梭。

在實測中,MiniMax Design先生成了一個3D運鏡視訊,讓我們根據預覽效果繼續調整鏡頭距離、移動方向以及角色運動軌跡,直到確認整體鏡頭語言,再進入最終視訊生成環節。

從結果來看,加入3D導演台後,這個複雜動作場景的可控性有所提高。角色在建築之間穿梭時,鏡頭方向和運動軌跡都更明確,最終成片和預想效果基本對得上。

對於動作片、影視預告、遊戲CG等需要複雜空間調度的內容,3D導演台提供了一種更接近專業製作流程的方式,讓使用者能夠提前規劃鏡頭,再交給模型完成生成,減少複雜場景製作中的試錯成本。

03. Skill呼叫:視訊生成也有“方法論”

在連續製作視訊時,還有一個更大的難題是,怎麼復用此前的視覺風格和設定,產出同類的視訊,而不是同類型內容往往要重複走一遍相似的製作步驟。

如果每條視訊都從頭輸入提示詞,重新描述人物、場景和畫面風格,效率低,且生成的結果還容易“跑偏”。針對這類需求,MiniMax Design做了Skill功能,把一整套視訊製作流程封裝成可呼叫的範本,讓已經跑通的創作方式可以直接復用。

我們上傳了一張小貓照片,呼叫3D動畫Skill,讓它製作一支《貓咪歷險記》主題短片。

MiniMax Design規劃頁面

呼叫之後,MiniMax Design會按照預設流程一步步走:先把照片裡的貓轉化成3D動畫角色,再做場景規劃,最後進入視訊製作。每個關鍵節點都會停下來讓我們確認方向。

需要說明的是,我們沒有改動它生成的故事大綱和分鏡指令碼,相當於全程用了默認配置。最後的劇情相對簡單,更像一支基礎的動畫短片,談不上特別出彩。但呼叫Skill之後,整套製作流程基本可以按照預設步驟直接推進,不需要再從頭組織任務。

Skill的價值在於,把包含角色設定、視覺風格和製作流程的一套創作方法封裝起來,方便後續復用。對於動畫短片、科普視訊、品牌內容等需要持續生產的場景,Skill可以幫助團隊減少重複設定,提高批次生產效率。至於最終角色和視覺風格能否保持一致,仍然取決於模型和具體生成效果。

04. 橫向比拚:誰更會創作

前面測的是MiniMax Design自己能不能幹活,接下來我們選了另一款視訊生成Agent產品LibTV,同樣呼叫了MiniMax H3模型,並設計了兩個更接近真實創作場景的任務,讓它們同題競技,目的是比較兩套Agent和工作流。

第一題是15秒的黏土定格動畫風格MV。

我們要求三隻小動物組成樂隊,包括橘貓主唱、柴犬吉他手和兔子鼓手,保持角色全程一致,同時完成舞台展開、樂隊演出、場景切換、鏡頭拉遠和片尾收束等完整流程。

先看創作過程,兩款產品都會在接到需求後,自動規劃視覺效果和分鏡指令碼。它們具體有兩個不同點,一是“自動化”程度,MiniMax Design“不懂就問”,視覺效果、風格和分鏡指令碼、鏡頭都會經確認後再行動,LibTV更“自動”,需要使用者確認和干預的節點更少,整個生成過程更自動,代價是使用者對中間環節的把控空間也更小;二是規劃的深度,MiniMax Design分鏡指令碼更加豐富,LibTV的則相對簡單。

再來看最終成品。MiniMax Design生成的橘貓、柴犬和兔子在多個鏡頭中保持了較好的穩定性,角色形象沒有明顯變化。它的場景設計得更豐富,除了純演出的鏡頭外,還設計了一些特寫鏡頭和更動態的動作展示,結尾最後定格成手作賀卡,整個視訊更加完整。

LibTV的成品設計比較單一,基本是樂隊演出的固定視角平推,場景元素也比較少,更像是演出視訊的拼接,而不是MV。視訊也沒有保持角色的一致性,小狗的形像在不同場景裡不一致。我們要求的手作賀卡結尾,成品沒有完整呈現出來,視訊的情節不夠完整。

第二題是續寫電影《歡迎來龍餐館》的結局。我們給出原片的劇情設定,要求生成一個師徒重逢、團圓收尾的結尾,彌補原片的遺憾。

相比從零創作,這個任務更考驗AI視訊Agent對於已有故事的理解能力。它不僅需要延續人物關係和情緒走向,還要保持原有角色設定,並完成一個符合劇情邏輯的結尾。

從結果來看,兩款產品整體差異不大。MiniMax Design生成速度偏慢,但分鏡更完整。它還加入了人物對白,從重逢到團圓的整個情節更完整。相對LibTV而言,它給的成品角色質感更像真人,沒有AI生成人像常有的蠟像感。

LibTV則更偏向用背景音樂強化情緒,但沒有對白,人物關係主要靠畫面傳達,因此能夠承載的敘事資訊相對有限。部分人物鏡頭的生成痕跡也更加明顯,不夠自然。

兩輪比下來,MiniMax Design生成更慢,但在這兩道題裡,分鏡完整度、角色一致性和中間環節的可控性表現更好;LibTV的優勢則是確認環節更少,生成推進得更快,單個鏡頭的視覺完成度也不弱。

這樣看來,同一個視訊模型,放進不同的Agent和工作流中,最終呈現出的創作結果也會不同。MiniMax Design更偏向規劃型,通過需求拆解、分鏡設計和過程確認,提高複雜任務中的可控性;LibTV則更強調效率和快速產出,更適合作為靈感生成和視訊素材工具。

它們體現的是視訊Agent的兩種產品取捨:一個希望通過更細的規劃和人工確認,把使用者的想法更穩定地落到成片;另一個則減少中間環節,讓使用者更快拿到結果。

05. 結語

隨著模型能力的提升,創作者更關心怎麼把一個想法穩定、高效地變成成片。模型更多解決其中具體的生成任務,而Agent試圖把這些分散的環節連接起來。尤其對於廣告、電商、短劇等需要持續生產大量內容的場景,Agent帶來的效率提升也更為突出。

從這個角度看,MiniMax Design的價值在於,MiniMax開始補上從模型到應用之間的一環。

相比只完成一次生成任務,工作台希望承載的是更完整的生產流程,指令碼、素材、Skill和修改記錄都可以沉澱在同一個項目裡。理論上,這有機會提高使用者的使用黏性和遷移成本,但最終能否轉化成更高的留存和付費,還需要後續資料驗證。

據高盛預計,全球AI視訊生成市場將從2025年約30億美元增至2030年約290億美元。隨著市場擴大,AI視訊領域的競爭也會進一步加劇。一方面,廠商仍需要比拚底層模型能力,包括視訊質量、生成速度和穩定性;另一方面,也需要競爭產品能力,比拚誰能更低門檻地串起視訊創作流程。

目前,MiniMax主要面臨兩類競爭。一類是擁有視訊模型能力的平台型廠商,例如快手、字節等,它們依靠模型和流量優勢持續完善視訊生成體驗,可靈、即夢都在快速迭代,MiniMax仍需要繼續提升模型的穩定性;另一類是聚焦應用層的視訊Agent產品,例如LibTV、Flova等,以及動畫創作Agent平台OiiOii、字節被曝內測的漫劇創作工具等垂直應用,MiniMax需要證明,除了模型本身,這套工作流能夠形成足夠的產品差異,讓使用者願意持續留在這裡完成創作。 (定焦One)