AI造劇的速度,正在改變很多人的日常。當AI參與製作後,新劇上線的速度明顯加快,觀眾幾乎每天都能刷到不同題材、不同畫風的短劇。
根據QuestMobile資料顯示,2026年2月,國內短劇行業覆蓋使用者達到7.18億;短短三個月,短劇的增長速度越來越快,到5月,短劇行業去重使用者規模達到8.51億。
使用者規模擴大,內容需求也隨之增長。從內容生產到產品互動,再到商業化和市場競爭,AI視訊行業正在同時經歷多方面變化。
智象未來聯合創始人兼首席營運官王科告訴騰訊科技:“短劇和漫劇的需求增長非常快,正在從流量紅利期逐漸進入優勝劣汰的階段。”
對於創作者來說,一個好用的AI視訊工具極為重要,不僅能降低製作成本,還能做出更有審美的畫面和創意表達。
目前,AI視訊產品的功能,已經從輸入提示詞、生成片段,延伸到更多創作環節。創作者們可以上傳角色和場景參考,反覆調整鏡頭,給畫面配音配樂,有些產品還會根據劇本安排分鏡。
一位視訊內容創作者向騰訊科技表示:“做爆款的內容難度非常大。從製作角度來看,目前比較難的環節還是出片時要反覆‘抽卡’。一個鏡頭可能會生成好幾次,才挑出能用的版本;如果一集有幾十個鏡頭,時間和成本就這樣疊上去了。我們更關心生成一次有多少內容能用”。
並且,生成鏡頭只是製作的一部分。面對一集中的幾十個鏡頭,創作者還要逐一篩選、修改和拼接,同時處理整集節奏,並確保人物、場景和聲音前後銜接。
這些具體的製作難題,也在不斷推動AI視訊產品演變。
智象未來聯合創始人兼首席營運官王科告訴騰訊科技,目前,AI視訊工具大致有兩類互動方式:一類是畫布式或節點式工作流,強調專業控制和自由度。另一類是對話式互動,試圖降低操作門檻。隨著Agent承擔任務拆解和執行,創作者可以更多地表達目標,複雜的模型呼叫和製作流程則由系統在後台完成。
王科強調,AI參與的環節越多,創作者的判斷力、審美和敘事能力越重要。內容供給增加後,創作者的價值會更加突出。AI可以降低製作門檻、承擔更多執行工作,但對於劇本、審美、節奏和情緒等關鍵判斷仍然依賴創作者。
以下為王科的分享交流實錄內容(精選版):
01
流量紅利過後,AI視訊拼什麼
問:隨著AI視訊進入影視、廣告和短影片的實際製作流程,行業對產品的要求發生了那些變化?這種變化會分別給這些行業帶來什麼影響?
王科:過去兩年,行業更多關注誰能生成質量更高的視訊片段。隨著AI進入實際生產流程,使用者的需求也變得更加具體:最終交付的內容能否直接使用。
這一變化對不同行業的影響有所不同。
對影視行業來說,AI會降低執行和製作環節的門檻,同時對創作者的判斷力、審美和敘事能力提出更高要求。劇本是否成立、節奏是否合適、情緒是否到位,這些關鍵的創作判斷仍然需要由人完成。AI可以承擔越來越多執行工作,創作者則要對作品作出最終判斷。
對廣告行業來說,內容生產的顆粒度會越來越細。過去,一個品牌可能只製作十幾條廣告;有了AI之後,可以針對不同人群、平台和使用場景批次生成差異化素材,再根據投放資料持續調整。廣告內容將更接近即時生產和精準匹配。
對短影片行業來說,AI會進一步擴大內容供給,但使用者的時間和注意力不會同步增加。
未來,內容和管道之間的競爭可能更加激烈,也會推動短影片向更垂直、更個性化和更精品化的方向發展。
問:目前,AI視訊最熱的幾個落地場景,包括短劇、漫劇、廣告和電商行銷。你怎麼看這些需求的可持續性?那些是真正能夠長期形成穩定付費的市場,那些更多還處於流量紅利或者早期“嘗鮮”階段?
王科:短劇和漫劇的需求增長很快,目前正從流量紅利期逐漸進入優勝劣汰階段。未來能夠形成長期付費的,主要是那些可以持續生產精品內容、沉澱IP資產,並保持高效穩定產出的平台。
相比之下,廣告和電商行銷的需求更為穩健。這些場景的內容生產頻率高、反饋周期短,投入產出也更容易量化。
跨境電商商家會直接計算一條AI行銷視訊能夠帶來多少轉化。只要投入產出能夠算得過來,商家的付費就可以持續。
OPC市場目前仍處於快速放量階段,距離天花板還比較遠。以智象自身為例,隨著vivago R1全球上線,我們預計使用者規模還會進入一個新的增長階段。
問:前兩年大家最容易比較的是畫質、運動幅度、生成時長。到現在,那些指標正在取代這些參數,成為決定產品競爭力的新標準?那些能力仍然能夠形成真正的差異?
王科:畫質、運動幅度、生成時長這些指標今天依然重要,只是它們正在逐漸成為產品的基礎能力。
現在評價視訊生成產品,需要看的維度更多。基於自己的實踐,我們提出了一套“CHATS™視訊Agent評估標準”,總體主要看這幾個方面,供大家參考:
C,Consistency,一致性。角色、場景和風格能否在多個鏡頭之間保持穩定。
H,Human Intent,意圖理解。系統能否精準理解使用者的創意,並且在多輪對話中持續推進任務。
A,Audio & Visual,視聽完整度。除了生成畫面,還要能夠處理聲音、節奏以及整體視聽體驗。
T,Timeline & Tale,時間線與敘事。一個故事能否在多個鏡頭、多個段落之間持續成立。
S,Stability,穩定交付。能否減少反覆生成和返工,提高最終內容的可用率。
未來真正能夠形成差異的,我認為會是系統工程能力。
行業正在發生一個比較明顯的變化,競爭正在從單點模型能力,進一步走向整條創作鏈路的協同。從指令碼規劃、分鏡設計、角色管理到音效匹配,最終考驗的是整套系統的組織效率和交付確定性。
比如vivago R1也在驗證這個方向。根據我們的統計,其背後的HD-AgentOS調度系統目前可以大幅提高有效內容的可用率,減少視訊生成過程中反覆“抽卡”帶來的不確定性。這套系統需要理解整個項目,再完成需求分析、任務拆解和模型調度,讓不同能力圍繞同一個創作目標協同工作,逐步提高完整作品的交付能力。
問:目前大語言模型已經出現明顯的價格競爭,視覺多模態賽道是否也會走上類似的路徑?智象未來怎麼避免陷入價格戰?
王科:當一類產品逐漸標準化,大家能夠生成的內容越來越接近,價格很容易成為重要的競爭維度。
智象更希望把競爭放在價值和差異化能力上。
第一,繼續做目前市場上還比較難完成的事情。比如R1希望一次完成更長視訊的生成,同時提高商業可用成功率、角色一致性和整體穩定性。這些能力很難單純通過降價獲得。
第二,通過系統能力建立壁壘。智象目前重點投入的是“模型+智能體+資料”這套閉環:模型提供理解和生成的基礎能力,智能體負責把這些能力組織成完整創作流程,資料再通過真實使用不斷反饋到系統中。
隨著這幾個部分持續循環,最終競爭會越來越多地落到整體系統能力上。
問:面對字節Seedance、Seedream以及快手可靈等大廠產品,獨立創業公司在基礎模型、產品和流量等方面會存在資源差距。未來最現實的競爭空間在那裡?
王科:創業公司的融資規模和資源體量與大廠相比確實存在很大差距。我覺得要競爭,主要有三點。
第一,認知要快。對於模型架構、下一代模型的技術方向以及技術選型,要儘可能做出更早、更準確的判斷。有時候只要比大廠提前半個身位,甚至提前三個月,就可能出現機會窗口。
第二,落地速度要快。方向確定之後,要盡快完成模型迭代,同時推進產品化和商業化,在窗口期形成產品壁壘或者使用者壁壘。
第三,組織調整要快。創業公司的一個優勢是組織更加扁平,決策鏈條更短,可以根據技術和產品變化快速調整方向。
智象也有比較明確的生態位。比如我們與TikTok有比較緊密的合作,大廠擁有流量和資本優勢,我們更希望依靠底層模型創新和工程落地速度參與競爭。
在這個市場裡,我們不會和大廠在所有方向全面競爭,而是希望在關鍵節點抓住技術和產品窗口。比如出現新的技術方向之後,我們可以很快把演算法、工程和產品團隊拉到一起,當天討論,第二天就開始做Demo。
這種速度,就是創業公司的生存空間之一。
公司的核心策略依然是在圖片和視訊多模態模型上持續投入,希望長期保持在全球第一梯隊,這也是我們最核心的競爭力。
02
AI視訊的兩種互動路線
問:近日,智象未來上線內容創作智能體vivago R1,並同步升級國內版本“夠搭”。vivago R1定位為“內容創作智能體”,而非單純的視訊生成工具。“智能體”和“工具”的核心區別是什麼?
王科:這裡最核心的區別是,使用傳統工具時,使用者需要自己決定每一步怎麼做;使用智能體時,使用者更多隻需要說明自己最終想得到什麼結果,系統會自己規劃中間過程。
以幀贊為例,底層採用自研的原生全模態架構,可以把文字、圖片、視訊、參考資產、文件說明以及歷史創作結果放進同一個任務語境中,讓Agent理解整個項目的上下文,而非只執行一個單點指令。
在此基礎上,智能體系統再把模型能力組織成持續推進的創作流程,在指令碼、分鏡、角色、場景、鏡頭和音效之間進行規劃和調度,同時處理複雜敘事中的角色形象、聲音特徵和風格一致性。
傳統視訊生成工具中,使用者輸入提示詞,模型生成一個片段。如果想完成一部完整短片,使用者往往還需要自己拆分鏡、調整提示詞、逐個生成鏡頭、手動拼接以及完成後期處理。
我們希望使用者先告訴系統自己想做什麼,後面的任務拆解和環節協調儘量交給Agent完成,最終圍繞同一個項目持續推進。
問:長視訊生成涉及幾十個甚至更多鏡頭,行業目前普遍面臨角色、風格和敘事難以保持一致的問題,智象未來通過那些方式解決?
王科:我們的思路是採用“多Agent協作機制”。
比如R1的主Agent可以先理解使用者的整體創意,將其拆解成不同任務,再由子Agent分別處理指令碼、分鏡、角色、場景和音效等環節。
這些Agent共享同一套項目上下文。使用者提供的文字、圖片、視訊和其他參考素材都會進入同一個任務語境,各個Agent據此理解人物設定、故事走向和視覺風格,減少不同環節之間的偏差。
HD-AgentOS負責調度整個製作流程,協調各個Agent的任務和輸出,儘量讓角色形象、畫面風格、敘事節奏和整體質感保持一致。
我們認為,系統協同是其中一個重要原因。長視訊涉及多個連續環節,最終效果取決於這些能力能否穩定配合,而非某一個環節能夠生成多好的單個鏡頭。
問:R1強調“Chat-First”(以對話為主要的互動方式)。自然語言會成為下一代專業創作軟體的主要互動方式嗎?像Photoshop、Premiere這類複雜的專業軟體,未來可能發生多大變化?
王科:好的創作工具應該儘可能順應人的表達習慣。對於視訊創作來說,創作者最先想到的通常是自己想表達什麼,而非節點、畫布或者具體參數、。
目前,AI視訊工具大致有兩類互動方式。
一類是畫布式或節點式工作流。產品將模型、工具和參數交給使用者,由使用者自行連接和偵錯。這種方式自由度較高,對專業使用者很有價值,但學習和使用門檻也相對較高。
另一類是R1採用的對話式互動。使用者可以直接通過自然語言提出需求,由系統生成視訊,並通過多輪對話繼續修改和調整。
在這一過程中,使用者主要負責表達目標,Agent負責拆解和執行任務。SkillHub承擔類似“翻譯層”的作用,根據使用者意圖匹配和編排不同的Skill,將創作需求轉化為可以執行的任務序列。
我們希望通過這種方式封裝複雜的系統能力,為使用者提供一個更簡單的創作入口,縮短從產生靈感到開始執行之間的操作鏈條。 (騰訊科技)