今年世界人工智慧大會(WAIC)期間的感受就一個詞:熱鬧。
1100余家企業集中參展亮相,超300款產品全球首發、超4400款展品令人目不暇接。
這說明,AI技術已經不是某個行業的事,而是所有人的事。
更重要的是AI企業估值規模快速增加。
其中,快手可靈最近公佈完成總額上限30億美元外部增資,投後估值有望達180億美元;DeepSeek最新已經完成500億元融資,已確定估值超過3500億。
目前,中國平均每天生產晶片超過15億塊,大模型日均呼叫量達數百兆詞元,居世界第一。今年中國AI核心產業規模預計將繼續超過30%。
高盛近期發佈的行業研究報告指出,當前中國AI科技類股總市值約4兆美元,增長潛力巨大。
就在7月18日,加拿大工程院外籍院士、ACM Fellow、IEEE Fellow梅濤創立的智象未來(HiDream.ai)適時加速多模態Agent落地——現場發佈全球首款無限時長內容創作多模態智能體vivago R1。
簡單來說,vivago R1 就是一款能不限時長、邏輯不亂、畫質穩定的全自動 AI 長視訊創作大腦,不用你分段拼接,它自己就能從頭到尾完整拍出靠譜的長視訊,直接商用。
智象未來創始人、CEO梅濤在演講中表示,Agent OS是釋放大模型核心價值的“最後一公里”。它並非簡單的工具集合,而是一套可復用、可編排、可進化的創意生產力元件體系。依託Agent OS,vivago R1可實現全流程自主創作。使用者僅需輸入核心創作需求,智能體可在半小時內自主完成分鐘級完整視訊的全鏈路創作,全程無需人工干預。
顯然,多模態AI正迎來屬於它的DeepSeek時刻。
多模態Agent背後四條核心演進路線
最近發生的一件小事,直觀折射出多模態對於AI發展的重要性。
兆估值的智譜,近期開源了大模型GLM-5.2,一度達到開源AI程式設計第一、全球第二,僅屈居於大名鼎鼎的神話級模型Fable-5,強到離譜。但是,GLM-5.2卻只是純文字模型,實現百萬Token超長上下文和深度邏輯推理,沒有搭載視覺編碼器,看不了圖也造不出圖。
反觀拿來對標的Fable-5,甚至是DeepSeek檢視模式,都是原生多模態模型,視覺能力應有盡有。
近期,智譜創始人唐傑徵集對GLM-5.3的新功能建議,但大家一致認為,需要增加多模態能力。
所以你可以看到,大模型正以前所未有的速度快速躍遷,頂尖AI模型的智能水平已經很高了,Coding、Hermes Agent、企業級AI產品,都已經開始落地在真實場景中。但是,這其中依然存在落地難、適配弱、不可控的產業鴻溝,多模態能力至關重要。
而Agent智能體具備自主記憶、邏輯規劃、工具調度、多端協作的核心能力,可將基礎模型的生成與推理優勢,轉化為標準化、可驗證、可交付的系統化產業能力,基礎模型疊加智能體能力,正是一條新的路徑。
“2023年之後,智能體產業迎來快速萌芽,2024年更是進入規模化爆發的關鍵階段。站在當前產業節點來看,智能體的進化遠未止步,未來將全面邁入自進化發展階段,同時完成從單智能體獨立作業到多智能體協同協作的核心迭代。自此,AI智能體不再是簡單的工具輔助載體,逐步成長為可承接復雜任務、可自主完成全鏈路工作、可實現最終標準化任務交付的數位化員工,真正實現AI價值的落地閉環。”梅濤表示。
這意味著,無論是基座AI模型,還是具身智能、世界模型,多模態Agent是通用人工智慧(AGI)發展的必經之路。
正如梅濤在演講中所言,縱觀智能體的整體發展歷程,其技術迭代始終遵循四條核心演進路線,建構起全新的AI工程範式,徹底重構了傳統AI的應用邏輯。
第一,是能力抽象維度的迭代,從傳統的工具呼叫(Tool Calling)升級為可復用技能(Reusable Skills)的沉澱。過去智能體平台的開發落地,大多依賴API、SDK等基礎介面呼叫,應用門檻高、復用性差。而當下的產業發展核心,是引導開發者將各行業的專業知識、業務經驗與行業方法論,沉澱為標準化、可復用的AI技能。如今,行業技能已經取代傳統介面,成為智能體呼叫、執行任務的核心基礎單元,讓智能體具備垂直行業的專業作業能力。
第二,是工程範式的核心升級,從提示詞驅動(Prompt Centric)轉向系統可靠驅動(Honney Centric)。早期AI應用最佳化,核心聚焦於單次對話、單次生成的效果最佳化,追求單輪迴答的精準度。而新時代的智能體研發,核心目標已經轉變為保障全系統輸出的穩定性、可靠性與低成本,解決大模型機率性輸出偏差、效果不穩定、落地成本高的行業痛點,這也是智能體能夠規模化商用的核心前提。
第三,是迭代機制的顛覆性變革,從靜態預定義工作流升級為反饋驅動的自主進化模式。傳統智能體的工作流程、任務鏈路、工具調度邏輯,均依賴人工提前定義、固定固化,無法適配復雜多變的業務場景。而新一代智能體可依託真實業務反饋形成閉環,自主迭代工作鏈路、最佳化工具調度邏輯、完善任務執行流程,無需人工持續干預,實現真正意義上的自主進化。
第四,是協作框架的全面升級,從單智能體獨立作業演進為多智能體協同調度。面對復雜、長鏈路、多維度的產業任務,單一智能體的能力邊界有限。行業發展正加速建構完善的智能體編排系統,通過多智能體分工協作、統籌調度、互補賦能,破解單智能體的能力侷限,承接更高複雜度、更高專業度、更高落地要求的業務場景。
基於這套成熟的技術架構與作業系統底座,當前智能體產業已形成兩大核心應用形態,分別是通用智能體與多模態智能體,覆蓋不同維度的產業需求。
全球首個無限時長內容創作智能體來了
從應用角度來說,過往我們用AI做視訊,只能做幾十秒短片、越長越容易畫面崩壞、人物人設和劇情說斷就斷。
不管是個人創作者做短劇,還是企業拍宣傳片、行銷成片,AI始終只能當個“臨時素材工具”,撐不起完整的商業創作全流程。
而在今年WAIC,智象未來帶著多年多智能體協同與AgentOS系統的核心技術沉澱,直接打破了這個行業僵局——全球首款無限時長創作智能體vivago R1正式首發亮相。
以智象未來(HiDream.ai)自研的vivago R1為代表的多模態智能體,是全球首個無限時長內容創作智能體。
相較於通用智能體,多模態智能體需要應對更復雜、更精細化、更具創意屬性的創作流程,核心要解決內容專業性、結果可復現性、流程可協作性三大核心問題,最終為使用者交付可落地、可商用、高品質的內容價值。
在梅濤看來,AI創作不再是拼接碎片素材的輔助工具,已經實現了一次行業升級:從“單點素材生成”,進階到能自主思考、自主規劃、自主跑完整條長鏈路創作的全能創作搭子。
簡單說,以前AI只能幫你“拼片段”,現在vivago R1能幫你“做完整成片”。
縱觀整個行業,vivago R1的核心優勢可以精準概括為長、長、准,剛好對症下藥,解決了困擾創作者和企業已久的難題。
vivago R1先拆掉的是時長。
市面上的AI視訊模型大多卡在15到30秒。要做幾分鐘的短劇、一條品牌宣傳片,過去只能反覆生成、手動拼接,費時間,接縫還看得出來。vivago R1不設這個上限,任意時長一條生成完,短影片矩陣、連載短劇、品牌大片走同一套流程。AI長視訊商業化這塊空白,算是補上了。
時長之後,麻煩是連貫。
短片接起來不等於長視訊。手拼的片子常見毛病是前後不像同一個東西:人臉變了、場景風格散了、劇情接不上,整條片過不了商用那條線。vivago R1的做法是先想後做。接到任務,它會先把故事線、鏡頭節奏、人物和場景設定釘住,過程中持續校準。AI視訊跳變、人設崩、敘事斷這些老問題,是從這裡壓下去的。
最後一關是產出穩不穩。
用過AI做視訊的人都清楚,模型隨機性強,十次翻車八九次,有效成片率低。企業想批次接單、規模化交付,人力和時間頂不住。
依託自研AgentOS全流程調度與治理技術,vivago R1實現了創作全鏈路的可控、可校準、可復盤。目前其內容有效可用成功率達到85%,遠超行業平均水平。這意味著大部分生成內容無需反覆微調,可直接用於商業製作、品牌傳播、市場化交付,真正把AI創作從“碰運氣”變成了“穩產出”。
這事不是調個API、套個範本就能幹的。
同樣是出分鏡、做成片,專業活兒要讀鏡頭語言、壓敘事節奏、接內容情緒,還要分清Vlog、短劇、行銷片、專題片各怎麼做。
這種行業理解和調度顆粒度,普通大模型沒有。
這款產品早已獲得全球行業認可。
今年5月,vivago 灰度測試版成功登頂Product Hunt日榜第一。矽谷知名技術博主Chris Messina親自體驗產品,僅通過簡單文字輸入,便生成出一段敘事完整、分鏡豐富、畫面流暢的一分鐘短影片,充分驗證了其極簡操作、高階輸出、全鏈路自主創作的核心能力。
基於技術演進路線,整個AI產業已經形成清晰的五層Agent技術架構,自上而下依次為應用場景層、能力層、系統層、資源層與底層模型層,層層賦能、閉環聯動。而貫穿整套架構、保障全鏈路高效運轉的核心關鍵,便是智象未來自研的全新HD-AgentOS智能體作業系統。
該智能體作業系統依託資源層、系統層、能力層三層耦合架構,建構起完整的智能體產業落地支撐體系:
資源層決定了智能體可呼叫的資源、可依託的基礎能力,是智能體作業的基礎支撐;
系統層定義了智能體的作業標準、調度邏輯,保障任務高效、穩定落地;
能力層界定了智能體的業務邊界與專業水準,決定其可實現的業務效果;
最上層的應用場景層,則面向各行各業真實業務,實現技術價值的最終落地。
簡單來說,HD-AgentOS是套智能體作業系統,管的是多個智能體怎麼搭班。單個智能體能兜的事有限,幾個搭成團隊,能看、能想、能動手,跑起來還會自己改。這麼搭是為了讓智能體能在復雜的真實產業場景裡落下去,不停在演示那一步。
可以說,Agent OS是釋放大模型核心價值的“最後一公里”,它並非簡單的工具集合,而是一套可復用、可編排、可進化的創意生產力元件體系。
vivago R1的核心價值,是將AI內容創作從傳統的單點、單次碎片化生成,推進到長鏈路、全流程、智能化、可商用的規模化生產新階段,重構了AI內容創作的產業範式。
33天融資超5億,
已覆蓋5000萬專業個人使用者
今年4月,智象未來(HiDream.ai)宣佈完成超5億元新一輪融資。本輪融資由東方富海、安徽省投資集團旗下的省產業投資公司、峰華資本等新股東聯合投資,同時合肥產投、興泰集團、合肥高投、安徽省人工智慧母基金等老股東持續加注。
今年5月,智象未來宣佈完成新一輪億級融資,深創投、金浦投資、財鑫資本、復聚資本等多家機構參與。
短短30天左右,智象未來迎來兩次超過5億元融資,體現出資本市場對原生全模態大模型方向的持續看好。
隨著視覺生成、具身智能等前沿技術加速融合,世界模型成為 AI 演進的重要方向,智象未來在底層模型架構、產品化能力與產業生態佈局上的持續突破,也獲得了市場進一步認可。
截至目前,智象未來產品已覆蓋全球超5000萬專業使用者及4萬餘家企業客戶,形成了從技術研發到產品商業化的閉環。
今年5月,智象未來正式發佈超2千億參數、基於新一代原生全模態模型架構 Unified Transformer(UiT)打造的圖像大模型 HiDream-O1-Image-Pro。
這不僅在多個基準測試中刷新 SOTA 紀錄,也標誌著智象未來正向圖像、視訊、文字、音訊等多模態統一建模的“原生全模態”階段邁進。
如今,AI大模型的演進路徑清晰且篤定,正從單模態走向多模態,從多模態升級為全模態,最終邁向原生世界模型。
行業賽道雖存在多種技術流派,包括3D原生模型、視訊多模態模型、具身智能等,但最具落地可行性的核心路徑,是從視訊多模態迭代到原生全模態,最終完成世界模型的終極進化。
梅濤認為,未來的原生全模態世界模型,將實現“任意模態到任意模態”的自由轉換,無需二次分發、壓縮與適配,實現認知、感知、互動、生成的一體化閉環。
其中,圖像是世界模型進化的核心起點:圖像向時間維度延伸,形成動態視訊;向空間維度拓展,建構三維幾何空間;疊加互動能力,最終形成具備自主感知、自主反饋、自主進化的具身智能形態。
在他看來,原生全模態大模型的落地,將推動智能體實現架構升級、能力躍遷、協作革新、安全落地四大維度的跨越式升級:
“我們可以總結出AI產業進化的核心邏輯:大模型讓AI讀懂世界、擁有認知能力,智能體讓AI落地行動、實現價值交付,而原生全模態世界模型,將認知、行動、反饋深度串聯,最終推動AI從簡單的內容生成,進化為能夠重構場景、賦能產業、改變世界的核心生產力。”梅濤在演講結尾表示。 (智能紀元AGI)
