合肥又押中AI獨角獸:多模態賽道,3個月融了21億

7月23日,智象未來(HiDream.ai)宣佈完成15億元C輪融資

這是這家多模態大模型公司在近三個月內完成的第三輪融資。

三輪密集融資超21億元後,智象未來估值超過10億美金,正式躋身全球AI獨角獸行列。

但真正讓人感興趣的從來不是錢本身,而是誰在給錢,以及為什麼給。

這一輪的投資人名單,堪稱“神仙打架”。

公開資訊顯示,本輪融資由社保基金四川振興科創基金、工銀資本、弘頤資管、敦鴻資本聯合領投,廈門國貿資本、上影新視野基金、湖北長江產業投資集團、華策影視、航源資本、創雲海資本、華福投資、餘杭金控股份、交銀資本、若松基金等多家機構跟投。

老股東合肥產投、東方富海、金浦投資、金華金投、中哲創、財鑫資本持續加注。

風格、佈局邏輯截然不同的資本,罕見扎堆押注同一家創業公司。

這不禁讓人好奇,這些人在智象身上看到了怎樣的未來?

LLM估值紅利見頂,視覺模型的想像空間正在被打開

智象C輪融資的這個時間點很微妙,恰好踩中了AI行業範式切換的關鍵拐點。

此前,大語言模型憑藉程式碼生成、文字互動能力,長期佔據資本與市場的核心焦點,參數規模、推理速度成為核心競爭標尺。

近期,隨著新一代開源/開放權重模型密集發佈,市場對大語言模型估值溢價的分歧明顯加劇,部分已上市AI模型公司股價波動加大。

過去,資本願意為更大的參數規模、更高的Benchmark分數、更強的通用能力支付溢價;

但當模型能力迭代越來越快、領先窗口越來越短,單純“做大模型”已經不再是足夠穩固的估值錨點。

相比繼續押注參數規模,資本的目光正在從AI“現在能做什麼”,移向“未來能成為什麼”

市場正在形成共識:大語言模型的領先優勢極具短暫性,單純依靠參數堆疊、文字能力領跑的模式,已逼近工程天花板。

同一時間,AI視覺賽道卻呈現出截然不同的景象,迎來資本集中爆發。

據不完全統計,2026年國內AI視覺領域的融資總額已逼近300億元。

大廠背景的字節系Seedance、可靈ARR資料大幅增長,一眾獨立創業公司接連落地大額融資,賽道整體進入技術落地、商業兌現的黃金周期。

可以說,多模態已經成為自AI Coding之後,AI商業化確定性最高的賽道之一。

智象未來能在資本市場受到矚目,當然離不開這個時代的“大氣候”。

多元資本共同押注了一個怎樣的技術敘事?

賽道升溫,不代表所有人的機會均等,市場只會把籌碼押給真正的頭部玩家。

而一家公司的投資方陣容,往往就是最直接的信任投票。

翻看智象未來投資人名單,幾個鮮明的特徵躍然紙上:國家級資本站台、多元資本集結、以及“首次出手”的稀缺性。

公開資訊顯示,這是社保基金作為LP首次投資多模態大模型方向的公司,更是工銀資本第一次出手多模態大模型企業。

跟投名單裡,還站著來自安徽、上海、浙江、福建、湖南多地的國資。上影股份、華策影視兩家頭部影視上市公司並肩入局。

此外,還有東方富海、弘頤資管、敦鴻資本這些頂級的市場化VC。

這種多元化的投資人結構,在當下的一級市場中並不多見。

通常情況下,一家AI創業公司的融資輪次越往後,股東構成會趨於收斂,集中在少數幾類財務或產業資本手中。

智象未來的情況——國資、產業方、市場化VC在同一輪次密集參與,至少說明一個問題:不同屬性的資金,在這裡看到了不同的價值錨點。

對國家級資本而言,關注的是“路線”。

全模態世界模型是否成立,目前尚無定論,但如果這一方向最終跑通,其戰略意義將不止於單一商業場景,而可能成為下一代AI基礎設施的重要組成部分。

影視產業資本,此次投資是卡位內容產業革命的前置佈局。

因此,可以看到上影股份、華策影視與智象未來達成了多項合作,比如新型內容創製、院線場景升級、AI跨屏整合行銷、AI大屏製片標準與工作流程制定等方向協同。這顯然不是一次簡單的財務佈局,雙方都志在長遠。

對地方國資而言,算的是產業帳。

AI競賽已進入貼身肉搏階段,各地都在尋找自己的“標誌性項目”。

過去十年,合肥接連投資了長鑫科技、京東方等高科技企業,這座城市在過去反覆證明了一件事:它擅長在行業黎明期下重注。如今,智象未來被擺在了相似的位置上。

而敦鴻資本、弘頤資管、東方富海等市場化頂級機構集體入局,則是基於硬核技術落地價值的專業判斷。

多家機構更是首次佈局視覺大模型賽道,這也從側面印證了智象未來的技術路線、團隊積澱與商業化能力,具備一定的行業稀缺性與差異化優勢。

不同背景的出資人,從各自坐標出發,看到了同一個方向上的不同切面。但這些切面最終拼出的那個完整圖景,才是真正值得追問的問題——

他們共同押注的,究竟是一個什麼樣的技術敘事?

顛覆行業“縫合架構”,UiT跑出原生全模態新路徑

要回答這個問題,需要回到一個更底層的判斷:大模型通往AGI的路徑,正在發生一次根本性的路線分歧。

過去兩三年,AI行業的主流敘事是“規模法則”——參數越大、資料越多、算力越強,模型就越聰明。

楊立昆對此立場鮮明,甚至近乎偏激,他曾多次表示,三到五年內,世界模型將取代LLM成為主流AI架構。

這一判斷是否精準另當別論,但它指向了一個大模型無法迴避的先天缺陷:LLM本質上是“書齋裡的思想家”,它的智能被侷限在人類文明已編碼的符號系統之內。

世界模型試圖解決的就是這個問題:讓AI不僅僅處理符號,而是理解物理世界中的空間、時間、因果和互動。

智象未來選擇從視覺像素出發,建構原生全模態架構。

這個選擇的背後有一個核心判斷:圖像是資訊密度極高的模態之一。

一張圖片定格的是某一時刻物理世界的完整狀態,空間關係、光影變化、物體材質、色彩資訊,所有這些都被壓縮在像素矩陣中。

傳統的多模態模型,本質上是“縫合怪”,在語言模型之外掛一個圖片理解模組,再補一個生成模組,各模態分別編碼,最後在外層拼接。

文字是主軸,其他模態是外掛。資訊在不同模組之間傳遞時,每一次轉換都在損耗。

智象的UiT架構試圖顛覆這個範式。

它將圖像像素、文字Token、視訊體素以及音訊、動作、空間關係等原始訊號,由同一套Transformer完成理解、生成和推理。

不設獨立的文字編碼器,不用VAE作為模態間的傳導介質,所有訊號統一tokenization,端到端地在同一網路中完成多工處理:文生圖、長文字渲染、指令編輯、主體驅動、故事板生成,全部由同一個模型完成。

全模態世界模型不是一個停留在論文裡的學術概念。2026年5月,原生全模態架構迎來了第一個關鍵節點。

智象旗下HiDream-O1-Image(8B參數開源版本)以「Peanut」匿名上榜全球知名獨立AI模型評測平台Artificial Analysis、並登上文生圖榜單開源模型第一,成為榜單前20名模型中參數最小的版本。

隨後,商用版HiDream-O1-Image-1.5再次成為該榜單排名最高的中國圖像模型,位列全球前三,在光影、複雜構圖、指令跟隨和中英文字渲染上表現突出。

當然,一次評測登頂不意味著終局。

視覺大模型的競爭才剛剛進入深水區,榜單排名的變動周期正在從季度縮短到月度。

但這件事的坐標意義在於:當行業還在爭論“世界模型到底能不能work”的時候,至少有一條技術路線,已經在第三方評測體系裡交出了可被驗證的答卷。

多路資本集體重倉,固然有賽道的熱度使然,但更深層的驅動力,恐怕還要回到智象未來在底層架構上的差異化選擇。

這讓智象未來在眾多AI創業公司中,呈現出了一種不太一樣的質地。

這段“荒誕科幻片”,可能比SOTA更有說服力

區別於多數重技術、輕落地的AI創業公司,智象未來早已搭建起成熟可落地的“1+1+3”商業化體系,實現底層技術、平台能力、場景應用的三級跳落地。

體系第一層為HiDream全模態大模型底座,承載所有底層技術創新與算力支撐;

  • 第二層為HiHarness企業能力中台,對外輸出標準化、可復用的模型能力,適配企業定製化需求;
  • 第三層聚焦商業行銷、影視創作、社媒創作三大垂直場景,打造專屬AI智能體產品,深度嵌入產業工作流。

其中,本次WAIC重磅發佈的vivago R1多模態創作智能體,成為技術落地的核心標竿產品。

針對行業視訊生成時長受限、畫面跳變、人設錯亂、可用性低等長期痛點,vivago R1實現了突破性革新,成為全球首款支援無限時長視訊自主生成與編輯的創作智能體。

產品搭載長鏈路敘事規劃能力,摒棄傳統“抽卡式”隨機生成模式,先完成整體指令碼與鏡頭規劃,再分段落地生成、智能糾錯,單段任務失敗獨立重試,不影響整體創作進度。

依託這一架構革新,vivago R1將AI內容商用有效成功率提升至85%,跨過了企業規模化商用的核心門檻,讓AI正式從輔助工具,升級為內容生產的核心生產力。

這套技術參數落到實際創作中是什麼效果?

近期有一個來自使用者的測試案例在創作者社群中流傳甚廣,有人在vivago R1上輸入了一組相當刁鑽的指令:

生成一部“葉什爾查姆風格”的荒誕科幻短片。

葉什爾查姆(Yeşilçam)是土耳其上世紀六七十年代為核心的商業電影黃金時代。

它整體上類似“土耳其好萊塢”,以高產、明星制和類型片著稱;其中一支後期低成本山寨片,因為粗糲道具、拼貼素材和誇張表演,後來在海外電影圈走紅,《土耳其星戰》就是最著名的代表——

真人套著硬紙板噴銀漆的怪獸服、泡沫塑料製作的石頭道具、手繪的外星球背景、演員綁著石頭在蹦床上模擬飛行、直接剪輯真實爆炸鏡頭入畫。

它的精髓是“廉價到極致,反而形成了一種獨特的幽默感”。

對於AI視訊模型來說,這種風格真正的考驗在於:它要求模型理解“不完美”,既要輸出符合物理規則的畫面,又要刻意保持低成本的質感,還要在“假”與“可笑”之間精確地踩中那個風格閾值。

大多數模型在面對這類指令時,會傾向於輸出“好看的畫面”而非“對的風格”。

而vivago R1的處理結果,至少在創作者社群的反饋中,被認為是“精準捕捉到了那種荒謬感”——硬紙板怪獸、手繪背景、廉價特效的質感都被覆現,同時鏡頭之間的敘事邏輯保持了連貫。

一個把“假”做到極致的風格,反而成了檢驗模型對“真實”理解深度的試金石。

這個案例之所以值得被提及,不是因為它展示了多精美的畫面,而是因為它指向了一個更本質的能力:一個真正可用的創作工具,必須能理解風格、執行意圖、保持敘事連貫,而不只是生成漂亮的單幀畫面。

紮實的產品能力也收穫了全球市場認可。

目前vivago海外版已覆蓋全球100多個國家和地區,累計服務超5000萬使用者,今年5月灰度版登頂Product Hunt日榜第一,被矽谷知名product hunter Chris Messina強力推薦,評價為“Think Claude Code,but for video”,商業化落地能力穩居行業第一梯隊。

如果說前兩年的AI競賽比的是誰更能“讀懂”人類已有的知識,那麼從現在開始,比的是誰更能“看懂”並“推演”這個物理世界

這是一場從文字智能到物理智能的範式躍遷,也是世界模型賽道最迷人的不確定性。

沿著這條原生全模態技術路線,智象未來的演進節奏與落地效果,值得長期追蹤。

它不僅是國產AI在底層架構上的一次主動突圍,更可能為“大模型如何跨越紙上談兵、真正走進物理世界”這一命題,提供了一個值得挖掘的範本。

隨著這一輪融資塵埃落地,世界模型的牌桌擺開,真正的競賽,才剛剛鳴槍。 (量子位)