姚順雨重整騰訊多模態路線:靠攏梁文鋒,遠離李飛飛

AI速讀
騰訊混元多模態團隊近日迎來重大人事調整,前 xAI 負責人藺旭東加入負責內容生成演算法。此次變動揭示了騰訊在姚順雨領導下,正將研發重心從側重於「生成」的空間智能路線,轉向以「理解」為核心的 AGI 主線,旨在將多模態能力整合進 Agent 的感知環節。騰訊已撤銷原大語言模型部與多模態模型部,合併成立「基礎模型部」。近期推出的 Hy3 模型在 WorkBuddy 平台上的實踐證明,強化上下文理解能顯著提升複雜任務的解決率,顯示騰訊正致力於打造能理解介面並執行操作的 GUI Agent。

騰訊混元多模態團隊又發生了一起人事變動。據媒體報導,曾負責xAI多模態理解負責人藺旭東,已經離開xAI,加入騰訊混元,擔任多模態內容生成演算法負責人。

這則人事消息之所以值得關注,是因為它發生在混元多模態團隊持續調整的背景下。

過去一段時間,混元內部陸續傳出負責人離職、研究人員轉崗和新成員加入的消息。

原多模態理解負責人胡瀚離職創業,田永龍等人加入騰訊,原有多模態團隊的匯報關係也隨著大語言模型部門和多模態模型部門的整合而發生變化。

但這是否意味著騰訊多模態團隊正在“改朝換代”,目前還不能直接下結論。

公開資訊能夠確認的是,混元確實出現了人員流動和組織重組。藺旭東的加入傳聞,更像是這場調整中的一個新訊號:騰訊正在重新組合多模態理解和內容生成這兩條路線。

那麼問題來了,藺旭東究竟是什麼來頭,他能為騰訊補上什麼能力?以及騰訊的多模態路線是否正在從“生成內容”轉向了姚順雨更偏向的“理解上下文並在世界中行動”?



藺旭東是什麼來頭,他加入騰訊後能做什麼?

公開資料顯示,藺旭東2018年畢業於清華大學,隨後赴哥倫比亞大學攻讀博士。

在讀博期間,他的研究方向包括嵌入學習、視訊分析和生成模型,也曾參與哥倫比亞大學與Facebook AI合作的Vx2Text項目。

V指的是視訊,x指的是未知數,可以是聲音、語音甚至是環境音,2代表to,Text則代表字幕。它的邏輯是,先把視訊、聲音等不同模態轉換成類似“語言token”的向量,再統一送入語言模型進行融合,最後由自回歸解碼器生成開放式文字。

Transformer只能理解token,所以AI本質上是不理解視訊和音訊這兩種檔案形式的,也就更不可能將其轉換成文字。

舉個例子,一隻狗在游泳池旁邊跳進水裡,那麼Vx2Text的視訊識別器看(V)就會輸出關鍵詞:狗、跳躍、游泳池;聲音識別器(x)就會輸出:水聲、撲通。

雖然Vx2Text的產品功能是“生成”,但產品的核心難點在於“理解”。

當然,Vx2Text並不是簡單地把畫面“翻譯”成幾句話而已。模型需要從視訊裡識別人物、物體、動作和事件,還要理解這些東西在時間上的變化,最後再把視覺資訊組織成語言。

博士畢業後,藺旭東進入DeepMind,參與Gemini相關的多模態預訓練和後訓練工作。2025年,他又加入xAI,公開資料稱其負責多模態理解方向,並參與多模態內容理解與生成模型的訓練。

如今他加入騰訊混元,將負責混元多模態內容生成演算法。

藺旭東的加入與其說是提升混元多模態生成的性能,倒不如說是為瞭解決一個困擾所有多模態的問題——理解。

以前的生成模型更像一個畫面製造器。給它一句提示詞,它可以生成一張圖片、一段視訊。但只要使用者提出更複雜的要求,模型就有點跟不上了。比如人物在長視訊裡變了,物體的形狀前後不一致,攝影機運動不符合空間關係等等。

這不是因為模型不會生成,而是因為它沒有穩定地記住和理解世界。

所以,把藺旭東放到多模態內容生成的位置上,可能正是因為他把多模態,“翻譯”成AI能理解的東西。

藺旭東的加入要放在一個更大的背景下才能看得清楚,那就是如今騰訊混元正在重新整理自己的多模態路線。

2025年1月,騰訊傑出科學家(Tencent Distinguished Scientist)胡瀚接替此前離職的劉威,全面負責混元多模態大模型的研發,同時擔任騰訊混元大模型Tech Lead。

2025年下半年騰訊內部組織調整,他從多模態模型部,調入了大語言模型部旗下的“Frontier”前沿技術研究組,頭銜變成了多模態理解方向負責人,匯報線也改為向姚順雨匯報。

實際地位從“一個獨立部門的領導”變成了“大語言模型部下面一個研究組裡某個方向的負責人”,管的範圍從整個多模態大模型收縮到只剩多模態理解這一塊,多模態生成等方向被劃出去了。

2026年3月騰訊已經撤銷了成立近十年的AI Lab,部分人員併入混元大語言模型部轉向姚順雨匯報。在這次調整後,此前混元實際掌舵人、騰訊公司副總裁蔣傑,正式與姚順雨完成工作交接,不再兼管AI Lab和混元。

2026年7月初,前OpenAI研究員、姚順雨清華本科校友田永龍加入騰訊,負責視覺語言模型方向。

緊接著沒過幾天,騰訊TEG正式發文,撤銷大語言模型部和多模態模型部,合併成立“基礎模型部”,姚順雨任負責人,向TEG總裁盧山匯報。騰訊稱,此舉旨在提升模型研發與協同效率,探索全模態模型的智能上限。

隨後,胡瀚被曝離職創業。

前亞馬遜首席科學家、京東數科首席科學家、阿里通義實驗室應用視覺團隊負責人、原騰訊多模態模型部負責人Linus在這次調整之後,從原本和姚順雨平行的地位,改為了向姚順雨匯報。

還沒完,騰訊混元多模態基礎模型負責人鐘釗,負責HunyuanVideo和HunyuanImage兩條生成線,是混元多模態生成方向的實際掌舵人。

他在8月14日發了一條朋友圈,稱“即將發佈的版本或將是我在HunyuanVideo與HunyuanImage項目中的最終版本”,字裡行間充滿了告別。

藺旭東或許只是混元多模態換血中的一員,但是他的加入釋放出了一個明顯的訊號,整個騰訊對於多模態的研發方向,已經發生了改變。

在此之前,騰訊是怎麼做多模態的?

此前騰訊的語言模型和多模態是根本的兩條線,而混元多模態最核心的兩個產品,正是前文提到的HunyuanVideo和HunyuanImage。

HunyuanVideo是文生視訊模型,2024年12月首發即以130億參數成為當時全球最大的開源視訊生成模型,支援5秒720p輸出。2025年密集擴展能力,3月上線圖生視訊,5月推出定製化生成HunyuanCustom和數字人驅動Avatar,11月發佈1.5版本,將參數壓縮至83億,支援原生生成5至10秒的480p或720p視訊,並可通過超解析度得到1080p輸出。

HunyuanImage起步更早,這是2024年5月,混元推出的首個中文原生DiT架構圖像模型,2025年迭代出業界首個工業級即時生圖的2.0版本,同年9月發佈了2.1版本(170 億參數、原生 2K 解析度)和3.0版本(800 億參數、首個工業級開源原生多模態生圖模型),2026年1月進一步推出帶推理能力的Instruct版本,支援提示詞自改寫和圖生圖編輯。

還有一條線是Hy 3D,這是一個專門生成單體3D模型的模型,2024年11月隨Hunyuan-Large一同開源1.0版本,2025年1月升級到了2.0,拆分為DiT形狀生成加Paint紋理合成的兩階段流水線,6月2.1完整開源訓練程式碼,9月發佈3.0將建模精度提升3倍、幾何解析度達1536³,目前已迭代至 3.1,廣泛用於電商建模、產品設計和3D列印。

在這三座大山之後,或許是李飛飛的空間智能理論影響了騰訊,亦或者是多年以前,騰訊在數字孿生中掌握的相關知識,在AI的加持下得以再次利用。

就如同劉關張之後有趙雲一樣,混元多模態在2025年7月下旬也迎來了四弟,Hy World 1.0。

所謂空間智能,根據李飛飛旗下World Labs的表述,它是指讓AI感知、生成、推理並與三維空間中的世界互動。

語言模型學習的是文字的統計結構,而世界模型需要學習空間和時間的結構,例如光線如何落到物體表面、從沒有拍攝過的角度看花園會是什麼樣,以及物體受到外力後會如何運動。

騰訊稱,Hy World 1.0是全球首個開源、支援模擬的沉浸式3D世界生成模型,技術路線是先生成一張360度全景圖作為“世界代理”,再分解成語義層做分層3D重建,最後輸出可匯入遊戲引擎的分層Mesh。

由於騰訊本身就很擅長開發遊戲引擎和遊戲內容,Hy World雖然表現力非常驚人,卻也被網友調侃成了“騰訊不願離開舒適圈”。

在Hy World 1.0發佈的一個多月後,騰訊又發佈了Hy World-Voyager,定位是基於相機軌跡控制的超長漫遊世界模型。

Hy World-Voyager解決的是1.0留下的一個痛點。雖然1.0生成的3D世界質量不錯,但漫遊範圍是相當有限的,走不了多遠就會出現幾何漂移和穿模。

Voyager的思路是換一條技術路線,不直接生成3D資產,而是先做RGB-D雙模態視訊生成,每一幀畫面在輸出色彩的同時同步輸出一張深度圖,然後用深度圖即時重建3D點雲。

總而言之,Hy World幾乎可以說是藉由騰訊在引擎和美術上的優勢,完美還原了李飛飛空間智能的設想。

要知道,Hy World 2.0它的技術報告全稱就是《HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds》,其中的“Reconstructing, Generating, and Simulating 3D Worlds”(重建、生成、模擬3D世界),也就是前文所提到的,World Labs對空間智能的闡述。

然而並不是所有人都認同李飛飛,就包括姚順雨。在多模態這件事上,姚順雨似乎更認同梁文鋒的觀點。

姚順雨認同梁文鋒

李飛飛的觀點是,世界模型作為空間智能的一部分,是AGI重要的一條線,梁文鋒則持反對意見。

曾有投資者在多模態這個問題上向梁文鋒提問,梁文鋒回答說:“我們只做AGI主線——GPT、CoT、Agent。AI領域很廣泛,但3D、視訊生成、世界模型,跟智能的主線沒有太大關係。”

DeepSeek有個產品,叫做DeepSeek OCR,幾乎就是梁文鋒多模態觀的技術具象化。把視覺模態當成服務於語言模型的工具,而不是獨立的智能方向。

DeepSeek OCR的核心叫做“上下文光學壓縮”(Contexts Optical Compression),核心思路是把長文字渲染成圖像,用視覺編碼器把文字壓縮成緊湊的視覺token,再交給語言模型解碼。

是不是有點眼熟?翻回前面看看藺旭東的Vx2Text,姚順雨或許正是想學梁文鋒,把混元現有的多模態基礎,轉換成為這樣一種理解方式,進而更好地融合進Hy模型主線。

包括OpenAI在內,很多AI大廠其實都是類似的做法。姚順雨曾就職於OpenAI,很可能就是在那時,確立了這個方向。

姚順雨加入騰訊後的第一款旗艦產品是Hy3,他把重點放在推理、智能體、長上下文和生產力任務上。

官方稱,Hy3在軟體開發、辦公生產、金融建模、前端設計和遊戲製作等任務上進行了最佳化,並且在工具呼叫穩定性、複雜上下文承接和多輪意圖保持方面繼續改進。

Hy3的目標並非“屠榜”,而是讓模型在真實產品裡少出錯、能理解上下文、能夠把任務持續做下去。

這個產品本身就非常的“姚順雨”。

2026年6月5日,在騰訊雲AI產業應用大會與湯道生的對談中,姚順雨是這麼判斷的,AI下半場的競爭壁壘不在模型參數量,而在Context(上下文)。

“我們現在就像是擁有了一個萬能的錘子,它可以去砸任何釘子。方法論已經變得非常成熟,相反,尋找真正有價值的問題,變得越來越困難。”姚順雨如此說到。

同樣在那場會上,公佈了騰訊長期AGI建設的三層架構:基礎底座(預訓練+後訓練+基建)、產品落地、前沿探索。推理能力屬於基礎底座要解決的問題,上下文能力屬於產品落地和前沿探索的交叉點。

此前,為了測試模型脫離原有知識,只從上下文中尋找答案,姚順雨還特地製作了測試上下文的基準CL-bench以及CL-bench life。

可見,姚順雨其實也跟梁文鋒一樣,覺得主線是Agent相關的內容,而非多模態生成。

至於Hy3到底怎麼樣,那就要看WorkBuddy了。WorkBuddy是Hy3的首發平台之一,這哥倆屬於是“產品+模型”雙螺旋關係,互相成就。

接入Hy3後WorkBuddy的表現提升非常顯著。基於辦公場景內部測評,任務解決率從72%躍升至 90%,平均耗時縮短34%,可多處理約五分之一的複雜需求。

Hy3上線後,WorkBuddy上主動選擇Hy3的使用者數增長了 6 倍,日均文書處理量較預覽版增長20倍,7月8日算力消耗一度達到峰值,排隊率超過50%,騰訊為此緊急擴容。

一個猜想,Hy提升多模態理解後,它的GUI Agent場景下的體驗會更上一層樓。GUI Agent的核心鏈路是“感知螢幕 — 理解介面 — 決策操作 — 執行驗證”,其中多模態理解是連接視覺感知與語言決策的關鍵瓶頸。

但這並不足以證明李飛飛是錯的,只能說姚順雨認同梁文鋒罷了。(字母AI)