繼姚順雨後,田永龍也進入騰訊CEO/總裁辦公室

第一財經「新皮層」獨家獲悉,田永龍近期也被納入騰訊CEO/總裁辦公室(CEO|President’s Office),同時其頭銜已明確為「混元多模態負責人」,向姚順雨匯報。

7月24日,騰訊將原本相互獨立、分別由姚順雨和薄列峰領導的大語言模型和多模態模型部門合併,成立基礎模型部,由姚順雨統一負責。田永龍在此次騰訊大模型架構調整期間加入其多模態團隊,擔任VLM(視覺語言模型)負責人。

接近騰訊的人士稱,7月的架構調整後,曾任多模態模型負責人的薄列峰就不再直接負責一線模型業務,與王迪一道擔任基礎模型部營運負責人。

田永龍本科畢業於清華大學,2014年至2016年在香港中文大學多媒體實驗室(MMLab)攻讀碩士,師從商湯科技創始人湯曉鷗和商湯科技首席科學家王曉剛,從事視覺基礎演算法、檢測/識別類早期工作。

2017年,田永龍進入麻省理工攻讀電腦博士,並於博士期間先後在輝達、Google及DeepMind實習。2022年畢業後,田永龍加入Google,擔任高級研究科學家,後轉至DeepMind。2024年10月,他加入OpenAI擔任研究員,主要研究方向是多模態表徵學習和自回歸視覺生成。同一時期,姚順雨也在OpenAI擔任研究員。

騰訊CEO/總裁辦公室最初只有騰訊「大語言模型(LLM)一號位」、首席科學家姚順雨一名成員,該部門去年12月隨著姚順雨的公開入職而設立,明確了姚順雨在領導大語言模型團隊向所屬上級部門TEG的總裁盧山匯報之外,也要直接向騰訊總裁劉熾平匯報。

田永龍的任命意味著騰訊提升了多模態的重要性,並試圖複製它在語言模型領域的翻身之路——先找到一位海外優秀模型廠商的核心研究員,再將人才放置到某個模型一把手的位置,並賦予他向上可以直接跟騰訊集團一把手說上話、向下統領從預訓練到後訓練以及資料和Infra的模型完整產線的權力——此前,姚順雨加入騰訊後走的就是這條路。今年7月和8月,騰訊接連發佈的Hy3和Hy4 preview,都由姚順雨主導。

Hy4 preview發佈時,騰訊稱,在其組織的163名內部專家、203個工程任務的盲測中,Hy4 preview(均分2.99/4)的表現略優於GLM 5.3(均分2.92/4.00)和Kimi K3(均分2.94/4.00)。

騰訊看起來對姚順雨在語言模型領域的工作是滿意的,並試圖將這一模式複製到多模態領域。

「新皮層」此前曾報導,騰訊混元自去年11月至今就沒有再發佈過新的多模態模型。這一周期顯著超過同行的模型迭代速度。同一周期內,阿里巴巴、字節跳動和可靈先後突破了視訊生成的音畫一體化能力,並在多模態生成的推理能力上取得進展,其中字節在此期間更新了Seedance 2.0和Seedance 2.5兩代模型。

在多模態領域的落後削弱了騰訊在終端應用上服務使用者的能力。目前,騰訊旗下的元寶、WorkBuddy等產品內建的混元系模型仍然無法原生地理解和生成圖片和視訊,完成這兩項任務時,兩個應用都要呼叫第三方工具才能實現。

9月2日的騰訊WorkBuddy生態大會上,WorkBuddy接入了Plaud、Rokid、影石、科大訊飛、安克、猛瑪、京東京造、優籃子等公司的硬體。其中所涉及的多模態場景,也只涉及語音識別和理解,比如優籃子的「鍵盤麥」,其中一項功能是方便使用者語音輸入。影石的攝像裝置接入WorkBuddy,WorkBuddy目前能夠為其解決的也是視訊的音訊轉寫,不涉及對視訊畫面的處理。 (新皮層NewNewThing)