登入
關鍵字
#羅福莉
官方認證
北風窗
昨天 14:54
•
羅福莉劇透小米MiMo v3架構:模型還沒影,論文全說了
MiMo-V2.6剛發佈,羅福莉就開始劇透MiMo-V3了。 MiMo-V3將採用新架構,核心是HySparse2,是Agent執行長任務時越來越重的輸入處理。 Agent生成一次工具呼叫可能只需幾十個token,搜尋結果、網頁、程式碼和執行日誌卻能一口氣回來幾萬字。 模型讀完繼續操作,每一輪結果都要進入上下文;
科技
#羅福莉
#小米
#MiMo-V3
32人
讚
留言
分享
官方認證
北風窗
昨天 10:22
•
小米羅福莉發表新論文:MiMo V3模型採用新架構,推理預填充算力砍到1/5。
小米發佈MiMo V2.6系列大模型不到48小時,羅福莉剛剛官宣新的MiMo V3技術資訊。 9月23日消息,就在剛剛,小米MiMo大模型團隊負責人羅福莉在X上發佈了推文,宣佈即將發佈的MiMo-V3,將採用全新架構,而核心 HySparse2今天發佈。 新架構核心HySparse2採用更少的預填充、更小的 KV Cache快取、更出色的長上下文檢索。 羅福莉稱,與 MiMo-V2.6 的 Hybrid SWA 架構相比,HySparse2新架構的MiMo V3:
科技
#小米
#羅福莉
#MiMo V3
56人
讚
留言
分享
官方認證
北風窗
2026/09/21
•
小米「直播煉丹」火了!把大模型訓練後台全公開,一小時燒掉20萬
眾所周知,雷軍很喜歡直播。 不管是新品發佈會,還是平時和米粉聊天,都習慣一邊開播一邊聊。 有趣的是,小雷發現現在小米AI團隊負責人羅福莉,也玩起了直播。 圖源:X
港股
#小米
#大模型訓練
#羅福莉
188人
1 則留言
讚
留言
分享
百貓爭鳴
MiMo 2.5 Pro 一直都客滿速度很慢... 只好換別家
2026/09/21
讚
回覆
官方認證
北風窗
2026/09/18
•
小米羅福莉直播燒雷軍的錢!RL訓練全程,每小時燒20萬元,75%的嘗試失敗,全部不打碼
OpenAI 不敢公開的,小米公開了:大模型 RL 訓練全程直播! 今天凌晨,小米羅福莉,把 MiMo-V2.6 的強化學習訓練過程搬上了直播!上午 8 點 13 分,帳單停在 1,113,375 美元。還在跳。 當 Anthropic 和 OpenAI 還在跟你玩捉迷藏時,小米向我們展示了訓練 AI 可以更透明。 01. 羅福莉 線上直播燒錢
科技
#小米
#羅福莉
#RL訓練
208人
讚
留言
分享
官方認證
北風窗
2026/07/05
•
AI天才為什麼回流大廠
有些年代,聰明人都往外走。 題圖來自:視覺中國 學校待不住,研究院待不住,大公司更待不住。外面有錢,有新牌桌,有一張幾個人圍著坐到半夜的白板,外賣盒子摞在旁邊,誰都覺得自己馬上要改變世界了。 十九世紀的淘金者往西走,二十世紀的矽谷工程師離開仙童,移動網際網路那幾年,產品經理從大廠辭職,發的朋友圈總要配一句類似“重新出發”的話。
港股
#小米發佈會
#羅福莉
#天才少女
253人
讚
留言
分享
官方認證
北風窗
2026/05/02
•
羅福莉與小米大模型:一個"天才少女"的600億AI賭局
01. 從"天才少女"到小米大模型掌門人2024年底,一條傳聞震動AI圈:雷軍親自出手,以千萬級年薪挖來一位95後女生,執掌小米大模型團隊。她叫羅福莉,彼時在DeepSeek擔任核心研究員,參與研發的DeepSeek-V2模型讓她在圈內聲名鵲起。這不是一個普通的職場跳槽故事。羅福莉的履歷自帶"爽文"色彩:本科:北京師範大學電腦專業碩士:北京大學計算語言學研究所,在ACL頂會發表8篇論文,其中2篇為第一作者職業軌跡:阿里達摩院→幻方量化(DeepSeek母公司)→小米在DeepSeek期間,她參與研發的DeepSeek-V2以"性價比之王"著稱,推理成本僅為GPT-4 Turbo的1/70,被業界稱為"AI界的拼多多"。這段經歷讓她深刻理解了一個道理:大模型的競爭,最終是效率與成本的競爭。2025年初正式加入小米後,羅福莉迅速進入角色。2026年3月,小米發佈兆參數MoE大模型MiMo-V2-Pro,全球榜單排名第八;4月28日,MiMo-V2.5系列正式開源,採用最寬鬆的MIT協議,同步啟動百兆Token激勵計畫。申請了沒有?一般有2億token的免費使用量。從被雷軍挖角到主導開源戰略,羅福莉用一年半時間,完成了從研究員到戰略決策者的蛻變。02. AGI時間窗口只剩1-2年羅福莉的激進,不僅體現在技術迭代速度上,更體現在她對行業趨勢的判斷上。在近期一次深度訪談中,她拋出了幾個極具衝擊力的觀點:關於AGI時間線"一年前我覺得要三到五年,現在我認為時間窗口已縮短到1-2年。"她認為,當前行業整體進度約20%,2026年將推進至60%-70%。這意味著,我們正處於AGI爆發的前夜。關於開源戰略"AGI不可能由一家公司獨佔,必須走開源協同路線。"這種認知直接影響了小米大模型的開放策略——MIT協議、百兆Token免費發放、首日即適配國內外主流AI晶片。在羅福莉看來,封閉生態在AI時代是死路,只有最大化社區參與度,才能加速技術迭代。關於競爭核心"行業競爭核心不再是對話體驗,而是長程自主任務執行、工具呼叫與自我修復能力。"這句話解釋了為什麼MiMo-V2.5-Pro的標竿測試是"4.3小時自主完成編譯器開發"——這不再是聊天機器人的遊戲,而是AI Agent替代人類工程師的預演。03. 600億背後的人車家野心羅福莉的技術理想主義,需要龐大的資源支撐。雷軍給了。2026年3月,雷軍宣佈:未來三年小米AI投入超600億元,2026年當年超160億元。這是什麼概念?小米造車三年投入約100億元,AI投入是其六倍。這筆錢正在流向三個方向:大模型底座:MiLM/MiMo系列持續迭代,從7B到兆參數全覆蓋端側智能:手機、汽車、家居的AI原生改造機器人:人形機器人已進入汽車工廠實習,打螺絲成功率超90%更關鍵的是,雷軍透露2026年有望在一款終端上實現自研晶片+自研OS+自研AI大模型的"大會師"。這款被推測為小米17S Pro的重磅產品,將搭載新一代自研晶片玄戒O2,成為小米技術自主化的標誌性節點。羅福莉的大模型團隊,正是這場"大會師"的核心一環。從雲端到端側,從手機到汽車,她的模型正在嵌入小米生態的每一個毛孔。04. 25歲平均年齡:一支少年軍的AI遠征小米大模型團隊的另一個標籤,是年輕。羅福莉本人出生於95年的,而她的團隊成員平均年齡僅25歲。看到這個數字真是浮誇到我了,老了呀。這是一支典型的"少年軍"——沒有大廠包袱,沒有路徑依賴,只有對AGI的純粹信仰。年輕,就是幹!這種年輕化的組織架構,或許正是小米能在一年內完成從MiLM到MiMo-V2.5跨越的原因。當其他大廠還在糾結匯報層級時,小米的工程師已經在為開源首日適配七八家晶片廠商而通宵奮戰。羅福莉的管理風格也帶著鮮明的技術理想主義色彩:她強調"長程自主能力"而非短期對話最佳化,推崇"開源協同"而非封閉壟斷,預判"1-2年AGI"而非保守觀望。這種激進,與雷軍"風口上的豬"的哲學一脈相承。05. 國產開源大模型的"羅福莉時刻"羅福莉的崛起,恰逢國產開源大模型的集體爆發。2026年4月,堪稱中國AI開放原始碼的奇蹟月:4月8日:智譜AI開源GLM-5.14月20日:月之暗面開源Kimi K2.64月23日:小米MiMo-V2.5公測4月24日:DeepSeek-V4正式發佈並開源4月28日:小米MiMo-V2.5正式開源上個月體驗新的大模型,針對是人都麻木了,沒幾天來一款爆款。Hugging Face顯示,其平台上41%的大模型下載量來自中國模型。中國已成為全球開源大模型最活躍的供給方。羅福莉現在是一個符號——她代表著中國AI新生代的力量:年輕、激進、開源、務實。當她說"我們已經摸到AGI的邊界"時,這不僅是技術判斷,更是一代AI人的集體宣言。 (程式設計師失控了)
科技
#羅福莉
#小米大模型
190人
讚
留言
分享
官方認證
RexAA
2026/04/28
•
超越DeepSeek-V4!羅福莉交出小米最強開源模型,首日適配5家中國國產晶片
免費100兆Token,開源模型新王登場。▲圖片由AI生成智東西4月28日報導,剛剛,小米開源羅福莉帶隊研發的MiMo-V2.5系列模型,採用MIT協議,允許商用推理部署與二次訓練,無需額外授權。▲MiMo-V2.5-Pro在Hugging Face的開源頁面截圖此前,該系列模型於4月23日開啟公測,包括MiMo-V2.5-Pro、MiMo-V2.5兩款模型。模型具備更強Agent能力,支援100萬上下文,且Token效率大幅提升。MiMo-V2.5-Pro的完整基準測試結果今日公佈,小米稱其在GDPVal-AA(Elo)、Claw-Eval(pass^3)等多項測評中超過了最新開放原始碼的DeepSeek-V4-Pro模型,也超過了發佈不久的Kimi K2.6等主流閉源模型,實現總體最佳。▲MiMo-V2.5-Pro的最新測評成績開源首日,MiMo-V2.5-Pro宣佈已完成與阿里平頭哥、亞馬遜雲科技、AMD、百度崑崙芯、燧原科技、沐曦、天數智芯多個晶片廠商的接入適配。MiMo-V2.5系列模型同步完成SGLang和vLLM主流推理框架的Day 0適配。與此同時,小米還推出百兆Token創造者激勵計畫,計畫30天內免費發放總計100兆Token權益;推出Agent生態共建計畫,目前已與OpenCode、Hermes Agent、KiloCode等Agent框架廠商展開合作。01. 模型技術細節公佈 測評超越DeepSeek-V4由小米最新公開的模型卡可知,小米迄今為止最強模型MiMo-V2.5-Pro是一款擁有1.02兆(1.02T)個參數的混合專家模型,其中420億(42B)個啟動參數,基於混合注意力架構,相比前代模型在通用智能能力、複雜軟體工程和長時域任務處理方面均實現了顯著提升。MiMo-V2.5-Pro繼承了MiMo-V2-Flash的混合注意力機制和多標記預測(MTP)設計。局部滑動窗口注意力(SWA)和全域注意力(GA)以6:1的比例交錯使用,窗口大小為128個Token,在長上下文情況下,通過可學習的注意力池偏置,將鍵值快取儲存空間減少了近7倍,同時保持了性能。一個輕量級的MTP模組,採用密集前饋神經網路(FFN),原生整合用於訓練和推理,輸出吞吐量大約提升了三倍,並加速了強化學習(RL)的部署。▲MiMo-V2.5-Pro的模型架構及訓練過程該模型預訓練使用27兆(27T)個Token,採用FP8混合精度,原生序列長度為32K,上下文擴展至1M個Token。後訓練遵循MiMo-V2-Flash中引入的三階段範式:1、監督式微調,在精心挑選的資料對上建立基礎的指令跟蹤;2、領域專精訓練,其中不同的教師模型分別通過針對特定領域的強化學習進行最佳化,涵蓋數學、安全、智能工具使用等領域;3、多教師策略蒸餾(MOPD),其中單個學生模型在每位專精教師的Token級指導下,從自身的展開中學習策略,並將所有教師的能力融合到一個統一的模型中。再來看看MiMo-V2.5,這是一個3100億(310B)參數的稀疏MoE模型,擁有150億(15B)啟動參數,在48兆(48T)個Token上進行訓練。它的語言主幹框架繼承了MiMo-V2-Flash的混合滑動窗口注意力機制,並搭載自研預訓練視覺、音訊編碼器,兩類編碼器通過輕量化投影模組完成跨模組融合。▲MiMo-V2.5架構訓練過程分為五個階段:1、基於多樣化語料開展文字預訓練,搭建大語言模型主幹網路;2、進行投影層預熱訓練,實現音視訊、視覺投影器與語言模型的對齊融合;3、依託高品質跨模態資料集,開展大規模多模態預訓練;4、執行監督微調與智能體後訓練,在此過程中將上下文窗口從32K逐步擴容至256K,最終達到100萬Token;5、最後是通過強化學習(RL)與多目標偏好蒸餾(MOPD),進一步強化模型的感知、邏輯推理與智能體執行能力。從小米最新公佈的測評結果來看,MiMo-V2.5在Claw-Eval Text、Terminal-Bench 2.0、SWE-Bench Pro等多項測評中大幅超越了DeepSeek最新發佈的DeepSeek-V4-Flash。▲MiMo-V2.5最新測評情況02. 開源首日,完成阿里平頭哥沐曦 等7家晶片廠商適配小米還公佈了晶片生態與推理框架最新適配情況,MiMo-V2.5-Pro開源首日完成多個晶片廠商的接入適配:阿里平頭哥:基於真武810E及全端自研AI軟體棧實現深度適配。亞馬遜雲科技:基於Trainium2晶片與Neuron SDK+vLLM推理框架完成深度適配,實現開源即全球可用的首日適配。下一代3nm製程Trainium3將進一步釋放模型性能。AMD:依託ROCm開放原始碼軟體棧提供Day-0適配及全面最佳化支援。百度崑崙芯:通過底層算子最佳化與軟硬體協同加速,保障模型穩定高效運行。燧原科技:基於自研馭算TopsRider軟體棧深度最佳化,在燧原L600上完成全量適配。沐曦:基於曦雲C系列及全端自研MXMACA軟體棧,實現Triton語法到沐曦GPU指令集的端到端原生支援。天數智芯:實現Day 0級深度適配。此外,MiMo-V2.5系列模型同步完成SGLang和vLLM主流推理框架的Day 0適配。03. 免費發放100兆Token 已與Hermes Agent等合作與此同時,小米還同步推出MiMo Orbit計畫,包含兩部分:“百兆Token創造者激勵計畫”,與面向Agent框架團隊的“Agent生態共建計畫”。在百兆Token創造者激勵計畫方面,小米面向全球AI使用者免費發放Token,30天內發放總計100兆Token權益,贈完即止。該計畫採取申請制,通過者最高獲得Max檔位Token Plan,包含16億Credits,價值659元。活動時間:台北時間2026年4月28日00:00至5月28日00:00。Agent生態共建計畫方面,小米面向全球Agent框架團隊提供專項支援,為框架提供MiMo Token限免支援,同時參與和贊助框架平台的AI Hackathon等共創活動。其目前已與OpenCode、Hermes Agent、KiloCode等Agent框架廠商展開深度合作。04. 結語:多款國產開源模型“亮劍”交鋒近期,大模型行業開源力度持續加碼,模型與國產及國際晶片的“Day 0”適配已從亮點變為剛需,推理效率和部署成本成為下一階段競爭的核心。同時,百億級Token免費激勵與Agent框架生態共建,反映出行業正從“拼參數”轉向“拼應用”。值得關注的是,小米MiMo-V2.5-Pro在多項基準評測中直接超越DeepSeek最新開放原始碼的DeepSeek-V4-Pro模型,可謂與DeepSeek在開源賽道發起“亮劍”交鋒,有望倒逼行業更快降低推理成本、提升Agent真實任務完成率。 (智東西)
科技
#DeepSeek
#羅福莉
#Token
248人
讚
留言
分享
官方認證
北風窗
2026/03/24
•
字節的“羅福莉”,撐起了Seedance的半邊天
隨著小米新模型的推出,“天才少女”羅福莉再度成為焦點。其實在AI科學家圈子裡,女性數量雖然相對較少,但也絕非羅福莉一顆獨苗。在字節跳動,就有一位羅福莉式的人物。她就是Seedance 2.0視訊生成模型的預訓練負責人,曾妍。一般聊起Seedance 2.0,大家普遍想到的人是掌舵人吳永輝、研發負責人周暢、視訊生成技術核心負責人蔣璐。很少有人知道,曾妍的存在,同樣無可或缺。因為預訓練是整個模型的“基石”,它決定了模型的能力上限。大多數人把預訓練當成“喂資料”,但真正的高手知道,預訓練是在“塑造模型的世界觀”。資料怎麼配比、架構怎麼設計、訓練策略怎麼調整,每一個決策都在決定模型能看到什麼、理解什麼、生成什麼。無論你後面怎麼努力最佳化,預訓練只要沒做好,這個模型就一輩子達不到Seedance 2.0現如今的高度。不僅是貢獻大,曾妍的晉陞速度在字節也是相當快的。從她畢業進入字節開始算起,到現在的4-2職級,曾妍僅僅花了5年時間。4-2職級對應高級總監/權威架構師層級,屬於公司核心戰略級技術骨幹,年包(含基本工資、年終獎、股票)普遍在500萬以上。她到底做了什麼,才有如此成就?讓我們從她的求學之路說起。01 從西交到字節說實話,當我第一次看到曾妍的履歷時,並沒有覺得特別驚豔。1997年出生,西安交通大學本科,加拿大蒙特利爾大學電腦碩士。這條路徑放到現在的AI圈裡太常見了。但接下來發生的事,就不那麼“標準”了。2021年9月,曾妍以校招生身份加入字節跳動 AI Lab,起點職級是演算法工程師。入職僅兩個月,曾妍就以第一作者身份在arXiv上發表了論文《Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts》,也就是後來大家熟知的X-VLM模型。這篇論文解決的問題,用大白話說就是:怎麼讓 AI 既能看懂“大場面”,又能注意到“小細節”。傳統的視覺語言模型有兩個極端。一種是“粗線條”派,只看圖像整體和文字的對應關係,就像你給AI看一張照片,它只能說“這是海灘”,但說不出更多了。另一種是“顯微鏡”派,依賴昂貴的目標檢測器去摳每個物體,雖然能看到細節,但計算成本高得嚇人,還得依賴大量人工標註資料。曾妍提出的X-VLM,就是取兩者之所長。它能同時學習從整體到局部、從場景到物體、從粗到細的多層次視覺概念,並與文字中的不同粒度資訊精準對齊。或者我用一個我最近剛學會的話來形容:既見森林,又見樹木。這個“多粒度對齊”的思想,在當時看起來只是個學術創新,但它為曾妍後來擔任Seedance 2.0預訓練負責人埋下了伏筆。因為視訊生成的預訓練,本質上也是個多粒度建模的問題。你要想生成一個好看的視訊,那就既要把握整體敘事節奏,讓一段視訊有連貫的故事線;又要控制每一幀的細節質量,確保人物面容不變形、物體運動符合物理規律;還要建立時序維度上的關聯關係,讓前後幀之間的過渡自然流暢。這剛和X-VLM的底層邏輯是一致的。接下來的兩年,曾妍就像開了掛一樣。她以第一作者身份在TPAMI、ICML、CVPR、ACL、NAACL等國際頂會發表了八篇論文,還擔任了TPAMI、ICML、NeurIPS、ICLR、ACL、EMNLP等頂會的審稿人。2023年,一個關鍵轉折點到來了。字節跳動成立大模型研究部門Seed,曾妍和所在團隊一同轉入。這個時間節點你得放在大背景下看,2022年底ChatGPT橫空出世,2023年初各大公司紛紛All in大模型,字節也在這波浪潮中調整了技術戰略。曾妍擅長的多模態預訓練,在視訊生成這個新戰場上,能發揮她的全部實力。在Seed部門,曾妍作為第一作者主導了兩個重要項目,分別是CCLM和Lynx。先說CCLM(Cross-View Language Modeling)。這個項目讓AI模型同時學會“跨語言”和“跨模態”的理解能力。CCLM通過統一的預訓練框架,讓在英文圖像-文字資料上訓練的模型,可以零樣本遷移到中文、日文等其他語言的多模態任務上。說白了,就是讓 AI 學會“舉一反三”——在英文視訊上學到的理解能力,能直接用到中文、日文、西班牙文的視訊上。再說Lynx。這是一個系統性研究如何訓練GPT-4風格多模態大語言模型的項目。2023年正是GPT-4剛發佈的時候,大家都在摸索怎麼做出“能看圖說話”的大模型。曾妍團隊通過一系列對比實驗,找出了模型架構設計、訓練資料配比、指令微調策略等關鍵因素,最終做出了 Lynx 模型,在多模態理解和指令跟隨能力上都表現出色。用人話說,就是研究“怎麼造出一個既能看懂圖片又能流暢對話的AI”,並且搞清楚了那些因素真正重要。真正讓曾妍“出圈”的,是2023年年底的PixelDance。這個項目的論文題目很有意思,叫《如何讓像素跳舞》(Make Pixels Dance: High-Dynamic Video Generation)。它解決的是視訊生成領域一個長期存在的矛盾,如何平衡動態性和穩定性。你想想,如果一個AI生成的視訊動作幅度很大、畫面變化劇烈,看起來確實生動有趣,但很容易出現畫面崩壞、角色變形、物體突然消失這些“靈異事件”。反過來,如果你追求穩定性,讓角色和場景保持一致,人物面容不突變,那生成的視訊就容易僵硬,像幻燈片切換而不是流暢的動態影像。曾妍團隊的突破在於,他們在預訓練階段就建立了嚴格的時序約束。傳統的視訊生成模型都是先生成視訊,然後再一幀一幀去修補。PixelDance則是讓模型學會了在保持一致性的前提下生成動態內容。核心創新點是在擴散模型框架中,引入首幀+末幀的雙圖像指令,配合文字指令聯合約束視訊生成,同時在網路結構中新增時序摺積與時序注意力層,從生成的源頭就錨定了視訊的起止狀態,從而保證大動態動作下的主體與場景一致性。就像訓練一個舞者,從一開始就教她在保持平衡的前提下做大幅度動作。PixelDance的成功,讓曾妍在字節內部的地位迅速提升。2024年,她從演算法工程師晉陞為演算法研究員,成為Seed團隊中最年輕的研究員之一。這個晉陞不只是對她學術能力的認可,更重要的是,她證明了自己能把研究成果轉化為實際產品。在大廠裡,這兩種能力的差別,就像會做菜和會開餐廳的差別。02 從 PixelDance 到 Seedance 2.0有意思的是,PixelDance就是Seedance的前身。Seed代表字節的大模型部門,dance則保留了“讓像素起舞”的核心理念。這個改名不只是品牌策略,更標誌著模型從研究原型向商業產品的轉變。2025年6月11日,字節正式發佈了Seedance 1.0,曾妍是該模型的核心研發負責人。雖然直至2026年2月,曾妍才被字節官方確認為Seedance 2.0 視訊模型預訓練負責人,但知情人士爆料,早2025年下半年時,曾妍就已經正式牽頭Seedance 2.0的預訓練全流程工作,成為該項目的核心一號位。她的+2 leader是周暢,+3 leader是Seed團隊負責人吳永輝。Seedance 2.0核心技術突破之一是雙分支擴散變換器架構,這是曾妍團隊在預訓練階段就確立的基礎架構。傳統視訊生成模型採用“先畫後配”的模式。即先生成視訊畫面,再單獨生成或匹配音訊。這種方式的問題在於,音畫分離導致同步性差,人物說話時嘴型對不上,背景音樂的節奏與畫面情緒脫節,音效出現的時機與畫面動作不匹配。Seedance 2.0通過視訊與音訊平行生成的方式,共享同一個理解編碼器,從根源上實現了音畫原生協同。這個架構設計的關鍵在於,讓模型在生成每一幀畫面的同時,就考慮對應的音訊應該是什麼樣的,而不是等畫面全部生成完再去“配”音訊。文章開頭我就講了,預訓練是整個模型能力的基石。曾妍在這個階段需要處理海量的視訊資料,建立視覺、文字、音訊等多模態之間的對齊關係。她通過引入“跨分支校準模組”,即時校準視訊與音訊的節奏、情緒與場景匹配度,確保嘴型與台詞同步、音效與畫面契合、背景音樂與情緒氛圍一致。預訓練階段把所有的多模態對齊關係、物理規律、運動模式都塞進模型裡,成為“默認項”。後續模型只要呼叫到相關內容,就會立刻給出預訓練時的結果。它不是簡單地讓模型記住訓練資料,而是讓模型從海量資料中提煉出普遍規律,形成對世界的基礎理解。Seedance 2.0生成時長1分鐘的2K視訊僅需60秒,比上一代Seedance 1.5 Pro快了30%。速度提升的背後,是曾妍團隊在預訓練階段對模型架構、訓練策略、資料配比的精細調優。她的團隊迭代速度極快,在預訓練階段就完成了擴散模型的多輪最佳化。最佳化注意力機制減少冗餘計算,改進噪聲調度策略加快收斂速度,精選高品質訓練資料提升樣本效率。每一個最佳化點單獨看都不起眼,但累積起來就是質的飛躍。模型規模越大,訓練成本越高,每一個百分點的效率提升都意味著數百萬元的成本節約和數周的時間縮短。Seedance 2.0還實現了多鏡頭敘事能力。這意味著模型不僅能生成長視訊,還能理解“全景-中景-特寫”的專業分鏡邏輯,自動規劃鏡頭切換,生成帶有蒙太奇效果的完整敘事序列。這個能力很大程度上依賴於曾妍在預訓練階段投喂的字節跳動海量短影片資料。抖音每天產生數以億計的短影片,這些視訊雖然大多是普通使用者拍攝,但其中不乏優秀的鏡頭語言和敘事技巧。曾妍團隊從這些資料中篩選出高品質樣本,讓模型學習到了人類導演的鏡頭語言和敘事節奏。這種從資料中提煉出的“導演直覺”。03 曾妍與羅福莉同為女性AI科學家,曾妍和羅福莉在模型研發中,都擅長尋找“平衡點”。在DeepSeek時期,羅福莉參與的DeepSeek-V2,通過MoE架構的稀疏啟動,把推理成本降到了GPT-4 Turbo的七十分之一,但是性能卻與頂尖的閉源模型十分相近。這就像設計一個大型圖書館,雖然藏書百萬冊,但每次查詢只需要翻開其中幾本,而不是把所有書都搬出來。這種“按需啟動”的機制,讓大模型的成本驟然下降,卻不怎麼損失性能。羅福莉在性能與成本之間,找到了這樣一個平衡點。到了號稱“性價比之王”的小米,羅福莉把DeepSeek的精神貫徹到底。她主導團隊與北京大學聯合研發資源管理系統ARL-Tangram,讓模型的算力成本直降71.2%。然而成本下降並不意味著性能下降。使用了該技術的兆參數的旗艦模型MiMo-V2-Pro,在Artificial Analysis全球大模型綜合智能排行榜上位列第八、國內第二。羅福莉證明了一件事:性價比不是某個項目的偶然,而是一種可以跨平台複製的方法論。曾妍的平衡點則是前文提到的動態性和穩定性,讓視訊生成模型又能講好故事,又有畫面張力和視覺衝擊力。兩人不同的是職業規劃。羅福莉從阿里跳到幻方,再到DeepSeek,這條路徑是“從大廠到創業公司,從工程應用到模型研究”。曾妍則是在字節內部一路深耕,5年時間完成了從校招畢業生,坐到了4-2的位置。兩條路徑沒有高下之分。在AI大模型這個燒錢、拼資源、看長期積累的領域,年輕的技術人才依然可以通過對問題的深刻理解,在短時間內做出關鍵貢獻。有可能他們研究的方向,你聽都沒聽過,但就是有效。她們的故事才剛剛開始。 (字母AI)
科技
#字節
#Seedance
#PixelDance
262人
讚
留言
分享