小米羅福莉直播燒雷軍的錢!RL訓練全程,每小時燒20萬元,75%的嘗試失敗,全部不打碼

北風窗
•
AI速讀
小米 MiMo 團隊突破業界慣例,將 MiMo-V2.6 的強化學習訓練過程公開直播,實時展示每小時燒錢約 3 萬美元的算力開銷與 75% 的任務失敗率。此次行動揭露了非同步訓練、動態採樣等核心技術細節,將原本隱藏在財報中的研發成本轉化為品牌內容。在由前 DeepSeek 成員羅福莉領導下,小米試圖透過極高的透明度,在與 OpenAI 等巨頭的 AI 競爭中,證明其技術實力與對大模型研發的決心。

OpenAI 不敢公開的,小米公開了:大模型 RL 訓練全程直播!

今天凌晨,小米羅福莉,把 MiMo-V2.6 的強化學習訓練過程搬上了直播!上午 8 點 13 分,帳單停在 1,113,375 美元。還在跳。

當 Anthropic 和 OpenAI 還在跟你玩捉迷藏時,小米向我們展示了訓練 AI 可以更透明。

01. 羅福莉 線上直播燒錢

羅福莉表示,小米MiMo近半年沉默。我們用這段時間研究一個問題:強化學習(RL)能擴展到多遠。

這次MiMo-V2.6 目前正處於其 RL 運行的中途。他們擴展了三件事:計算資源(每步約 20 億 token,1568 個提示 × 16 次 rollout,完全非同步)、環境和測試框架(多工代理式 RL,在一次運行中混合多個測試框架),以及評估計算(代理式組內信用分配,帶有測試用例和基於量規的獎勵)。

他們將在未來幾周逐步開源細節。

然後後訓練過程的儀表盤直接公開了!基哥是第一次見!

大家都說,小米太瘋狂了!

02. 燒多快?

有開發者盯著儀表板掐表:總費用半分鐘漲了 287 美元。

折算下來每秒約 8.5 美元,每小時 3 萬美元。

儀表盤自己把單價都報了:Pro 檔每步成本除以 token 總量,約 34 美元/百萬 token;Flash 檔約 9 美元/百萬 token。

每分鐘 511 美元的帳。

這次直播的不是發佈會 PPT,是一線大廠的 RL 訓練 telemetry,這種東西,OpenAI、Anthropic 的內部同款,普通人從來只能在論文裡看靜態截圖。

兩個任務在同時跑。

Pro:第 11 步,已訓 1 天 13 小時,燒掉 77.4 萬美元,吃掉 228 億 token。

Flash:第 17 步,已訓 1 天 8 小時,燒掉 33.9 萬美元,吃掉 378 億 token。

每步訓練批是 1568 條 prompt,每條 16 個採樣序列。

03. 透明的公開細節

真正值錢的是細節。

每條樣本平均要跑 47 到 53 輪智能體循環,平均上下文長度 8.7 萬到 10.4 萬 token。這不是讓模型做選擇題,是把它扔進程式碼、終端、網頁任務裡跑長鏈操作,跑完再打分。

passrate:零嘗試通過率只有 14.6% 到 14.9%,一次重試後也不過 21.8% 到 25.2%。這些頂級模型面對真實長鏈任務,四分之三的嘗試是失敗的。

另一欄是 notices:四個小時前,團隊主動公告"Pro 因單節點 VRAM 問題正在重啟";評測結果隨出隨發。

叢集同時掛著 2.2 萬到 3.8 萬個平行環境,基礎設施錯誤率壓在 0.5% 左右。每步耗時兩個半小時,其中生成佔一個半小時、訓練佔一個小時,兩條流水線重疊著跑。

核心機密其實藏在 "dynamic sampler" 裡。

feed 區暴露了他們的採樣機制:step 12 的 pro 實際 accepted 2,200/1,568。超采了 1.4 倍,judge 了 2,110 條,從 6,217 個候選裡篩。

12 個資料來源(code×9、cyber、general×2,名字全是雜湊過的)各有 accepted/target 配額,比如 yfch 目標 54 實際收了 56-364 條。

這就是 MiMo 技術報告裡 RL 範式的線上版:動態配比 + 超額採樣 + 按源配額重組訓練批。

儀表盤自己的 benchmark 曲線顯示,DeepSWE v1.1 上 Pro 是 62.24 分,Flash 是 60.77 分。什麼水平?同一個 benchmark,昨天那個匿名模型 Union Alpha 實測 73 分,GPT-6 Astra 74 分。

差距明晃晃擺在那。

曲線在後段還在爬,Flash 的斜率尤其陡。

04. 小結

小米這波操作,開發者都在鼓掌。這就是最好的入門教材,做 RL 的人能即時看到非同步訓練的 KL/staleness 控制資料,想自建訓練 infra 的團隊第一次有了公開成本基準。

別人把燒錢藏進財報,小米把燒錢做成內容。

領舞的是去年 11 月入職的 MiMo 大模型負責人羅福莉。95 後,北大碩士,達摩院做過 VECO,在 DeepSeek 參與過 V2。她今年給的關鍵詞是"自進化”。

小米要讓大家相信:這家公司在大模型上是認真的,錢管夠,過程敢亮。

1.6 兆美元的全球 AI 軍備賽裡,111 萬美元的訓練直播算不上大手筆。但它把"透明度"捲到了新高度。 (奇偶工作室)