把思考折疊進序列:WeLM 617B MoE的隱式Scaling路徑

大模型變強,過去靠兩條路。

做大——Scaling Law出現後,參數從百億推向千億,算力支出一路飆升。

想久——o1帶火思考模型,用更長的思維鏈、更多推理時間換結果。

問題是,除了Scaling參數和思維鏈之外,到底有沒有第三條路?

微信WeLM團隊給了一個全新的答案——

把額外算力折疊進序列內部,讓模型在token之間完成隱式思考。輸出不變長,每個token想得更深。

這套方法叫Hidden Decoding,隱式序列縮放。

而WeLM做到的關鍵一步,是把它推到了前沿規模。

從3月的80B參數,到現在的617B MoE,不僅增量續訓只用了完整訓練量的5.3%,而且9個評測全部超越自回歸基線。

01. 把思考折疊進序列WeLM 617B MoE的隱式Scaling路徑

7月14日,微信WeLM團隊放出了Hidden Decoding系列的第二篇部落格,並首次展示了一個新模型的進展:一個總參數617B、評估表現達到開源頭部水平的模型。

部落格地址:https://welm.weixin.qq.com/posts/hidden_decoding_at_scale/

這並非該系列的首度發聲。

今年3月2日,WeLM 團隊就發表了系列的第一篇部落格,彼時Hidden Decoding還是一套相對樸素的早期實現,只在80B規模上跑通了初步驗證。

四個月過去,新部落格不僅把方法做紮實,更第一次展示了將該方案上推到600B+模型的效果。

這篇部落格的核心,是介紹Hidden Decoding如何被推進到100B+ MoE的前沿規模——

把每個token在序列維度上展開成多條平行的「流」,讓同一套Transformer權重在一次前向傳播裡完成多步隱式推理,而只在最後一條流上計算損失。

換句話說,模型在落筆寫下下一個token之前,先在自己的序列內部折疊進了一段不為人見的思考。

如果說過去一年大模型的兩條主線是「把參數做大」和「把思維鏈做長」,Hidden Decoding展示的是第三條路:在不動參數的前提下,把額外算力藏進序列本身,讓推理在模型內部多走幾步。

02. 參數與思維鏈之後,第三條路指向隱式序列

過去一年,大模型社區的努力可以粗略分成兩條線。

一條是把模型本身做大,總參數沖到兆、啟動參數沖到30B以上;另一條是在後訓練階段堆算力,靠強化學習和更長的思維鏈把推理能力「逼」出來。

隨著o1、DeepSeek-R1以及一眾「思考模型」的走紅,這後一條路線幾乎成了默認敘事。

但兩條線共享同一個隱含前提,都需要「更多」。更多參數、更多高品質推理資料。

Hidden Decoding的提出,恰好繞開了這個前提。它不在資料側做文章,而是回到預訓練與繼續預訓練階段,問了一個更樸素的問題——

同一套權重、同一批資料,能不能通過更聰明的算力組織方式,逼出更多能力?

這條路並非沒人走過。

循環模型、各類「在序列維度做擴展」的嘗試,都屬於同一種思路。讓同一套權重在一次前向裡多走幾步。

卡點也很清楚。循環模型序列不可平行,序列擴展又容易讓注意力按序列長度的平方膨脹,在大模型上訓不動、也用不起。

因此相關討論雖多,真正在前沿規模跑通的卻很少。WeLM這篇部落格文章,正是要把這條被繞開的路,在100B+ MoE的體量上重新打通。

03. 先認識一下WeLM:微信大模型的四代演進

WeLM是微信AI團隊持續研發的通用大語言模型系列,承載著微信在大模型時代的核心技術戰略,也是微信參與前沿人工智慧競爭最為關鍵的技術底座。

從2022年首次公開亮相至今,WeLM已連續迭代四代。

雖然團隊過往對外發聲始終秉持審慎的態度,但從近期集中發佈的技術博客來看,其已清晰勾勒出一條技術演進路線——

從V3時代的訓練體系搭建,到V4時代的效率與質量創新,再到600B級模型的Scaling突破與Hidden Decoding的推理範式創新。

這標誌著WeLM已形成覆蓋預訓練、後訓練和推理最佳化的完整技術版圖。

更重要的是,WeLM絕非止步於論文指標與實驗室評測的試驗性模型。

當前已進入灰度測試階段的微信AI助手「小微」,其核心模型能力由WeLM提供。依託微信這一擁有超大規模使用者基數的國民級產品生態,WeLM已成功進入由真實使用者、真實流量與真實複雜任務所構成的終極試煉場。

從這次Hidden Decoding系列技術部落格的發佈中,我們可以窺見WeLM團隊將前沿模型技術和規模化應用實踐相結合的思考。

04. Hidden Decoding:把思考折疊進序列

Hidden Decoding的做法,可以概括為三步:

  1. 給定輸入序列和n份詞表嵌入,把第i個token的第k條「流」表徵放在物理位置(i−1)n+k上,構成長度為nL的擴展序列;
  2. 擴展序列在標準因果注意力和連續的位置編碼下,送進同一個Transformer,不新增任何主幹參數;
  3. 訓練時只在每個token的最後一條流上計算下一個token的預測損失,前n−1條流不接收任何直接監督。

換句話說,前面的流像是給最後一流「打草稿」——逐步精煉表徵、保留更寬的候選集合,等最後一流再收斂到最終預測。

Hidden Decoding vs Loop Latent Computation

此前,團隊已經在6B、8B、80B上驗證了這套方法的損失下降與評測提升。這次的目標,是把它推進到真正的前沿規模。

05. 關鍵工程:讓擴展在100B+體量上可訓

把序列從L拉到nL,非注意力計算大致線性增長,但稠密注意力會按序列長度的平方膨脹。

以n=4為例就是16倍,對長序列的大模型,這直接不可訓。

團隊的解法叫Stream-Factorized Attention:讓大多數層只在同一條流內部做注意力,只讓少數層做跨流混合。

  • 流內注意力層:只關注同一條流中更早的位置;
  • 跨流注意力層:額外跨流關注,沿用基座原本的注意力形態,滑動窗口或全注意力。

關鍵在於,團隊不新增注意力層,而是對基座裡已有的局部注意力層和一小部分全注意力層啟用跨流功能。

這樣就把新增的注意力成本從n的平方量級壓到了接近線性的n倍。而這也是Hidden Decoding能在100B+稀疏模型上落地的核心。

此外,團隊還利用了WeLM主幹的一項既有設計KV-mirror來進一步加速。也就是,後段三分之一的層復用前段三分之一層的隱狀態來構造鍵值快取。

由於鏡像層的鍵值只依賴早期層的隱狀態,而只有最後一條流被監督、中間流只通過它們貢獻的鍵值起作用,團隊只讓最後一條流通過鏡像層,前段仍處理全部n條流。

在80B、32k訓練設定下,這把單步時間從15秒降到12秒,約兩成的提升,疊加在流因子化注意力已提供的近線性成本之上。

06. 結果:全面超越基線

團隊對每個基座比較兩種形態,除Hidden Decoding外一切相同。隨後用同一套短指令微調配方適配,不涉及強化學習。

結果顯示,Hidden Decoding在兩個規模上都實現了全面的提升

其中,80B平均提升約0.99個百分點、在617B上提升約1.03個百分點,較大的提升出現在SuperGPQA、MMLU-Pro等更難的推理與知識任務上。

07. 成本:近線性的訓練開銷,且無需重跑完整預訓練

這樣一套方法,訓練成本到底如何?實測資料給出了明確答案。

n=4時,有效序列在80B上花費5.1×單batch時間、在617B上花費4.4×,接近n=4的線性參考,遠低於稠密注意力的16×膨脹。

更關鍵的是,Hidden Decoding並非從零訓練,而是在已有自回歸基座checkpoint上做增量續訓(CPT)。

08. 推理吞吐:平行計算,小batch下反而有優勢

相比循環模型,Hidden Decoding的額外計算是平行的。

循環模型逐步重複主幹,每步都要等上一步,額外成本無法隱藏;Hidden Decoding把計算攤到n條stream上,一次前向平行處理。

實測吞吐矩陣顯示:

  • 大batch下,解碼受計算限制,額外計算會降低吞吐(所有增加計算的方法都如此);
  • 小batch下,解碼受視訊記憶體頻寬限制,計算大量閒置,平行stream恰好利用這些空閒算力,相對基線損失更小。

這意味著在實際線上服務場景中,Hidden Decoding的推理成本並非簡單的線性增長,而是與batch size和序列長度分佈強相關。

09. 探針:折疊進去的思考,究竟在算什麼

Hidden Decoding依賴一個反直覺的選擇:只訓練最後一條流,前面的流零監督。

主結果說明這能提升精準率,但收益到底來自「更長的序列」「更多的預測目標」,還是「中間流真的在做某種精煉」?

注意力組合消融中,團隊比較了三種配置:27層全跨流、4層、1層。

所有變體都大幅超過自回歸基線,全跨流最好,但只用1層或4層全注意力的變體恢復了大部分收益。少數幾層跨流就足夠了,這讓流因子化注意力能在保住精準率的同時保持廉價。

鍵值快取保留的消融則表明,為不同流保留獨立狀態優於共享狀態,兩種佈局下平均分都小幅下降,說明獨立的中間狀態確有幫助。

最有趣的是流與語言模型頭的探針實驗。在8B基座加Hidden Decoding(n=8)上,團隊觀察到兩點:

其一,同一token的各流在Transformer中間層顯著分化、臨近輸出層又部分靠攏,且最終流對其他流分配了可觀的注意力,構成從中間流到預測流的讀取通路;

其二,把共享的輸出頭施加到各流時,中間流的最優預測常與最終流不同,最大差異率約63%,且其不確定性普遍高於最終流——說明在最終預測收斂前,中間流保留了更寬的候選分佈。

綜合起來,消融與探針指向同一解釋:中間流在最終流收斂到預測之前,保留並精煉著一個更寬的候選集合。

研究團隊認為,這正是「把前面的流用作潛空間計算狀態」的含義,也是Hidden Decoding區別於簡單「加長序列」或「多目標預測」的關鍵。

10. 展望:更強的基座,以及與強化學習的結合

部落格最後透露了一點後續進展。

在採用更高品質、更大規模的資料做後訓練後,80B與617B的自回歸基座已經展現出顯著更高的基準成績與更穩定的使用體驗。

這組資料說明,WeLM的自回歸基座本身就已經很有競爭力,而Hidden Decoding是在這個紮實基座之上的進一步增益。

研究團隊表示,接下來他們會在這套更強的基線上繼續驗證Hidden Decoding的增益,並將其與強化學習充分結合。

11. 寫在最後

回顧WeLM團隊近期公開的技術部落格,可以看到一條逐漸清晰、前後呼應的技術路線。

  • 《以適度資源建構高效稀疏MoE模型》探索了如何以更稀疏、更高效的模型獲得有競爭力的能力,在同等智能下壓低資源消耗。
  • Hidden Decoding 系列則從創新的推理範式入手,在同等模型參數下繼續上推智能上限。

前者讓智能服務得起更多使用者,後者讓有限資源解決更難的問題。

沿著兩個方向回看,這系列部落格並非彼此孤立的技術嘗試,而是一套圍繞資源效率展開的系統性探索,也呼應了團隊部落格首頁「極致的資源效率」的命題。 (新智元)