大模型重回參數競賽:2兆成標配,3兆是下一站?

AI速讀
中國大模型廠商重啟參數競賽,月之暗面發布 2.78 萬億參數的 Kimi K3,推動公司估值飆升至 500 億美元。行業分析指出,在後訓練優化達到瓶頸後,擴大預訓練基座規模成為突破智能上限的關鍵。Kimi K3 透過 MoE 架構與 KDA 技術,在提升能力的同時有效控制推理成本。此趨勢正傳導至上游晶片設計,推動雲端大模型與端側輕量化模型的協同發展。未來競爭核心將從底層能力轉向 AgentOS 的編排能力,並逐步滲透至程式設計、白領辦公及專業服務等萬億級市場。

中國頭部大模型廠商開始集體衝擊2兆以上參數,但參數競賽重啟的影響不會僅停留在模型層面,它正在沿著產業鏈上游的晶片設計和算力基礎設施傳導。


7月29日,一則關於大模型公司北京月之暗面科技有限公司(下稱“月之暗面”)的融資消息在業內迅速傳開——月之暗面已完成新一輪超35億美元融資,投後估值升至350億美元,Pre-IPO輪也已啟動,投前估值達到500億美元。

這意味著,相較2025年底C輪融資時的估值43億美元,月之暗面在半年多的時間裡估值增長超過10倍,這一速度在全球AI創業公司中也不多見。記者就上述融資資訊向月之暗面方面傳送了求證郵件,截至發稿未獲回覆。

推動這輪估值躍升的核心催化劑是月之暗面7月16日發佈的旗艦模型Kimi K3,該模型的參數規模達到約2.8兆(精確值為2.78兆),是目前全球參數量最大的開源模型。

7月19日,月之暗面發佈公告,宣佈暫停C端(個人使用者)新使用者訂閱,將全部算力投入保障已有使用者的服務。7月27日晚間,月之暗面進一步公開了Kimi K3的模型權重和一份47頁的技術報告,對模型架構和訓練方法做了全面披露。

Kimi K3的發佈只是“中國大模型集體轉向大參數”的一個切面:阿里7月19日發佈的旗艦模型Qwen3.8 Max,參數量約2.4兆;百度1月上線的文心5.0,參數量同樣達到2.4兆;DeepSeek 4月發佈的V4-Pro,參數量為1.6兆。另據記者瞭解,MiniMax(00100.HK)下一代模型的參數量也將超過2兆。

2025年,DeepSeek R1的發佈曾讓行業一度轉向更小參數、更低成本的路線,“Scaling Law(規模法則,即模型性能隨參數規模和算力增加而可預測地提升的經驗規律)是否已經失效”成為貫穿全年的熱議話題。

但僅一年之後,“參數競賽”再次啟動,中國頭部大模型廠商開始集體衝擊2兆以上參數。


參數躍升

Kimi K3的參數躍升幅度在行業內並不常見。

和上一代相比,Kim K3的總參數從1.04兆增至2.78兆,增長了167%;啟動參數從326億增至1042億,增長220%;上下文窗口從128K(K代表千)擴展至100萬詞元(Token,AI模型處理文字的基本計量單位),擴大了近8倍。

月之暗麵糰隊在7月27日發佈的Kimi K3技術報告中指出,過去一年,開源模型在推理階段的強化學習上進展很快,但預訓練基座的參數規模停滯在1兆左右。

大模型的訓練分為兩個階段——預訓練階段,模型在海量資料上學習語言、知識和推理模式,形成底層能力,參數規模和資料質量決定了這層能力的上限;後訓練階段,研發團隊通過強化學習(用獎勵訊號引導模型改進推理策略)、思維鏈(讓模型把推理過程拆解成多個步驟逐步推導)等方法,在底層能力之上做精細打磨。

過去一年,行業把主要精力放在了後訓練上——DeepSeek R1證明了強化學習可以在較小參數的模型上取得很好的效果,國內外廠商紛紛跟進。但Kimi K3技術報告提出的問題是,後訓練的最佳化空間受制於預訓練基座的容量,基座的能力邊界決定了後訓練的上限。

早在今年3月的中關村論壇上,月之暗面創始人楊植麟就公開闡述過類似的判斷。他認為,做大模型本質上是把更多的能源轉化成智能,規模化絕非暴力增加算力投入,而是關於轉化效率的競賽。他在演講中拆解了三個提升效率的維度:提升詞元效率,從有限的存量資料中挖掘更多智能;最佳化長上下文架構,以低損耗完成長時間複雜任務;引入Agent叢集(多個AI智能體平行協作)模式,通過協作擴展模型執行複雜任務的邊界。

華南一家大型券商的半導體分析師告訴經濟觀察報,參數競賽重啟還有外部推力——2026年6月下旬起,以Claude為代表的海外頭部模型開始限制國內模型對其API(應用程式程式設計介面)的訪問,這意味著蒸餾(用大模型的輸出來訓練小模型)作為過去兩年國內模型縮短差距的重要路徑,正在變得越來越窄。

在他看來,大模型的發展可以劃分為三個階段:第一階段從2023年初到2024年第三季度,以預訓練參數競賽為主;第二階段從2024年下半年開始,行業轉向後訓練的強化學習和推理最佳化;2026年正在進入第三階段,模型能力從單體智能升級為系統編排,AI開始向智能體(Agent)的形態演進。

他認為,第三階段並沒有取代前兩個階段,參數量的持續增長仍然是關鍵變數。中國大模型的追趕將主要依賴三條路徑:訓練範式與海外對齊,建構自有的資料反哺循環,持續擴大預訓練基座的參數規模。

深圳一家網際網路遊戲企業的產品經理告訴記者,對使用者來說,參數規模的直接體感是模型“能處理複雜的任務”。

據其介紹,他所在的團隊從今年年初開始把AI程式設計工具接入日常開發流程。在一個完整的程式設計任務中,模型需要讀取整個項目的上下文,連續呼叫編譯、測試、偵錯等工具,執行多輪自我修正,單次會話消耗的詞元量是傳統對話場景的很多倍。這類長程任務對模型底層能力的要求,和簡單的一問一答完全不在一個量級上。

由此,“模型能連續工作多久”正在成為衡量模型能力的新指標。


規模法則

2.8兆參數規模巨大,但Kimi K3的每次推理並不需要動用全部參數。

根據技術報告,Kimi K3採用了MoE架構(Mixture of Experts,混合專家系統)。這種架構的核心思路是把模型參數分成多個功能模組,稱為“專家”。在處理每一個輸入時,路由系統只啟動與當前任務最相關的一小部分專家,其餘專家不參與計算。

Kimi K3擁有896個專家模組,每次推理只啟動其中16個,稀疏度達到56倍,實際參與計算的啟動參數約1040億。換言之,一個2.8兆參數的模型,單次推理的算力消耗大致相當於一個千億參數等級的稠密模型(即每次運算都呼叫全部參數的傳統模型)。

MoE架構解決的是“參數量大但推理成本可控”的問題。在此基礎上,月之暗面還需要解決兩個難題:長上下文場景下的計算開銷,以及資訊在深層網路中的逐層衰減。

根據Kimi K3技術報告,月之暗面分別為此開發了兩項底層架構。

第一項是KDA(Kimi Delta Attention,混合線性注意力機制)。傳統Transformer架構(當前主流大模型普遍採用的底層技術框架)在處理長上下文時,需要維護一個快取,這個快取的體積隨輸入長度線性增長。100萬詞元的上下文意味著龐大的視訊記憶體佔用和計算開銷,KDA的做法是,把這個不斷膨脹的快取壓縮成固定大小的矩陣狀態,使百萬級上下文的計算開銷大幅下降。

第二項是注意力殘差(Attention Residuals)。在傳統的深層網路中,資訊從底層逐層向上傳遞,每經過一層都會有部分資訊衰減或丟失。注意力殘差的做法是,讓每一層都能選擇性地回看前序所有層的輸出,跳過逐層傳遞的限制。根據KimiK3技術報告,這項改進的額外成本約為2%,但顯著緩解了資訊在深層網路中的衰減問題。

MoE、KDA和注意力殘差三項技術疊加上後,KimiK3相比K2的整體擴展效率提升了約2.5倍,即同樣的算力投入下Kimi K3能達到更好的模型表現。

效率的提升也直接反映在了使用成本上。

根據公開的API定價,KimiK3的輸入價格為每百萬詞元人民幣20元,輸出價格為100元。折合美元計算,Kimi K3的輸出單價約為14美元/百萬詞元,低於GPT-5.6 Sol的30美元和Claude Fable 5的50美元。Kimi K3在第三方評測中的單任務平均成本約0.94美元,與GPT-5.6 Sol基本相當,約為Claude Opus 4.8的一半。

在“用更少的算力產出更多的智能”這個方向上,端側模型廠商走得似乎更快一些。

面壁智能CEO李大海在接受經濟觀察報採訪時提到了一組對照資料:面壁的端側模型用10億到20億的參數量,已經達到了兩年前GPT-4o(OpenAI於2024年發佈的旗艦多模態模型,參數量在數百B等級)的水平,相當於實現了近百倍的壓縮。面壁聯合創始人、總裁雷升濤將這個方向稱為“知識密度定律”,即大約每3.5個月端側模型的能力密度翻一倍。

雲端模型在擴大參數規模,端側模型在壓縮參數規模,底層邏輯一致,都在提升每單位算力的智能產出。

在李大海看來,雲端程式設計、長程Agent等場景的爆發已經開始,端側雖然還沒有迎來類似的商業爆發,但模型能力的提升一直在發生。兩年前,達到GPT-4o水平需要數百億參數量級的模型,如今面壁用10億到20億參數量級的端側模型就能做到。雲端在做大,端側在做小,但驅動兩者進步的底層規律是同一個——投入更多的算力和更好的架構,就能換來更強的模型能力。“沒有爆發不代表沒有Scaling Law”,他說。

野村證券7月27日發佈的研報指出,3兆參數被行業視為中國大模型的下一個里程碑,但模型競爭力將越來越依賴架構效率、後訓練最佳化和長程任務表現。


產業鏈傳導

參數競賽重啟的同時,頭部模型廠商的商業化也在加速。

公開資訊顯示,月之暗面的ARR(年度經常性收入)在6月中旬突破3億美元,API收入佔比超過七成。

月之暗面企業業務負責人黃震昕在6月的一次公開活動中提到,自今年1月Kimi K2.5發佈以來,Kimi海外付費使用者數增長了4倍,產品進入200多個國家和地區。網際網路、金融、製造、教育、醫療等行業已成為Kimi重要的企業客戶來源。

Kimi K3發佈帶來的需求激增也讓算力緊缺浮出水面。公開資訊顯示,Kimi K3的部署需要一台8卡B300伺服器,訓練需要萬卡級叢集。多位接受採訪的業內人士提到,智算中心的大部分算力已被頭部大廠鎖定,獨立模型公司獲取算力的能力相對滯後,即便遇到Kimi K3這樣的需求爆發也難以及時補充。

李大海從端側的角度提供了觀察。他用八個字概括端側和雲端的分工關係——端側主內,雲端主外。端側掌握使用者的私有資料和即時需求,資料不出裝置,負責隱私敏感的本地推理;雲端接入外部世界的資訊和服務,處理對模型能力要求更高的開放性任務。他認為,隨著雲端模型參數規模持續做大,端側和雲端協同的格局會長期共存。

上述券商半導體分析師告訴記者,國內大模型競爭已經形成兩個梯隊:阿里和DeepSeek在模型能力和業務覆蓋上位居前列,騰訊、字節、智譜、月之暗面緊隨其後。競爭焦點也正在從底層模型能力轉向AgentOS(智能體作業系統,即模型之上負責任務編排、工具呼叫和長程執行的系統層)的綜合能力。

在國內競爭格局高速變動的同時,海外市場正在成為中國頭部大模型廠商爭奪的另一個增量來源。

野村在前述研報中提到,DeepSeek截至6月的ARR約為5.2億美元,其中海外市場貢獻了約47%到48%。不過,採用者以個人開發者和中小團隊為主,大型企業的滲透率仍然有限。而且,在實際的開發流程中,不少海外開發者已經形成了分層呼叫的習慣,使用Claude Code、Codex等海外模型做架構設計和複雜推理,再切換到DeepSeek等國產模型做持續的程式碼生成和執行。也就是說,國產模型率先拿下的,是詞元消耗最密集的執行環節。

華東一家大型公募機構的研究員告訴記者,詞元的整體成本在持續下降,預計年降幅在三成到五成。值得注意的是,Agent鏈路中等複雜度的任務,單次呼叫消耗的詞元量是傳統對話場景的二十多倍,超複雜任務的單次消耗達到百萬詞元等級。成本下降正在激發更多複雜任務的需求,整體利潤由增量市場驅動。“做大參數”對算力產業鏈的影響也已經開始傳導到晶片層面。

聆思科技是一家由科大訊飛體系孵化的端側AI推理晶片公司,已累計出貨超過1.5億顆晶片,7月剛完成近5億元B輪融資,首顆端側大模型推理晶片Nebula系列計畫於年底流片。

聆思科技市場副總裁韓超陽告訴經濟觀察報,端側推理市場的規模未來將比雲端大出不止一個數量級。他同時強調,算力利用率比絕對算力峰值更關鍵,一顆標稱200T(每秒200兆次運算)算力但利用率只有百分之十幾的晶片,和一顆100T算力利用率達到七成的晶片,實際產出完全不同。

但當前端側晶片在推理性能和功耗上仍無法滿足需求,在他看來整個市場仍處於萌芽階段。

聆思科技副總裁徐燕松提到,晶片公司和演算法公司未來可能不再獨立存在,晶片設計必須比演算法迭代更前置地投入研發,“晶片的研發周期通常在兩到三年,必須提前判斷兩三年後模型架構的走向,否則晶片推出時就已經落伍了”。

這也意味著,參數競賽重啟的影響不會停留在模型層面,它正在沿著產業鏈上游的晶片設計和算力基礎設施傳導。

在上述公募機構研究員看來,大模型向行業場景的滲透可以分為三個階段:第一階段是AI程式設計代理,對應全球約3000萬軟體開發者和部分外包採購市場,核心規模約7000億美元;第二階段是流程性AI代理,面向客服、財務、行政等約3.7億白領辦公人群,薪酬池規模超過1兆美元;第三階段及之後將延伸至金融、醫療、法律等專業領域,市場體量達到3兆至4兆美元以上。

他認為,目前僅處於第一個階段的初期。按照上述框架來看,當前圍繞AI程式設計場景的詞元消耗量爆發,距離真正的規模化滲透還很遠。(經濟觀察報)