剛剛!3萬億Kimi K3開源,華為昇騰Day0適配、撼動矽谷

AI速讀
月之暗面正式開源全球首個 2.8 萬億參數的 MoE 多模態大模型 Kimi K3。該模型透過 KDA 與 AttnRes 等原創技術,實現了低成本、高效率的百萬 token 上下文處理,並在程式碼能力上比肩頂尖閉源模型。K3 迅速完成華為昇騰與阿里平頭哥的硬體適配,展現強大的國產化部署能力。此次發佈引發強烈反響,不僅導致輝達股價下跌,更以詳盡的技術報告反駁了美國白宮關於其「蒸餾」海外模型的指控,顯著縮小了中美開源 AI 的技術差距。


就在剛剛,Kimi K3如約開源。

7月27日晚23點,月之暗面正式開源Kimi K3模型權重。

這次,Kimi K3採用自訂的License 協議,允許研究、部署、微調和二次開發。

這個 License 設計挺聰明的。小開發者和研究者零門檻,大玩家該付錢付錢,跟 Meta 的 Llama License 思路類似但細節不同。

Kimi K3是一款開放權重、原生多模態智能體模型,也是月之暗面迄今為止功能最強大的模型,還是全球首個完全開源2.8萬億參數MoE多模態大模型,更是一款基於 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 建構的2.8T參數模型。

Kimi K3啟動有效參數為104.2B,上代 K2 總參 1.04T、啟動 32.6B,有效算力提升 220%

同時,Kimi K3具備原生視覺功能和 100 萬個 token 的上下文窗口,是 K2(128K)的 8 倍,無需 RoPE/YaRN 等位置編碼插值調整,內建 27 層 MoonViT-V2 視覺編碼器(401M 參數)。

因此,其突破開源模型規模天花板,憑藉 KDA、AttnRes、Stable LatentMoE 三大原創架構實現了2.5倍每單位計算的智能水平/效率提升,百萬原生上下文和強大智能體、程式碼和多模態能力,同時具備極低推理成本。

根據Kimi K3資料,該模型的硬體部署成本只需 2000 萬元即可,4000 萬元可以流暢使用。

此次發佈的不僅是模型權重,還包括相關技術細節和報告,共計47頁。


根據論文資料,在程式碼層面,Kimi K3基本上比肩GPT-5.6 Sol和Fable 5模型,部分資料甚至超過這兩個海外模型。

與 Kimi K3 一起,月之暗面還將開放其背後的更多技術堆疊——高性能注意力核心、MoE 通訊庫,以及大規模運行代理環境的基礎設施。而對於年收入超過2000萬美元的模型 API 服務商,商用需與月之暗面另行簽署商業協議。

值得一提的是,在技術報告中,月之暗面透露,Kimi K2 及 K3 完整預訓練、百萬 token RL 強化學習主叢集均使用H800 GPU,配套輔助訓練 / 微調叢集使用L20(文件提及 MiniTriton、核心最佳化實驗基於 NVIDIA L20 完成)。

開源消息公佈後,華為昇騰CANN報導稱,趨境科技基於開源推理引擎SGLang 完成了Kimi K3在昇騰 Atlas A3 上的Day0推理適配。項目實現 KDA 的昇騰CANN適配,並針對 MoE、混合注意力機制、多卡通訊等關鍵模組進行了最佳化,實現模型在昇騰平台上的高效、穩定運行。


“Kimi K3 896 專家的大 EP 部署場景,能夠充分發揮昇騰超節點架構優勢。”這意味著,K3 已完成華為昇騰 950 SuperPod全鏈路適配,64卡/千卡國產超節點可跑訓練和推理。昇騰CANN稱,相關適配成果即將開源,為開源大模型在昇騰平台上的快速部署和Agent應用落地提供有力支撐。此外,阿里平頭哥M890 也宣佈了適配

月之暗面創始人、CEO楊植麟此前表示,“我們模型的迭代週期已經從過去的半年提升到現在的兩三個月,新一代模型也在加速研發中。”

“祝賀月之暗面創始人兼CEO楊植麟在最新Kimi發佈上的成就,這對開源社區來說是巨大的勝利!”7月17日,卡內基梅隆大學教授拉蘇·薩拉胡特季諾夫(Russ Salakhutdinov)發佈了這樣一條帖子,在卡內基梅隆大學,楊植麟曾是拉蘇的學生。

有趣的是,在技術報告第33頁,Kimi K3部署案例當中,秘密提到了“可替代的GPGPU(通用GPU)”——換句話說,K3模型其實可以在國產通用GPU當中進行部署。

受到Kimi K3發佈影響,輝達股價跌幅擴大至5%。

先回顧一下過去10天發生了什麼。

7月16日,月之暗面Kimi K3,全球最大開源權重大模型,程式設計榜單 Frontend Code Arena 登頂;官宣 7 月 27 日開放完整權重。

消息擴散後,美股 AI、半導體板塊出現大幅波動,媒體稱為新一輪DeepSeek時刻。

7月17-18日,矽谷開發者實測、初步輿論發酵。海外開發者大規模測試,認可推理、程式碼能力,馬斯克評論 “Impressive(令人印象深刻)”,普遍刊文,中國前沿開源模型縮小中美 AI 差距,衝擊美國頭部閉源廠商估值邏輯。

7月19日,Kimi官方公告,訪問量遠超預估,暫停 C 端新使用者訂閱,算力優先保障存量付費使用者,啟動擴容。

7月22日,白宮指控、多方立場集中爆發,白宮聲稱月之暗面使用工業級隱蔽蒸餾復刻 Anthropic Claude Fable 訓練 K3。而近 200 家矽谷初創企業聯合致信白宮,強烈反對限制中國開源模型。而輝達CEO黃仁勳力挺Kimi K3.

10天後的今天,Kimi K3全面開源,而且已經用技術解釋:我們沒蒸餾。

具體來說,根據Kimi K3技術報告中提到了很多細節。

從K3核心貢獻層面,首先要說五個領域的核心架構創新。

第一個是KDA混合注意力。

Kimi K3採用3層Kimi Delta Attention(KDA)線性循環注意力+ 1 層 Gated MLA 塊循環(解決百萬長序列開銷),基於Delta規則引入通道遺忘門,固定尺寸循環狀態替代傳統膨脹 KV 快取,長序列算力線性而非平方增長,百萬 token 解碼速度最高提升 6.3 倍。

而關鍵最佳化層面,全部分塊可用 Tensor Core 密集計算;輸出採用全秩門控替代低秩對應;配套工程上,FlashKDA 專用 GPU 核心、KDA 上下文平行(KCP),跨裝置僅同步固定大小狀態,通訊成本恆定不隨文字變長

Gated MLA 全域注意力,並且復用 DeepSeek MLA 低秩 KV 壓縮思路,移除全部顯式位置編碼(NoPE),位置資訊完全由 KDA 承載,以及每層末尾追加獨立 MLA 層保證全域跨 token 關聯,兼顧長序列效率與全域檢索能力。

第二個是Attention Residuals,也就是AttnRes 注意力殘差,解決深層模型資訊丟失。

傳統 Transformer 僅逐層單向累加特徵,深層易丟失淺層關鍵資訊。而AttnRes則讓每一層可選擇性讀取嵌入層、所有前置塊輸出,基礎層面每層獨有可學習偽 Query,對全部歷史層特徵做加權聚合,完整保留全層資訊。

同時,在工程最佳化 Block AttnRes上,將多層合併為塊,僅在塊等級做跨層注意力,記憶體開銷從 O (Ld) 降至 O (Nd),推理速度大幅提升;最終深度資訊流更通暢,訓練效率提升 25%,額外計算開銷不足 2%。

第三個是Stable LatentMoE 穩定稀疏專家架構(支撐 896 超大專家池)。

針對超大專家池訓練爆炸、負載失衡兩大痛點,Kimi團隊做了三層改進:

1、RMSNorm 歸一化latent通路,專家聚合輸出先歸一化再升維,抑制啟動值爆炸;

2、SiTU-GLU 全新啟動函數,改進 SwiGLU 無界問題,上下限軟截斷,保留近線性局部響應,低精度訓練更穩定;

3、Quantile Balancing(QB 分位數負載平衡)層面,無輔助損失路由,通過分位數動態調整專家偏置,批次內每個專家負載嚴格均等,而且跨卡僅少量通訊即可計算全域分位數,完美適配 896 專家超大規模,解決傳統專家冷熱不均、訓練停滯問題,並且大幅降低通訊開銷。

第四個貢獻是原生多模態 MoonViT-V2 視覺通路。

Kimi K3不使用 SigLIP 等預訓練視覺權重,而是從零和文字聯合預訓練,避免多階段梯度尖峰,訓練穩定性顯著提升,27 層無偏置 ViT,2×2 像素洗牌降採樣減少視覺 token,圖像 / 視訊參數完全共享;支援最高 3584×3584 大圖無縫進入百萬上下文,優勢在於,視覺表徵直接適配 LLM 預測目標,在圖表、數學視覺、視訊任務表現優於預訓練初始化方案。

第五個是Per-Head Muon 分層最佳化器。

對於計算成本,Kimi K3繼續採用Muon最佳化器,分注意力頭單獨正交化,避免大梯度頭壓制小頭,訓練動態更均衡,同時降低矩陣正交化計算開銷。

因此,Kimi K3模型成本更低、效率更高,而且能夠成功完整萬億級軟硬體協同基建,形成適配2.8T MoE、百萬 token RL、長上下文推理全套系統方案。

預訓練部分,Kimi K3基於文字四大域——網頁、程式碼、數學、專業知識,全部做去重、分類器質量過濾;知識 / 數學資料通過多樣改寫擴充樣本;多模態資料——圖文、OCR、視訊、程式碼渲染圖(SVG/3D/CAD/ 網頁),配套坐標標註監督,大量合成跨模態長文件資料;以及長文字專項——清洗超長文件,人工合成跨多段落、需百萬上下文才能解決的復合任務,避免模型僅學習局部模式

基於縮放定律驗證,在同等算力(FLOPs)下,Kimi K3 驗證損失遠低於 K2,整體縮放效率提升 2.5 倍。而且,所有架構創新、資料配方協同生效。

後訓練(SFT→多力度 RL→多MOPD蒸餾→感知量化)部分,Kimi K3先統一工具呼叫、思考、回覆多通道序列化格式,全程量化感知訓練(QAT);而在RL部分,進行多維度、多力度強化學習 RL,產出 9 個專用專家模型,Kimi還自研統一白盒智能體沙箱,可模擬 Claude Code、Codex等主流工具框架,基於知識圖譜自動生成海量驗證型任務(科研、金融、法律、GPU 核心、網頁開發、系統復刻)。

最後在多教師線上蒸餾 MOPD上,Kimi將 9 個不同領域、不同力度的專家模型知識融合進單一統一K3 主模型,兼顧所有任務能力,並進行EAGLE-3 草稿模型、量化適配,其餘模組保留高精度,訓練推理精度對齊無落差。

萬億級專用基礎設施上,Kimi K3擁有三大場景配套系統,包括KDA演算法硬體協同(解決百萬上下文平行難題);2.8T MoE 預訓練基建MoonEP,自研專家平行框架,實現完美均衡 token 負載;配套記憶體最佳化,啟動分片解除安裝、Pipeline ZeRO-2 梯度分片、Muon 最佳化器點對點收集參數,支撐 3T 模型穩定訓練;百萬 token 智能體 RL 沙箱AgentENV,大幅緩解 RL 訓練視訊記憶體爭搶,自適應並行節流調度,動態控制長軌跡數量,防止快取打爆。此外,Kimi K3採用專用稀疏MoE、AttnRes、KDA 解碼 GPU 核心,預算感知叢集調度,以及快取親和路由。

最後是Kimi K3的基準評測體系部分,包含公開基準、內部私有、第三方機構三個部分。

橫向對比基線,與閉源頂尖的Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5,以及開源標竿GLM-5.2相比,Kimi K3 綜合能力僅次於 Fable 5、GPT-5.6 Sol,全面超越其餘閉源與全部開源模型;成本效率極具優勢。

其中,程式碼能力(核心優勢賽道),Kimi K3在ProgramBench 開放原始碼基準第一(77.8%);SWE-Marathon GPU 核心專項領先所有閉源模型(42.0),內部 WebDev 基準對比 Opus 4.8,專家偏好淨 + 31%;WebDev Arena 全球排名第一(Elo1678);Terminal-Bench、DeepSWE、FrontierSWE 接近頭部閉源,企業級工程程式碼落地能力突出。

智能體工具使用 SOTA部分,Kimi K3模型在BrowseComp 網頁檢索 91.2%、DeepSearchQA 檢索 F1=95.0、MCPMark 多工具 94.5、自動化 / 銀行 / 法律 / 財務專業任務多數領先競品,尤其在作業系統操作 OSWorld、長週期多子 Agent 協同(Swarm Bench 第一)表現亮眼。

多模態視覺部分,OmniDoc 文件理解全球第一;數學視覺搭配 Python 工具達 97.8;圖表、視訊、工業圖紙推理優勢明顯,可迭代寫程式碼處理圖像、逐幀分析視訊,原生圖文程式碼混合長鏈路閉環。

通用高階推理部分,GPQA 研究生級推理 93.5 與 GPT-5.5 持平;高階科研 HLE、CritPt 略落後兩大頂級閉源,但顯著優於其他模型。

同時,專項安全攻防評測部分,漏洞挖掘(Tier1)上,Kimi K3自主發現上百軟體漏洞,含 16 個 Linux 核心未知 0day;漏洞利用(Tier2):36 道攻防題完成 14 道(38.9%),遠超 GLM-5.2(22.2%);核心深度利用仍存在明顯人類專家差距。

此外,第三方權威評測方向:

1、Artificial Analysis Intelligence Index v4.1上,Kimi K3達57.1,全 580款模型中,排名第4;

2、Vals 行業基準指數上,達74.7,全 39款模型中,排名第 2;

3、Arena Human偏好部分,Web 開發第 1、通用文字第 8、智能體第4。

總結來說,同等任務得分下,Kimi K3 推理成本僅為 Claude Fable 5 的 1/3~1/2,GPT-5.6 的一半左右,而在程式碼、檢索、知識工作場景性價比斷層領先於這些閉源模型。

而在Kimi K3論文中還提到了落地案例。

比如,Kimi K3支援GPU 核心與編譯器,自主最佳化各類 Attention 核心,自研 MiniTriton 類編譯器,性能逼近 cuBLAS,完整支援分佈式訓練。

其中,GPU核心最佳化:全面升級主流注意力核心,性能比肩頂尖模型。

本次測試在統一沙盒環境下開展,為每項模型最佳化任務設定最長24小時的研發週期,涵蓋核心分析、程式碼重寫、基準測試全流程,保障測試結果嚴謹可控。測試選取四類業界主流、具備代表性的注意力核心(attnRes、DeepSeek稀疏注意力DSA、KDA、MLA,頭部尺寸設為512),分別在NVIDIA Hopper GPU及競品通用GPU平台完成性能驗證。

實測結果顯示,Kimi K3對四類核心均實現顯著性能最佳化,最佳化效果全面且突出。其中,attnRes推理延遲從283.6毫秒大幅降至114.4毫秒;DSA、KDA核心運行效率分別提升55.1%、73.6%,同時MLA核心算力峰值可達硬體理論峰值TFLOPS的半數以上。

在同場景對比測試中,Kimi K3性能可持平帶後備機制的Claude Fable 5,且大幅超越Claude 4.8、GPT-5.6 Sol、GPT-5.5等主流模型。此外,研發過程中早期版本的Kimi K3檢查點,已高效承接大部分核心最佳化迭代工作,其attnRes核心的最佳化迭代軌跡也通過基準測試形成完整資料佐證。

GPU編譯器開發層面,Kimi K3自主研發輕量化類Triton編譯器MiniTriton5,搭建了一套完整、定製化的編譯架構。

硬體實測資料表明,在NVIDIA L20顯示卡的核心基準測試中,MiniTriton5的綜合幾何平均性能優於原生PyTorch即時編譯與torch.compile方案,其全新開發的張量核心矩陣運算路徑,在大尺寸算力任務下性能接近cuBLAS行業標竿,可達成硬體理論算力峰值的90%。

這整體驗證了Kimi K3可通過DSL前端與IR中間層,打通PTX程式碼生成及CUDA執行階段全鏈路,形成一體化編譯體系,而非零散的獨立核心集合。

對於半導體行業,Kimi K3可以實現AI 晶片 RTL 設計,48 小時自主完成 Nangate45 工藝推理晶片 RTL,時序收斂、吞吐 8700 token/s。

科研計算方面,Kimi K3實現天體物理300和物態方程數值管線、引力波巨量資料多 Agent 分析;知識生產上,可以實現42年AI晶片行業萬字調研網站、法律/投行完整交付物

多媒體創作上,Kimi採用自主架構 3Blue1Brown 風格動畫、56 條素材剪輯成片。

值得一提的是,Kimi K3唯一的門檻是年收入超 2000 萬美元的模型 API 服務商,商用得跟月之暗面另外談。

首日接入這事更值得注意。Modal、Together AI、Nebius、GMI Cloud、Baseten、Fireworks AI 六家海外推理平台,權重發佈當天就能用。vLLM 和 SGLang 兩大開源推理框架也同步支援。拿到權重直接部署,不用等適配。

論文最後,Kimi介紹Kimi K3,一個開放的2.8萬億parameter混合專家模型,具有本地視覺功能和100萬令牌上下文窗口。

作為世界上第一個開放的3T級模型,Kimi K3在編碼、智能體、知識、推理、和視覺任務。儘管與最強的專有型號之間仍然存在差距,但Kimi K3建立了一個新的開放前沿在每個人觸手可及的範圍內。

“我們根據 Kimi K3 許可證發佈完整的 Kimi K3 模型權重,使前沿報告可以公開用於研究、部署和進一步創新。我們希望K3能在研究、部署和創新方面賦予更廣泛的社區權力。”

對普通使用者來說最直接的影響:今天大機率就能在各家Token Plan平台上直接用 Kimi K3 了,想嘗鮮的可以關注一下。(智能紀元AGI)