月之暗面27日深夜正式發佈Kimi K3模型權重、技術報告,並同步開源三項關鍵基礎設施技術。這是Kimi迄今能力最強的模型,也是中國AI開源社區迄今為止規模最大的一次技術開放。
月之暗面在公告中表示,堅信開放權重模型的價值,它們能降低獲取智能的門檻,推動創新,並賦予使用者對資料更大的控制權、隱私保護和所有權。根據Kimi K3許可證,任何人都可以下載並部署該模型,無論是用於內部研發,還是嵌入到面向終端使用者的產品中,均可自由使用。模型權重已在Hugging Face上線,技術報告及全部原始碼已在GitHub公開。
Kimi K3模型一經開源,全球資本市場即做出劇烈反應,華爾街分析師估算,OpenAI與Anthropic的合計估值預期因此蒸發約3140億美元,輝達單日市值亦縮水1111億美元。彭博社評價稱,Kimi K3“正在攪動全球科技市場”。
Kimi K3是一個擁有2.8兆參數的混合專家(MoE)模型,參數規模約為此前Kimi K2.5的3倍。模型具備原生視覺理解能力,並支援100萬token的上下文窗口。在Artificial Analysis智能指數上,Kimi K3綜合得分位列全球第三,僅次於Claude Fable 5和GPT-5.6 Sol;在Frontend Code Arena程式設計榜單上更以1679分登頂,成為首個在該榜單超越所有閉源模型的開源模型。特斯拉CEO馬斯克在相關評測下留言“令人印象深刻”。
月之暗面強調,規模化並非簡單的參數堆疊。在算力條件並不寬裕的情況下,團隊憑藉一系列架構創新實現了規模化效率提升2.5倍,即單位算力產出的智能相當於原先的2.5倍。支撐這一效率突破的核心技術包括Kimi Delta Attention(KDA)、Attention Residuals以及MoonEP等。
技術報告披露訓練核心細節
同步發佈的技術報告詳盡披露了Kimi K3的訓練方法,主要包括四大技術類股:
KDA + AttnRes:以3:1比例混合KDA與Gated MLA,實現高效長上下文建模,並通過塊級注意力殘差增強跨層資訊流動。
Stable LatentMoE:每個token從896個路由專家中啟動16個,通過SiTU-GLU與Quantile Balancing在極高稀疏度下保持訓練穩定。
MoonViT-V2:視覺編碼器從零開始使用next-token prediction訓練,無需對比預訓練,在達到SigLIP初始化基線效果的同時獲得更穩定的最佳化過程。
後訓練與評估:在通用推理、通用Agent和程式設計Agent三大領域進行大規模任務合成,配備百萬token上下文的強化學習基建,並在近20個內部評測集上完成完整評估。
除模型本身外,月之暗面還開源了支撐Kimi K3訓練的三項基礎設施技術:
MoonEP:為超大細粒度MoE打造的高性能通訊庫,讓專家平行通訊在不均衡情況下仍能實現極致效率。
FlashKDA:KDA的高性能算子,在輝達H20上相比flash-linear-attention基線,prefill速度提升1.72至2.22倍,可直接作為替換後端。
AgentEnv:與KVCache.ai合作開發的沙箱系統,用於大規模運行Agent環境,支援快速快照、恢復和分叉,可應對大規模平行的Agent工作流。
三項技術覆蓋了高性能通訊、算子加速和分佈式強化學習環境的關鍵鏈路,全部在GitHub公開。
Kimi K3開源引發的最直接連鎖反應,是對閉源AI商業模式的衝擊。摩根士丹利評價稱,Kimi K3證明中國大模型在模型規模、性能、定價三個層面對美國頭部模型實現了“全方位追趕”。高盛則認為,中國AI開源模型的智能表現已達到全球大規模普及的關鍵節點。
尤為值得關注的是定價權的變化。Kimi K3的API定價為每百萬Token輸出100元(約15美元),與Claude Sonnet定價同檔,較上一代K2.6高出2.7倍。這是中國大模型第一次在規模、性能和定價上全面對標美國頭部產品。
摩根士丹利指出,這撕掉了“中國模型等於低價”的標籤。正如月之暗面企業業務負責人所言:“我們的目標從來不是做高性價比的雕琢。真正好的模型能力有溢價權。”
美國技術專家內森·蘭伯特指出,Kimi K3在Vals AI指數中排名全球第二,在“前端程式碼競技場”中排名第一。西班牙《國家報》更尖銳發問:“Anthropic公司現在該如何為其定價辯護?” IG市場分析師托尼·西卡莫爾表示,Kimi K3的推出挑戰了“美國對先進晶片出口限制會阻礙中國AI發展”的既有認知。
Kimi K3的開源,核心意義在於讓前沿AI能力不再被少數巨頭鎖在高牆之內。業內人士指出,開放權重將大幅降低全球開發者使用前沿AI的門檻,科研機構和企業可以本地部署、自主微調,不必將資料主權拱手讓給外部雲廠商。對於電力基礎設施薄弱、算力預算有限的全球南方國家而言,這尤其具有現實意義。
更重要的是,Kimi K3走出了一條通過架構創新而非算力堆疊實現智能躍升的路徑。閉源AI的發展邏輯是無限擴張,更大參數、更多晶片、更高能耗;而開源中國大模型證明了另一條路,更聰明地利用每一單位算力。這不僅是技術路線的分歧,更是發展智慧的差異。
Kimi K3的開源也是國產大模型搶佔全球生態話語權的重要佈局。美國25家科技公司已聯名簽署公開信,呼籲開放權重AI模型。開源與閉源共存的多元格局,正在成為AI產業的主流共識。正如彭博社所評價的,Kimi K3的真正震撼力不在於擊敗了誰,而在於它向世界展示了一種可能:全球AI產業從“美國絕對領先”進入“中美雙線競爭”的新階段,開源大模型也正式進入2.8兆參數的新紀元。 (TechWeb)
