Kimi K3 發佈,2.8T 參數開源最大,性能僅次於 Fable 5 和 GPT-5.6 Sol

7 月 16 日,趕在 WAIC 開幕前,月之暗面發佈了 Kimi K3——2.8 兆參數,1M 上下文窗口,原生多模態。

這是目前全球參數規模最大的開源模型,比 DeepSeek V4 Pro(1.6T)大約 75%。 月之暗面稱,雖然 K3 整體仍落後於最強閉源模型 Claude Fable 5 和 GPT-5.6 Sol,但在全套評測中展現出前沿水平,並穩定超過了其他所有模型。完整權重將於 7 月 27 日前發佈。

這也是全球首個開放原始碼的 3 兆等級模型,面向長程程式設計、知識工作和推理等前沿智能場景而設計。

價格上,K3 價格對標 Sonnet 模型,每百萬 Token 輸入:2 元(命中快取)和 20 元(未命中快取),輸出:100 元。官方聲稱,借助 Mooncake 分離式推理架構,Kimi 官方 API 程式設計場景的快取率超過 90%,實際輸入價格僅為標準輸入價格的 1/4。

目前 K3 已經可以在 Kimi 網頁版、Kimi App 和 Kimi Work 以及官方 API 中使用,當前默認思考強度為 max(極致),後續更新後會增加 low 和 high 兩種模式。


01

參數上,

把規模推到 3 T 參數級

Kimi K3 是一個 MoE 模型,總參數 2.8 T。模型擁有 896 個專家模組,每次推理只啟動其中 16 個。這種高稀疏度設計意味著,雖然模型「知道」的東西極多,但每次回答問題時呼叫的計算量被嚴格控制。

架構上,K3 引入了兩項關鍵創新:

Kimi Delta Attention(KDA): 一種混合線性注意力機制。傳統 Transformer 的注意力機制在處理超長文字時計算成本呈平方增長,KDA 用線性注意力替代了大部分計算,同時保留少量全注意力層處理需要精確檢索的場景。具體比例是 3:1——每 4 層中有 3 層用 KDA,1 層用全注意力。結果是 KV 快取使用量減少 75%,在 100 萬 token 上下文長度下解碼吞吐量提升最高 6 倍。

Attention Residuals(AttnRes): 傳統深層模型在各層均勻累積資訊表示,AttnRes 則讓模型能有選擇地跨層檢索資訊。簡單說,模型變深之後,底層學到的東西不容易被頂層「忘掉」。

這兩項技術合在一起,讓 K3 相比上一代 K2 的整體訓練效率提升了約 2.5 倍。月之暗面在官方部落格中的說法是:「能更有效地把算力轉化為能力。」

此外,K3 採用了量化感知訓練(MXFP4 權重 + MXFP8 啟動),從 SFT 階段就開始適配低精度推理,這意味著模型從訓練階段就在為部署效率做準備。

價格上,K3 對標 Sonnet 5 模型,比 K2.6 貴了不少,對於重度使用者,感覺 token plan 可能更划算。

根據 Artificial Analysis 的資料,K3 在智能指數(Intelligence Index)上的平均任務成本為 0.94 美元,接近 GPT-5.6 Sol 的 1.04 美元,約為 Opus 4.8(1.80 美元)價格的一半。


02

性能:

逼近閉源最強,但還沒追上

先看資料和評測。


月之暗面的定位是:K3 整體仍落後於 Fable 5 和 GPT-5.6 Sol,但穩定超過了其他所有模型。

在 Kernel 最佳化競技場(一個讓模型在 GPU 沙箱裡自主最佳化核心的測試環境)中,K3 在最大思考強度下的表現接近 Fable 5(含回退機制),明顯領先 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。

在 AA-Briefcase(長程智能體知識工作測試)中,K3 得分 1527,排名第二,超過了 GPT-5.6 Sol Max 的 1495。

知識工作領域的提升也是本次模型的亮點。

不過具體體感如何,也期待各位的實測。

03

任務演示:

48 小時設計一顆晶片

Benchmark 資料之外,K3 有幾個能力展示值得單獨說。

Kernel 最佳化競技場。 月之暗面搭建了一個核心最佳化測試環境,每個模型在獨立的 GPU 沙箱中運行,最多 24 小時內完成分析、重寫和驗證。測試覆蓋 H200 GPU 上的 Attention Residuals、KDA 線性注意力、512 頭維度 MLA 核心,以及某國產 GPU 上的 KDA 任務。K3 在最大思考強度下的表現接近 Fable 5。

從零建構 GPU 編譯器。 K3 開發了 MiniTriton,一款類 Triton 編譯器。它基於 MLIR 建構了自己的 tile 級中間表示層,實現了完整的最佳化 pass 到 PTX 程式碼生成流水線。在 Roofline 基準測試中,MiniTriton 在部分工作負載上的性能超過了 Triton 和 torch.compile。作為端到端驗證,團隊用 MiniTriton 訓練了 nanoGPT,並觀察到正常收斂。

自主設計晶片。 在 48 小時連續運行中,K3 基於開源 EDA 工具和 Nangate 45nm 工藝庫,獨立完成了一顆晶片的設計、最佳化和驗證。晶片面積 4 mm²,整合 146 萬個標準單元,在 100 MHz 下完成時序收斂,模擬解碼吞吐超過每秒 8700 個 token。月之暗面的描述是:「一顆由模型設計、為模型服務的晶片。」

科研程式設計。 在一個計算天體物理的案例中,K3 用約兩小時復現了 I-Love-Q 普適關係,閱讀交叉驗證了 20 多篇論文,評估了 300 多種狀態方程,生成了 3000 多行程式碼。這個工作通常需要一名資深研究人員一到兩周。

行業研究。 在 Kimi Work 中,K3 完成了一份推理晶片行業研究報告,覆蓋 ASIC 行業 42 年歷史,經過 120 多輪遞迴自我改進。過程中完成了 2800 多次網頁搜尋、1100 多次終端資料拉取,處理了 87 份季報和 99 份 PDF,合計超過 11000 頁。

查看完整互動式報告 https://asic42cn.ok.kimi.link/

這些案例的共同特徵是長程自主性,持續數小時甚至數天地獨立完成複雜工程任務。這是 K3 區別於上一代模型最核心的能力升級。

04

已知侷限

月之暗面在發佈部落格中列出了三條侷限:

  1. 對歷史思考內容敏感: Kimi K3 在後訓練過程中全程使用思考歷史保留模式,如果 agent 框架未按要求回傳全部歷史思考內容,或從其他模型正在進行的會話中切換到 Kimi K3,則有可能引發上下文干擾,導致內容生成質量不穩定。建議使用 Kimi Code 等經過相容性驗證的 Agent 框架,並避免在會話中途切換到 Kimi K3。
  2. 過於主動:Kimi K3 的訓練重點最佳化了長程、高難任務。因此,在任務執行過程中遇到小問題或使用者意圖模糊時,它可能會替使用者做出非預期的決定。如果你的應用希望 agent 更有邊界感、不要過於自由發揮,請在 system prompt 或 AGENTS.md 中對 Kimi K3 施加更明確的行為約束。
  3. 儘管 Kimi K3 總體上是一個非常有競爭力的模型,但與 Claude Fable 5 和 GPT-5.6 Sol 相比,在使用者體驗上仍有一定差距。 (Founder Park)