資料來源:月之暗面《Kimi K3: Open Frontier Intelligence — Technical Report of Kimi K3》(47頁技術報告);高盛《Navigating China AI Models: New frontier from Kimi K3: from cost efficiency, intelligence to pricing power of Chinese models》(2026年7月18日)
本文基於上述兩份公開報告整合撰寫,不構成投資建議。
🔥 先說結論:K3好在那,為什麼好?
開源模型普遍卡在1T參數等級,架構趨同,和閉源頭部的差距越拉越大。K3用2.8T總參數但每個token只啟動104B,通過KDA注意力、AttnRes層間檢索、Stable LatentMoE三大架構創新,實現了相對前代K2的2.5倍縮放效率——同樣的算力預算,跑出2.5倍的性能。
兩個最硬的指標:WebDev Arena(真人評測程式設計能力)1678 Elo,99個模型中排名第一;SWE-Marathon(真實軟體工程任務)42.0%,是GLM-5.2的3倍多。但也要看到邊界——K3整體仍落後於Claude Fable 5和GPT-5.6 Sol,是開源最強,不是全域最強。
📌 核心資料速覽
- 2.8T總參數,104B啟動:896個路由專家每個token只啟動16個,從K2的384專家擴展到896專家,啟動數從8提升至16,稀疏度達56倍
- 2.5倍縮放效率:從K2到K3,架構、資料、訓練三重改進疊加,同等算力下的性能提升2.5倍
- WebDev Arena登頂:K3以1678 Elo排名99個模型中第一,超過Claude Fable 5的1634 Elo
- Agent Arena第4:評分9.1,落後於Claude Fable 5(12.7)、GPT-5.6 Sol(10.1)、Claude Opus 4.8(9.8)
- 高盛關註定價權:K3定價$2.3/1M tokens,為中國模型最高;低端Agent API定價壓力持續在$0.1-0.2/1M tokens區間
KDA:把softmax扔了,用循環門控跑100萬token
Kimi K3最核心的架構創新是Kimi Delta Attention(KDA),它直接替換了Transformer用了好幾年的softmax attention。
具體做法是混合架構:每個block裡3層KDA + 1層Gated MLA,3:1的配比貫穿93層網路。KDA本質上是一種帶通道衰減的線性注意力——通過循環門控和衰減機制隱式編碼位置資訊,不需要任何顯式位置編碼(NoPE),直接支援100萬token上下文。
這意味著什麼?傳統模型要擴展上下文窗口,得折騰RoPE頻率縮放、YaRN插值等各種方案。K3完全跳過了這一步——KDA的衰減機制本身就攜帶位置訊號,窗口從8K逐步擴展到100萬,不需要任何位置編碼修改。
對比來看:GLM-5.2仍在使用標準softmax attention,DeepSeek系列從V2開始引入的MLA本質上也是對softmax KV-cache的壓縮最佳化,沒有跳出softmax的框架。而K3走了一條更激進的路——直接在注意力機制層面做了替換,不是修補,是換底層引擎。
AttnRes + Stable LatentMoE:93層深層網路的穩定性工程
傳統Transformer的殘差連接是"資訊接力賽"——每一層只能拿到上一層的輸出,逐層傳遞。層數越多,早期資訊衰減越嚴重。K3把93層分成8個block,block內部用標準殘差累加,block之間用AttnRes注意力檢索——每一層可以通過學習到的偽查詢,選擇性地從所有前序層檢索資訊。不是簡單的跳躍連接,而是一個完整的注意力機制,按需取用。N≈8時就能恢復大部分收益,記憶體開銷從O(L)降到O(N)。
MoE穩定性方面,K3做了三個關鍵改進:
一是RMSNorm歸一化——在路由專家聚合之後、上投影之前插入歸一化層,防止極端稀疏啟動導致的內部表徵爆炸。
二是SiTU-GLU啟動函數——替換業界通用的SwiGLU,用平滑截斷(softcap)控制大值增長,在低精度運算下更穩定。
三是Quantile Balancing——896個專家的路由均衡,基於分位數的偏差調整,一次前向傳播就能算出每個專家的均衡偏差。
每個token的啟動專家數從K2的8個提升到16個,專家總數從384擴展到896,稀疏度達56倍。這個規模的稀疏MoE,如果路由不穩定,訓練直接發散。訓練穩定性本身就是工程競爭力的核心體現。
Stable LatentMoE:896個專家不崩的秘密
MoE架構現在不新鮮了。DeepSeek用MoE做出了性價比,GLM-5.2也在用MoE,但K3在MoE穩定性上做了三個關鍵改進:
一是RMSNorm歸一化——在路由專家聚合之後、上投影之前插入歸一化層,防止極端稀疏啟動導致的內部表徵爆炸。二是SiTU-GLU啟動函數——替換了業界通用的SwiGLU。SwiGLU的兩個乘子都是無界的,在低精度運算下容易產生溢出;SiTU-GLU用平滑截斷(softcap)控制大值增長,同時保留SwiGLU在原點附近的響應特性。三是Quantile Balancing——896個專家的路由均衡,靠的不是傳統的輔助損失,而是基於分位數的偏差調整,一次前向傳播就能算出每個專家的均衡偏差。
有個細節值得注意:K3把每個token的啟動專家數從K2的8個提升到16個,專家總數從384擴展到896,稀疏度達到56倍。這個規模的稀疏MoE,如果路由不穩定,訓練直接發散,多少算力都白燒。這也是國產替代背景下特別重要的一點——算力不夠用的時候,訓練穩定性本身就是競爭力。
和GLM-5.2的正面對比:一個身位的差距
技術報告中GLM-5.2是唯一直接對比的開源模型,但差距分佈並不均勻,從幾乎持平到數量級差距都有:
差距極小(≤2.5分):
GPQA Diamond: K3 93.5% vs GLM-5.2 91.2%(差2.3)
PostTrainBench: K3 36.6% vs GLM-5.2 34.3%(差2.3)
CritPt: K3 23.4% vs GLM-5.2 20.9%(差2.5)
差距中等(5-6分):
Terminal-Bench 2.1: K3 88.3% vs GLM-5.2 82.7%(差5.6)
差距較大(14分以上):
ProgramBench: K3 77.8% vs GLM-5.2 63.7%(差14.1)
SWE-Marathon: K3 42.0% vs GLM-5.2 13.0%(差29.0)
Agent綜合:
GDPval-AA v2 Elo: K3 1686 vs GLM-5.2 1510(差176)
差距最大的是SWE-Marathon,K3是GLM-5.2的3倍多。SWE-Marathon評估包含GPU任務(以H20為校準基準),對模型的工程落地能力要求很高。而在推理能力(GPQA Diamond)和後訓練最佳化(PostTrainBench)等維度上,兩者的差距僅有2分左右。
和閉源頭部的對比更值得細看。K3在BrowseComp達到91.2%,在部分資訊檢索任務上領先;但在HLE-Full(43.5% vs GPT-5.6 Sol的53.3%)和CritPt(23.4% vs 28.6%)等研究級推理任務上,差距依然明顯。Terminal-Bench 2.1上K3以88.3%緊追GPT-5.6 Sol的88.8%,幾乎持平。Agent Arena上K3排名第4,評分9.1,落後於Claude Fable 5(12.7)、GPT-5.6 Sol(10.1)和Claude Opus 4.8(9.8)。
訓練效率才是真正的護城河
報告裡有一張scaling law曲線圖,顯示K3相對K2的縮放效率提升約2.5倍。這個提升不來自單一突破,是架構、資料和訓練策略的疊加效果。
💡 關鍵洞察:2.5倍縮放效率的含義——同樣的算力預算,K3能跑出K2時代2.5倍的性能。在AI晶片供給受限的大環境下,這比堆參數更有現實意義。
訓練方法上也有亮點:部分rollout RL——不需要等所有軌跡跑完再最佳化,完成一定比例就開始梯度更新,大幅降低長序列強化學習的尾部延遲。MXFP4量化感知訓練——從SFT階段開始就在低精度下訓練,推理時直接部署4位權重量化,部署成本和訓練成本雙降。EAGLE-3推測解碼——用預訓練的MTP層微調為草稿模型,融合AttnRes低、中、高三個層級的特徵做推測。
說白了,K3的思路是"每一層棧都最佳化":從注意力機制到啟動函數,從路由策略到量化部署,從RL框架到推測解碼。不是靠單點突破,是系統性工程能力的體現。當AI晶片供給受限時,這種全方位效率最佳化比堆算力更現實。
對開源AI生態意味著什麼
K3證明了一件事:在MoE架構創新+混合注意力+系統性工程最佳化的組合下,開源模型用相對有限的啟動參數就能逼近閉源前沿。WebDev Arena上,K3以1678 Elo拿下第一名——這是開源模型首次登頂這個榜單。
但對標對象也很清楚——Claude Fable 5和GPT-5.6 Sol在多數指標上仍然領先。K3在BrowseComp(91.2%)、ProgramBench(77.8%)等特定任務上已經追平甚至超越,但在HLE-Full(43.5% vs 53.3%)、CritPt(23.4% vs 28.6%)等研究級推理任務上,差距依然明顯。
💡一個值得追問的問題
當開源模型靠架構創新不斷逼近閉源前沿時,閉源模型真正的護城河到底在那裡——是資料壁壘、算力規模,還是某種尚未被開源社區復現的隱性工程能力? (AI深研淺說)
