Kimi K3:很強,很貴,很愛給你炫技

7 月 16 日晚,月之暗面上線 Kimi K3,2.8 兆參數,MoE 架構,原生支援視覺理解和 100 萬 token 上下文。K3的MoE共有896個專家,每個token啟動其中16個,並引入KDA、Attention Residuals和Stable LatentMoE。官方稱,這些改動讓其相較K2的整體擴展效率提高約2.5倍。

它號稱“迄今能力最強的旗艦模型”,完整權重發佈後(計畫 7 月 27 日前),K3 有望成為參數量最大的公開權重模型。Benchmark方面,K3官方稱其整體表現仍落後於Claude Fable 5和GPT-5.6 Sol,但在整套評測中達到了前沿水平,並穩定超過其他受測模型。

正式上線之前,demo 已經刷了兩天屏。Arena 上代號“Kivine”的匿名模型被社區認定來自 Moonshot,一句提示詞生成的 Minecraft 克隆和《殺戮尖塔》可以直接打開遊玩,Flappy Bird 對比視訊宣稱 K3“明顯優於”Opus 4.8。


此外官方還展示了一個晶片設計的案例。K3 連續自主運行 48 小時,基於開源 EDA 工具和 Nangate 45nm 工藝庫,為一個基於自身架構的 nano 模型完成晶片設計、最佳化與驗證,最終實現時序收斂和超過每秒 8700 token 的模擬解碼吞吐。


從K3自己提前佈置放出的案例來看,清楚地說明了 K3 想佔據的位置,一個能持續呼叫工具、根據運行結果迭代、把複雜任務推進到最終交付的長程 Agent。但官方案例展示的是能力上限。更現實的問題是,當 K3 進入普通使用者可以直接使用的產品,一次實際運行能得到什麼?

矽星人選了幾個結果相對容易快速驗證的任務,分別測試從零生成、需求理解和程式碼偵錯等能力。


1

從零生成:一場自動運行的死星戰壕

先上比較重的 case。

最重的 Build 測試要求 K3 用 Three.js 重現“死星戰壕突襲”:程序化生成無限循環的戰壕,X-Wing 自動飛行,炮塔追蹤射擊,同時實現碰撞檢測、粒子效果、路徑規劃和障礙規避。


生成過程中,它修復了跨模組引用錯誤,並將主循環改造成可步進驗證的結構。第一次60秒模擬中損失8架飛船,K3隨後根據死因調整射速、彈速和命中判定;第二次120秒模擬降到損失2架。

這也對應了官方所說的“vision in the loop”:K3 會把即時截圖重新納入執行循環,在程式碼和視覺結果之間持續迭代。死星測試裡,它也經歷了查看畫面、調整亮度和炮塔識別度、重新驗證的過程。

實際運行中,X-Wing 會自動改變位置躲避障礙和雷射,炮塔持續追蹤射擊,戰壕分段循環回收。我們觀察期間,HUD累計記錄18.1公里航程、89次閃避和2次損失,控制台沒有報錯。

它仍然是一個從零生成的 Three.js Demo。但相比“一次生成一個好看的頁面”,更有價值的是K3完成了生成、運行、觀察結果、調整參數和重新驗證的完整閉環。

另外一個 case K3 跑了接近一個小時。prompt 要求 K3 從零搭建一個叫《軌道危機:Orbital Command》的瀏覽器策略遊戲。玩家維持一個多衛星軌道通訊網路,太空碎片不斷出現,需要在有限燃料下調整軌道、規避碰撞、保持覆蓋。10 條硬性要求,包括完整遊戲循環、真實運動、資源消耗、四項即時狀態、有意義的取捨、暫停/倍速/新手引導,以及“完成後自行測試並修復問題”。


10 條要求中,主要功能均已實現並驗證,可以看出,Kimi 讓社區關注的“一句話生成遊戲”的能力,確實夠強。

但每個使用過足夠多模型去做類似任務的人也都會在這個過程中感覺到一些問題,一個是目前這些任務依然是幾個小時起,這還是太慢了,而且觀察它的思維鏈會發現很熟悉的味道。

此外,這些UI的風格在做了很多case的測試後,會讓人感覺有點範本化,就像DeepSeek R1寫的那些詩歌一樣,乍一看會讓人目眩,但看多了會感到熟悉的套路,從配色到所謂的“審美”,以至於會讓人用多了感到這個AI在給你炫技——那怕犧牲掉更多時間,也要炫技。而這在K3把價格調高到了“頂尖模型”水平的背景下,就顯得更加扎眼了。


1

需求判斷:一個故意埋坑的任務

所以除了一句話生成UI,我們也更關注它的推理和需求判斷以及真實程式碼修改能力。

第三個測試在需求裡故意埋了多組矛盾。

prompt 是一個大會報名網站的需求文件,共 18 條要求。矛盾散落各處,報名截止日晚於大會日期,要求不收集個人資訊但報名表必須填真實姓名和手機號,資料只能存瀏覽器本地但主辦方要跨電腦即時查看,宣傳“僅限 200 席”但系統允許 300 人報名,付款後立即顯示“已確認”但必須人工稽核,隨時退全款但門票不可退,要求 mobile-first 但只支援 1440px 以上桌面,紅綠色區分狀態但要滿足 WCAG AA。

K3 在開工前把這些矛盾合併成了 7 個問題提出。拍板“宣傳 200、上限 300”後,它沒再質疑,但也沒藏矛盾,管理面板上兩個數字分開標註。

這個 case 測的是 K3 面對模糊和矛盾需求時有沒有判斷力。答案是有。它會發現矛盾、也會服從拍板。


1

程式碼偵錯:修復一個權限 Bug

第四個測試考的是 K3 能不能修別人寫的程式碼。

該項目、Bug 設定、評分表和 5 項隱藏測試,由矽星人借助 OpenAI Codex 在測試前搭建。K3 獲得了待修程式碼、公開測試和 Bug 報告;報告提示問題與請求順序及跨請求狀態有關,並要求保留快取設計。隱藏測試在 K3 完成修改後獨立運行。

K3 單次運行定位到根因,系統快取了權限裁剪後的結果,快取鍵沒有區分訪問者的可見範圍。它的解法是增加 admin、finance、public 三檔權限 scope 並補上正反順序的回歸測試,沒有選擇關閉快取或按使用者拆分這兩種更粗暴的寫法。

3 分 03 秒。公開測試 14/14,隱藏測試 5/5,全部通過。

K3 找到了 Bug 並給出合理的修復。不過需要說明的是這是一個線索相對明確的小型程式碼庫。


1

普通人可能也快用不起最強開源模型了

從測試結果看,K3 在從零生成、需求理解和小型程式碼偵錯三項小規模任務中表現很強。社區 48 小時的 Demo 刷屏不全是 hype,K3 確實很會 Build。但它還沒有回答的問題也很具體。複雜工程維護、大型程式碼庫理解、多人協作場景下的表現,目前沒有可靠的測試資料。推理速度是一個現實約束,遊戲 case 在 max 思考強度下跑了接近一個小時。官方也坦承 K3 在任務執行中“過於主動”,會在使用者意圖模糊時替使用者做決定。

社區裡有人把 K3 稱為“又一個 DeepSeek R1 時刻”。但 R1 發佈時以遠低於同級模型的定價迅速打開市場,K3 走的是相反的方向。

K3 的 API 定價,輸入 2 元/百萬 token(快取命中)、20 元(未命中),輸出 100 元。以輸出價格計,約為 K2.7 Code 的 4 倍。Kimi 過去一年的市場位置一直是“性能接近 frontier,價格遠低於 frontier”,K3 不再只依靠低價參與競爭。100 元/百萬 token 的輸出價格已經進入 frontier 模型的定價區間。官方用 Mooncake 分離式推理架構把程式設計場景快取率做到了 90% 以上,輸入成本約為標價的四分之一,但輸出沒有類似的避險手段。

另一個變化是 1M 上下文的分層。K3 的百萬 token 上下文不是全量開放的,Moderato 使用者只能用 256K,Allegretto 及以上才能用 1M。把上下文長度做成會員權益,在行業裡還比較少見。

開源權重計畫 7 月 27 日前發佈,但 K3 推薦在 64 個或更多加速器的 supernode 上部署。權重開放之後真正能跑起來的機構不會很多。

也就是說,接下來“普通人”可能也快用不起最強開源模型了,因此對“開源模型”的考察標準,也會更加接近從產業和真正的生產力價值來評判,這個可能會是一個更強,更貴也更愛炫技的K3給整個中國模型行業帶來的更關鍵的影響。 (矽星人Pro)