繼DeepSeek之後,中國大模型再次攪動全球AI市場。
7月16日,月之暗面正式發表Kimi K3,模型總參數達2.8T,採用混合專家架構,原生支援多模態,並擁有100萬Token上下文窗口,是目前參數規模最大的開放權重大模型之一。
更受關注的是,Kimi K3在部分程式設計、智能體和知識工作測試中,已經接近甚至超過部分美國主流模型。雖然月之暗面也承認,K3的綜合能力仍落後於最強閉源模型,但它已經證明:中國開放模型與全球前沿水平之間的差距,正在迅速縮小。
消息公佈後,輝達、博通、美光等AI產業鏈公司一度承壓,市場擔憂Kimi K3會重演「DeepSeek時刻」:如果性能更強、成本更低的大模型不斷出現,科技巨頭是否還需要購買如此多的GPU?
但從K3的架構和實際部署要求來看,答案可能恰恰相反。
一、Kimi K3的優勢究竟在那裡?
Kimi K3的真正突破,不只是參數更大,而是在超大規模模型、推理效率和智能體能力之間,找到了新的平衡。
首先是大模型仍然有效。
Kimi K3總參數達2.8兆,是Kimi K2的數倍。與近年來市場流行的「小模型、高效率」路線不同,月之暗面選擇繼續推動模型規模增長,說明Scaling Law並未失效:在架構和訓練方法持續改進的前提下,擴大參數規模,依然能夠帶來能力提升。
不過,K3並不會在每次推理中啟動全部參數。它採用Stable LatentMoE混合專家架構,在896個專家中,每次只啟動16個,相當於只呼叫約1.8%的專家。這使得模型既能保留龐大的知識容量,又不必為每一個Token計算全部2.8兆參數。
其次是線性注意力降低了長文字成本。
傳統Transformer的注意力運算量會隨著上下文長度快速上升,尤其面對數十萬甚至上百萬Token時,KV Cache會佔用大量記憶體。
Kimi K3引入Kimi Delta Attention,也就是KDA,將線性注意力與傳統注意力結合。在先前發表的Kimi Linear研究中,這套架構在100萬Token場景下,最多可降低約75%的KV Cache佔用,並將解碼吞吐量提升至傳統架構的數倍。
這意味著,K3特別適合處理大型程式碼庫、數百份PDF、長時間運行的智能體任務,以及複雜研究項目。它的優勢並不是回答一個問題更快,而是能夠連續工作數小時甚至數十小時,在較少人工干預的情況下完成一整套任務。
第三是原生多模態和智能體能力。
K3不僅可以理解文字,還能同時處理圖片、影片、網頁、表格和程式碼。月之暗面展示的案例包括自動開發GPU編譯器、製作遊戲、設計晶片、分析數千頁研究資料,以及透過多個子智能體並行執行複雜任務。
因此,K3更像一個能夠調用工具、觀察結果、修改方案並持續執行的“數位員工”,而不是傳統聊天機器人。
第四是開放權重與較低價格形成競爭力。
Kimi K3的API定價為每百萬Token輸入3美元、輸出15美元,大約只有部分美國頂級模型的一半左右。同時,月之暗面計畫於7月27日發布完整模型權重,讓企業自行部署、微調和客製化。
這讓K3同時具備三項競爭力:能力接近前沿模式、價格更低、企業可以私有化部署。
二、為什麼華爾街如此關注Kimi K3?
華爾街熱議K3,表面上是擔心中國AI再次製造「DeepSeek衝擊」,本質上則是三個估值邏輯正在被重新審視。
第一,美國閉源模型的護城河可能變窄
過去市場普遍認為,OpenAI、Anthropic等美國實驗室在前沿模型上擁有明顯領先優勢,因此可以維持較高的API價格和利潤率。
但從DeepSeek、GLM到Kimi K3,中國開放模型正在持續逼近前沿水平。摩根士丹利認為,K3並非一夕之間出現的奇蹟,而是中國大模型產業長期累積的結果;Bernstein則認為,K3再次證明中國頂尖實驗室已經有能力跟上全球科技前線。
一旦不同模型之間的能力差距縮小,企業便可以根據成本、速度和任務類型,動態選擇不同模型。
這對模型公司並不是好消息。模型能力可能逐漸商品化,單純依靠「最強模型」獲得高利潤率將越來越困難。
第二,價值可能從模型層轉移到應用層
開放模式越強,應用公司使用AI的成本就越低。
例如,程式設計、金融研究、客服、廣告製作和企業自動化公司,不必完全依賴昂貴的封閉式模型,而是可以組合多個開放式模型來完成任務。 B. Riley認為,K3加劇了模型層的價格競爭,但對嵌入AI能力的應用層公司構成增量利多。
換句話說,未來AI產業的利潤可能不再全部集中在模型公司,而是逐步流向擁有使用者、資料、工作流程和分發入口的平台。
第三,市場開始重新討論AI資本開支
K3採用線性注意力,降低了KV Cache需求,因此市場第一反應是:
單次推理所需的顯存和運算量下降,輝達、HBM以及網路設備需求可能受到削弱。
這也是半導體股票出現調整的重要原因。K3發布當周,費城半導體指數明顯下跌,市場將其視為繼DeepSeek之後又一次針對AI資本開支合理性的考驗。
然而,這種判斷只看到了KV Cache下降,卻忽略了K3極其龐大的模型權重和專家並行需求。
三、線性注意力真的會削弱輝達和HBM需求嗎?
K3降低的是每個Token的部分注意力計算,並不意味著整個模型變得「小而輕」。
依照SemiAnalysis的估算,K3即使採用低精度格式,模型權重仍需佔用超過1.5TB的HBM容量。單張GPU無法容納如此龐大的模型,必須將896個專家分散部署在大量GPU上。
當一個Token被路由到不同專家時,資料需要在GPU之間不斷傳輸。這種名為WideEP的專家並行方式,會產生極高的Scale-Up互聯需求。 SemiAnalysis認為,雖然KDA最多可以顯著減少KV Cache傳輸,但模型權重和專家路由所產生的網路需求可能更大。
月之暗面也明確表示,K3的高效推理需要部署在至少64顆加速器組成的超級節點上。換言之,K3不是一套依賴幾張顯示卡便能運作的低成本模型,而是典型的機架級AI系統負載。
在這種情況下,K3可能同時推動四類硬體需求:
一是GPU和AI加速器:
模型必須分散在數十顆甚至更多加速器上運行,參數規模越大,能夠容納模型權重的計算域就必須越大。
二是HBM:
超過1.5TB的權重需要長期駐留在高速記憶體中,模型規模擴大仍直接推高HBM容量需求。
三是DDR5和企業級SSD:
當HBM主要用於存放模型權重時,部分KV Cache和中間資料需要卸載至CPU記憶體及NVMe SSD,形成HBM、DDR5和NAND協同工作的多層記憶體架構。
四是Scale-Up高速互聯:
896個專家分散在不同GPU上,專家路由需要高頻寬、低延遲的晶片間通訊。 K3越依賴專家並行,對NVLink、NVSwitch、銅連網以及機架級網路的要求越高。
因此,K3並不是簡單地降低算力需求,而是改變了算力的消耗方式:KV Cache佔用下降,但模型權重、專家並行和機架級互聯需求上升。
四、Kimi K3可能利多那些公司?
美國知名的科技投資人、避險基金Atreides Management的創始人兼CIO Gavin Baker在X上表示,Kimi K3可能是AI的一個重要轉折點,對Anthropic和OpenAI來說可能有潛在負面影響,而對世界上幾乎所有其他公司來說則是凈正面影響。
事實上,從產業鏈來看,Kimi K3並沒有削弱AI基礎設施需求,反而可能推動算力架構升級,最直接受益的仍是 $輝達 (NVDA.US)$等GPU廠商。雖然線性注意力降低了部分KV Cache壓力,但K3擁有2.8兆參數和896個專家,仍需要大規模GPU叢集和高速互聯支援,對GB200、GB300等機架級AI系統形成需求。
記憶體方面, $SK海力士 (SKHY.US)$、 $三星電子 (005930.KR)$、 $美光科技 (MU.US)$等HBM廠商仍將受益。超大模型的核心瓶頸之一是模型權重記憶體,K3龐大的參數規模需要大量HBM支撐。同時,隨著AI智能體任務增加,DDR5和企業級SSD也可能迎來新增需求。
高速互聯領域, $輝達 (NVDA.US)$、 $博通 (AVGO.US)$、 $邁威爾科技 (MRVL.US)$等公司同樣受益。混合專家架構需要大量GPU之間進行數據交換,對Scale-Up互聯提出更高要求,推動NVLink、交換晶片以及高速網絡需求增長。
此外, $台積電 (TSM.US)$ 、 $日月光半導體 (ASX.US)$ 等先進製程和封裝企業,也可能受益於AI叢集持續擴張。隨著模型規模擴大,GPU、HBM、先進封裝和高速互聯仍將成為AI基礎設施的核心瓶頸。
整體來看,Kimi K3帶來的並不是「算力需求下降」,而是算力需求從單純計算轉向「計算+記憶體+互聯」的系統級升級。真正受益的,仍是掌握GPU、HBM、先進封裝和高速互聯能力的核心供應商。
五、效率提升,為什麼反而可能需要更多算力?
理解K3對AI硬體的影響,關鍵在於傑文斯悖論。
當一種資源的使用效率提高、成本下降後,人們往往不會減少使用,反而會開發更多應用,最終使資源總消耗上升。
K3降低了長上下文和復雜智能體任務的成本,使過去因價格過高而無法落地的場景開始具備商業可行性。例如,一個企業可能過去每天只調用幾百萬Token,但在引入自動編程、自動研究、自動客服和多智能體工作流後,Token使用量可能增長數十倍。
K3發布後需求迅速超過月之暗面的現有算力容量。公司一度暫停新用戶訂閱,將算力優先提供給現有用戶,並表示正在加速擴容。這正是「模型更高效,但總算力需求反而上升」的現實案例。
結語:K3沖擊的不是GPU,而是模型公司的高利潤率
Kimi K3真正改變的,不是AI是否還需要算力,而是算力產生的智能將以什麼價格出售。
對於OpenAI、Anthropic等閉源模型公司而言,K3意味著競爭加劇、定價壓力上升,模型層的長期利潤率可能被重新評估。
但對於硬體產業鏈而言,K3傳遞出的信號並不悲觀。
線性注意力降低了KV Cache消耗,卻沒有改變大模型持續擴張的方向。2.8兆參數、896個專家、超過1.5TB模型權重以及64顆以上加速器的部署要求,都意味著前沿AI正在從單顆晶片競爭,升級為GPU、HBM、DDR5、記憶體與高速互聯組成的整套機架級系統競爭。
因此,K3更可能帶來一次AI價值鏈的重新分配:模型能力加速商品化,應用層獲得更低成本,而掌握GPU、內存、先進封裝和高速互聯的「賣鏟人」,仍然是算力擴張中最確定的受益者。
⚠️需要注意的是,截至7月20日,K3的完整模型權重和技術報告尚未正式發布,目前部分性能數據仍來自月之暗面的官方測試。它能否在第三方部署環境中維持相同的性能、成本和穩定性,仍需等待7月27日開放權重後的獨立驗證。 (牛牛課堂)
