Kimi K3最近大火,美國科技圈的一些人開始反思:為什麼楊植麟卡內基梅隆博士畢業後,不留在美國創業?
作為年度最強開源模型,Kimi K3的參數量達到了3T等級,並在各大基準測試中“屠榜”,一部分榜單表現甚至超越Fable 5這種美國實驗室的最前沿模型。
在算力不足的情況下,通過演算法、工程的最佳化,疊加參數的擴展,不僅追上前沿閉源模型的性能,打破Scaling Law“撞牆”一說,甚至還引發了一部分矽谷巨頭的焦慮與恐慌。
OpenAI戰略負責人迪恩·W·鮑爾說:“開源模型會阻礙人工智慧領域的進一步資本支出。”
這不難理解,大家都在探索AGI,你來做的話需要10塊錢,而別人只需要1塊。那麼,你就需要論證多出來的9塊錢的必要性、合理性。對於年度資本開支7000億美元的矽谷巨頭來說,如果答案是否定的,人工智慧產業將迎來一輪史無前例的“泡沫破裂”。
不過,“攪局”的同時,Kimi很快遇到了自己的第一個難題:算力焦慮。
01
一封充滿算力焦慮的信
7月19日晚間,Kimi發通知信暫停新使用者接入,暫時性關上了新使用者體驗Kimi K3的通道。
通知信大意是:熱度高、需求超預期、存量算力不夠且逼近極限。不得不暫停C端新使用者訂閱,將已有算力分配給存量使用者,直至新算力到位再陸續開放更多訂閱名額。
“暫停”增量使用者接入與“Token Plan”限售,雖然都源於算力緊缺,但二者略有不同。
過去,中國模型推理算力不夠,通過“Token Plan”限售的方式開一個口子提供服務,起碼意味著有供給空間,也能夠在後續通過API接入轉化重度使用者。直接“暫停”接入,把增量使用者拒之門外,意味著算力供給上沒有任何騰挪的空間,可見現階段Kimi的算力緊缺程度。
“它自己的算力都沒法批次獲取,現在這麼多使用者想用都沒法開通付費帳戶,這嚴重影響商業變現和使用者口碑。”一位資深科技投資人說。
長期關注中國科技產業發展的上海財經大學教授胡延平認為,Kimi暫停新使用者接入的原因是算力準備不足,而非ROI沒有轉正。“因為算力約束,接不住潑天的使用者,目前比ROI轉正更重要的是接住使用者。”
關於ROI的問題,胡延平認為只從“算力/token”來看問題,有可能出現使用者token消耗越多虧損越大的情況,只有從“算力成本效率/token”來分析,才能看清算力約束的真實涵義。
“類似Kimi接不住使用者這種情況,除了需要有更合理的資費、更多的算力卡,更重要的是要有能效比、量效比更高的算力卡和算力叢集。”一位接近Kimi的知情人士透露,暫停新會員訂閱後,找算力成為他們的頭號任務。
“我們已經在非常努力地通過模型性能的最佳化和算力供給來解決問題。”Kimi企業業務負責人黃震昕日前在溝通會上說。
Kimi在尋找算力的同時,智譜1GW純中國國產算力的消息卻被釋放出來。這也引發多位中國國產算力從業者的討論,核心在於智譜從那裡能夠獲得如此天量規模的算力。
以剛剛在2026世界人工智慧大會(WAIC)上亮相的華為昇騰Atlas 950超節點為例,僅按64卡機櫃100KW功耗上限來換算,不考慮交換等裝置,1GW相當於10000個Atlas 950機櫃,即640000張NPU。再假設單卡價格是20萬元,整個1GW的訂單,僅算力部分就將超過1200億元。
即便考慮中國國產卡價格差異,按照平均單價10萬元算,1GW純中國國產算力,也將是一筆超600億元的算力大單。若消息精準,對中國國產算力來說將是一個巨大利多。
02
先找路,再找錢
“從目前披露的資訊看,K3暫未呈現出範式級的全新架構。”期智研究院研究員李彪告訴騰訊科技。
KDA和AttnRes此前已有論文,本次更值得關注的是將這些模組與極稀疏MoE、低精度訓練和大規模平行系統整合,並擴展到2.8兆參數。 “由於K3完整技術報告尚未發佈,目前仍難以評估其全部技術增量。”李彪補充說。
《Kimi K3不是中國的Fable 5》一文中提到,KDA讓序列計算更便宜,AttnRes讓深度資訊流更智能,Stable LatentMoE讓參數容量更龐大——三者共同構成了Kimi K3的架構骨架。算得更省、流得更順、裝得更多,共同成就了2.8兆參數的Kimi K3,以及它在開源生態和整個大模型領域的影響力。
“Kimi K3 再次說明‘size still matters’。”李彪強調說。
他認為,模型規模仍是提升前沿能力的重要變數,但規模能否有效轉化為能力,取決於架構、資料配比、最佳化方法和基礎設施的共同配合。“對於2.8兆參數的極稀疏MoE模型,當前更顯性的工程約束來自功耗、通訊開銷、專家負載平衡和叢集可靠性。從其能夠支撐2.8兆參數MoE訓練來看,Kimi應該在底層Infra上做了不錯的最佳化。”
另一位學術研究員也認同訓練過程中Infra、工程能力的重要性,“大家思路都大差不差,歸根結底變成軟體工程了。”
前述科技投資人告訴騰訊科技,中國公司再一次在較短時間內把開源模型推到接近全球閉源旗艦模型的水平,“我覺得還是非常厲害。它給我的衝擊是Scaling Law還在繼續;當前最前沿的模型訓練配方,中國公司也可以快速掌握。”
如果把上述研究員、有投資人的觀點綜合到一起,可以歸結為:Kimi通過Infra、工程的手段,找到了一條持續Scaling Law的路,這不僅是Kimi自己的路,也是中國開源模型生態的路。
所以,Kimi K3亮相後不久,2.4兆參數的Qwen 3.8預覽版也宣佈上線了。
當可靠的Scaling Law路徑有了,剩下就是找錢的問題。
在一級市場,過去半年Kimi一直是“當紅炸子雞”,融資相關的傳聞不斷。根據外媒披露的資料,Kimi計畫8月啟動上市前最後一輪融資談判,目標估值為500億美元。這相當於DeepSeek的上一輪融資完成後的估值。同期,Kimi也拆VIE架構,加速赴港上市流程,衝擊繼智譜、MiniMax之後在港股上市的“大模型第三股”。
如果時間倒退至2025年12月31日,彼時楊植麟發內部信確認完成了5億美元的C輪融資。
“當前現金持有量超過100億元。相比於二級市場,我們判斷還可以從一級市場募集更大量資金,事實上,我們B/C輪融資金額就超過絕大部分IPO募資及上市公司的定向增發。所以我們短期不著急上市。”楊植麟在內部信中說。
資料顯示,Kimi的C輪完成後,投後估值43億美元,對比外媒報導最新的Pre-IPO輪500億美元估值,半年漲幅近12倍。
半年之前,楊植麟判斷可以從一級市場拿到更多的錢,這個點後續被時間驗證了,但100億元的現金在7個月之後,在Kimi K3被迫暫停新使用者接入之後來看,顯然不夠用。
03
中國晶片的第二場戰爭
“Kimi K3目前證明的是技術能力進入前沿,還沒有完全證明推理經濟性、產品體驗和商業模式同樣成立。”前述科技投資人說。
根據Artifacial Analysis的“智能指數”評測,Kimi K3在全部9項測試中總共產生了約1.3億個輸出Token,高吞吐量導致跑完整套評測的總帳單高達2709.75美元。相比之下,同類參評模型的中位數僅為6300萬個。
拆分成單一任務,Kimi K3的平均花費僅為0.94美元,GPT-5.6 Sol為1.04美元,Claude Opus 4.8為1.8美元。
單看定價,Kimi K3的token已經不便宜了。而Kimi自身關於這個問題的解釋是:中國開源模型不應該被貼上性價比標籤,SOTA模型應該有自己的定價權。
不過,對於使用者而言,追逐性價比就是追逐更高經濟性。放在Kimi K3身上,如果Token輸出量壓縮一半,那麼成本也就對應會壓縮一半。這與胡延平教授提出的量效比高度一致。
他說,如果不考慮量效比,長期競爭會是問題,“某些時間點會出現token不經濟”。
胡延平以輝達為例,強調在H200上,token的ROI下可能是虧的,但升級為B300可能分分秒秒都是“印鈔機”。這其實給中國國產算力提出了一個新的要求,既要給中國國產模型保證算力供給,也要在硬體層面釋放token的經濟性。
SemiAnalysis 5月份報告顯示,在MiniMax-M2.5的8K/1K負載下,B200 NVFP4憑藉硬體與核心最佳化,在高吞吐互動下(單使用者速度提升至110 tok/s/user),每百萬token為0.09美元。作為對比,H100 FP8在統一的條件下,每百萬token 0.74美元,實現了超過8倍的每美元性能提升(性價比)。
高互動負載下,B200 NVFP4 較 H100 FP8 運行Minimax 2.5成本對比
關於中國國產算力的進化,今年的世界人工智慧大會(WAIC)出現了一些比較好的趨勢。最典型的就是2025年的華為CloudMatrix 384和2026年的Atlas 950兩代超節點的進化——單櫃從32卡到64卡,計算密度翻倍;計算櫃也從12個增至16個。機櫃內部採用高密度銅纜電互聯,機櫃間採用全光互聯,從支援千億參數模型的訓練,擴展至兆參數模型的低精度訓練和混合推理。
這種變化,不去現場看,不做對比,很難直觀地感受到差異。
《2026,中國晶片為中國國產模型“托底”》裡提到了中國國產算力進化背後的一些花絮,其中最具代表性的是中國國產算力從業者都表現出了不同程度的喜悅、開心,這裡面有幾個原因:公司上市,很大一部分員工獲得了股權激勵;同時,市場開始為中國晶片重新定價,逐步放大這種財富效應。
如果說上市是中國晶片的第一場戰爭,那麼接住中國國產大模型的需求,為其token成本托底,將成為關鍵的第二戰。 (騰訊科技)
