更多Token、更多晶片!Kimi K3體現“傑文斯悖論”,效率提升反而增加資源消耗

花旗半導體分析師Peter Lee認為,Kimi K3觸發“傑文斯悖論”,即技術效率提升降低單位使用成本後,最終資源總消耗不降反升,伺服器DDR5和eSSD等通用記憶體需求仍會增加。美銀證券認為,更強的中國開源模型未必會讓美國AI巨頭削減算力投入,相反模型差距縮小會提高領先者維持優勢的成本。

Kimi K3把AI投資者重新帶回一個核心問題:模型更便宜、更高效,是否意味著晶片和記憶體需求下降?花旗和美銀證券的答案都偏向否定,效率提升可能釋放更多使用量,進而推高總資源消耗。

據追風交易台,月之暗面發佈的Kimi K3擁有2.8兆參數,面向100萬token上下文窗口和長周期智能體任務。花旗半導體分析師Peter Lee認為,即便Kimi K3被廣泛使用,伺服器DDR5和eSSD等通用記憶體需求仍會增加。

美銀證券半導體分析師Vivek Arya在7月17日的研究中也指出,美國前沿AI實驗室更可能增加算力投入,而不是減少投入。若中國開源模型持續逼近,OpenAI,Anthropic和Google等領先者需要用更大訓練規模,更重推理和更快產品迭代維持差異化。

這意味著市場對Kimi K3的定價邏輯,不能只看單次推理成本下降。更關鍵的是,低價模型是否帶來更多呼叫,更長任務鏈和更多token生成。若答案為是,GPU,HBM,DDR5,eSSD,高速網路和推理系統都可能繼續受益。


01

低價高性能,觸發“傑文斯悖論”

花旗將Kimi K3視為AI產業鏈中“傑文斯悖論”的潛在案例。該悖論的核心是,技術效率提升降低單位使用成本後,使用量可能大幅增加,最終資源總消耗不降反升。

Kimi K3的吸引力來自低成本與高性能組合。公開價格顯示,快取命中輸入價格為每百萬token 0.3美元,輸出價格為每百萬token 15美元。其完整權重計畫於7月27日披露,目標是支援長周期智能體工作。

花旗的判斷是,模型降價不會自動減少硬體需求。相反,低成本可能提高開發者和企業呼叫模型的意願,推動更多AI智能體部署。智能體任務並非一次性問答,而是在連續任務中不斷生成,讀取和處理token。呼叫次數和任務長度上升,會把單位成本下降重新轉化為總資源消耗。

因此,Kimi K3對半導體鏈條的影響,重點不在“單次呼叫是否更便宜”,而在“總token量是否擴大”。這正是花旗看好伺服器DDR5和eSSD需求的原因。


02

長上下文推理,把壓力傳導至記憶體

Kimi K3採用三項關鍵技術:Kimi Delta Attention,Attention Residuals和Stable LatentMoE。Kimi Delta Attention用於降低100萬token上下文窗口的成本,Attention Residuals用於在模型不同深度之間選擇性檢索表徵,Stable LatentMoE則提升稀疏化程度,每個token僅啟動896個專家中的16個。

月之暗面的技術資料稱,這套架構使Kimi K3的擴展效率達到K2的2.5倍。高稀疏度和長上下文能力,是其壓低運行成本的重要基礎。

但花旗強調,這並不等於推理端資源壓力消失。Kimi K3仍不是輕量級部署方案,其運行需要多節點叢集,超級節點配置超過64顆GPU。更重要的是,長上下文和智能體任務會推高KV Cache佔用,進而增加推理端記憶體負擔。

KV Cache需求直接關聯伺服器DDR5和eSSD。DDR5承擔高頻資料存取,eSSD受益於更大的快取和資料記憶體需求。對記憶體廠商而言,關鍵變數不是單個模型是否更省算力,而是低價之後模型被呼叫多少次,每次呼叫生成多少token,以及智能體任務鏈被拉多長。


03

模型逼近,反而抬高算力門檻

美銀證券的結論與花旗形成呼應,但關注點更偏向GPU和AI基礎設施。Vivek Arya認為,更強的中國開源模型未必會讓美國AI巨頭削減算力投入。相反,模型差距縮小會提高領先者維持優勢的成本。

美銀證券指出,如果開源模型持續逼近,OpenAI,Anthropic和Google需要依靠更大規模訓練,更多強化學習與合成資料循環,更重的測試時推理,以及更快的產品發佈節奏來守住差異化。

這套邏輯不取決於那一個模型短期領先。大模型排行榜可能快速輪換,但企業真正購買的是穩定,低延遲,高可用的AI輸出,以及更低的“每單位有效產出”成本。當模型能力趨同,競爭壓力會傳導至底層基礎設施,包括GPU,HBM,高速網路和推理系統。

因此,美銀證券認為,Kimi K3這類模型的出現,不應被簡單理解為“模型更高效,晶片更少”。更現實的路徑是,模型競爭加劇,領先者為了保持距離繼續加碼算力。


04

MoE架構改變瓶頸,視訊記憶體和互連更重要

Kimi K3採用MoE架構,意味著總參數量和每次推理實際啟動的參數可以分離。這一變化降低了部分計算壓力,但也讓基礎設施瓶頸從單純算力,轉向視訊記憶體訪問,專家路由,響應延遲和互連能力。

美銀證券強調,MoE推理要求系統更高效地搬運資料,調度專家模組,並連接更大的計算叢集。輝達提出,現代MoE推理需要更大的GPU域。其測算顯示,GB300 NVL72在領先開源模型上的每瓦性能,最高可達到Hopper平台的25倍。

CoreWeave圍繞Kimi K2.6的測試也說明,開源MoE模型即使每次只啟動部分參數,若要在速度和性價比上保持領先,仍需要經過最佳化的輝達GB300/GB200 NVL72基礎設施。

這意味著,模型權重可能逐步商品化,但運行模型所需的GPU,高頻寬記憶體,網路互連和推理系統不會失去價值。相反,隨著模型呼叫量擴大,這些環節可能成為競爭更集中的地方。


05

Token使用仍在擴張,需求端尚未見頂

美銀證券還引用OpenRouter資料指出,模型呼叫量仍在快速增加。作為連接多家模型實驗室的第三方API平台,OpenRouter上的token使用量持續增長,其中中國AI實驗室模型的token使用量已經超過非中國實驗室模型。

這一資料不能直接代表所有企業和消費者場景,但它至少顯示,開發者在開放模型生態中的選擇正在變化。模型價格下降和能力提升,可能推動呼叫量繼續擴張,而不是被單一模型的效率提升抵消。

企業付費使用也在增加。Ramp資料顯示,截至2026年6月,約55%的美國企業已付費訂閱AI模型,平台或工具,高於美國人口普查局BTOS調查的21%估計。按模型看,Anthropic企業採用率為42.4%,OpenAI為39.5%。

不過,AI支出仍高度集中。頭部1%的企業使用者,平均每名員工每月AI支出約4833美元,前10%為516美元,整體中位數僅為11美元。科技與媒體行業訂閱率達到79.8%,大型企業採用率為65.5%,高於中型企業的61.3%和小型企業的48.7%。

這組資料支援一個判斷:AI使用仍處於擴散過程中。若低價模型降低進入門檻,未來增量需求可能來自更多企業,更多開發者和更多智能體應用。


06

從“更省算力”轉向“更多工作負載”

花旗和美銀證券的共同結論是,Kimi K3的意義不在於單一模型是否降低單位推理成本,而在於低成本是否釋放更大規模的工作負載。

對花旗而言,最直接的受益方向是伺服器DDR5和eSSD。長上下文,KV Cache和智能體任務會提高記憶體訪問與記憶體需求。對美銀證券而言,更重要的是GPU,HBM,高速網路和推理系統,因為模型競爭會迫使領先者繼續投入基礎設施。

美銀證券還提到,Kimi K3涉及“45奈米開源EDA”不應被簡單解讀為商業EDA被替代。相反,這表明晶片設計仍離不開EDA工具。在先進製程上,Cadence和Synopsys等商業EDA廠商仍處於關鍵位置。 (硬AI)