9月,輝達連續釋放兩個明確訊號:Vera Rubin NVL72已進入全面生產,面向低延遲推理的Groq 3 LPX也已投產;最新MLPerf測試中,Vera Rubin NVL72在部分推理任務上的吞吐量達到GB300 NVL72的3.7倍。
輝達講述AI生意的口徑也隨之發生改變,關注點從訓練出多少參數,轉向每兆瓦能夠生產多少Token、服務多少使用者、產生多少收入。這個變化很現實。訓練是一筆階段性資本開支,推理卻伴隨每次提問、每輪程式碼生成和每個Agent任務持續發生。
模型進入企業流程後,呼叫次數、上下文長度與響應速度不僅共同決定了算力消耗,也決定了整個產業鏈的利潤分配。接下來需要研究的更多的是誰能讓Token生產得更快、更便宜,並把這些Token轉化為企業收入。
輝達正在把一次性賣晶片,
改造成持續生產Token的生意
2027財年第二季度,公司實現營收962億美元,同比增長106%;其中資料中心收入890億美元,同比增長117%,佔公司收入超過九成。公司給出的下一季度營收指引達到1080億美元,而且沒有計入中國資料中心計算收入。
輝達給出的最新財報增長十分迅猛,在高增長背後,輝達對自身商業模式的描述已經發生變化。黃仁勳在財報中直接表示,Token正在產生生產力與利潤,計算本身正在成為收入,該表達精準地概括了推理生意的特點。
模型訓練完成不代表成本結束,一次普通問答只消耗有限Token,但Agent需要閱讀資料、呼叫工具、反覆推理、檢查結果,還可能拆出多個子任務。輝達披露,Agent類工作負載的Token消耗量最高可達傳統AI應用的15倍。也就是說,應用越複雜,模型呼叫越頻繁,基礎設施的收入能見度反而越高。
Vera Rubin NVL72負責高頻寬、大模型與複雜計算,LPX依靠SRAM提供確定性的低延遲Token生成,兩類晶片共同處理推理中的預填充和解碼環節。每個LPX機架包含256顆LPU,輝達公佈的測試資料顯示,在長上下文、超大參數模型場景中,Vera Rubin配合LPX的每兆瓦Token吞吐量最高可達到GB200 NVL72的35倍。不過,該資料是在特定模型和測試條件下的,因此更適合用來觀察架構方向,不能直接等同於所有生產環境的實際收益。
相比之下,更有說服力的是標準化測試。Vera Rubin NVL72在MLPerf Inference 6.1首次亮相,對Qwen3-VL的吞吐量最高達到GB300 NVL72的3.7倍,對DeepSeek-R1最高達到2.5倍;四個GB300 NVL72機架組成的288 GPU叢集實現了99%的擴展效率,軟體最佳化又將部分任務性能提高至上一版本的1.6倍。以上資料更好地講清楚了輝達的護城河。
當前行業內競爭已經超出單顆GPU性能,客戶採購的是晶片、互聯、推理框架、調度軟體和電力管理共同構成的生產系統。輝達希望控制的也不止算力入口,還包括Token的生產流程和成本結構。
Inference擴張後,
利潤會沿著網路、電力和整機向外溢出
推理規模擴大,並等同於產業利潤全部留在GPU廠商手裡。Agent對延遲非常敏感,一個任務可能跨越多台伺服器、多個模型和多個資料庫,只要網路、記憶體、電力或散熱出現瓶頸,昂貴的GPU就只能等待。Inference產業鏈由此形成了一種很有意思的局面:計算晶片決定上限,外圍基礎設施決定利用率。
AMD是輝達最直接的挑戰者。財報顯示,2026年第二季度,AMD資料中心收入達到67億美元,同比增長107%,EPYC處理器和Instinct GPU同時貢獻增長。AMD近期還披露,MI350系列在512 GPU規模下實現每秒575萬個Token的MLPerf推理成績。
AMD的主要機會來自客戶對第二供應源、開放軟體棧和採購議價權的需求;至於壓力,仍在ROCm生態、系統交付能力以及大規模部署的穩定性方面。硬體性能可以追趕,軟體遷移成本和開發者習慣要慢得多。
Broadcom、Marvell和Arista的機會則來自定製晶片與資料搬運需求。Broadcom第三財季AI半導體收入達到167億美元,同比增長221%,定製加速器與網路業務已經成為增長主軸;Marvell第二財季營收27.39億美元,同比增長37%,AI資料中心連接需求繼續推高訂單;Arista第二季度收入30.36億美元,同比增長37.7%,同時推出面向AI叢集的1.6Tbps網路平台。
這一層的投資判斷很直接:推理量增長會增加資料在晶片、機架和資料中心之間往返的頻率,網路晶片、交換機和光連接的重要性也會隨之提升。
不過,基於Broadcom與Marvell同時受益於雲廠商自研ASIC,會分走通用GPU的部分工作負載。輝達用NVLink、Spectrum-X以及對外開放的NVLink Fusion回應這種壓力,目的就是讓定製晶片即使進入機房,也儘量留在輝達定義的互聯體系內。
Dell在2027財年第二季度實現AI最佳化伺服器收入164億美元,期末相關訂單積壓達到950億美元;HPE最新季度Cloud & AI收入90億美元,同比增長25.4%,AI系統訂單環比增長超過30%。
可見伺服器廠商的增長已從概念進入交付、收入與訂單能見度階段。電力與整機正在成為另一條更容易兌現的主線。
電力裝置公司的變化更有衝擊力。Vertiv第二季度銷售額32.74億美元,同比增長24%;Generac近期與亞馬遜簽署約24億美元的資料中心備用發電機供應協議,若後續採購全部兌現,相關支出最高可達80億美元。
以上多個訂單足以說明,推理需求最後都會落到一條物理約束上:電從那裡來,熱怎麼排出去,伺服器能否穩定運行。輝達推出DSX MaxLPS,正是在爭奪這部分價值。
Lambda的部署測試顯示,在相同電力預算下,相關軟體將叢集Token吞吐量從約每秒400萬個提高到500萬個,增幅24%。AI基礎設施的比較單位正在從GPU數量轉向每兆瓦產出,VRT、ETN、GNRC等公司因此獲得了更長的訂單周期,也獲得了重新審視業務結構的機會。
推理最大的贏家,
可能要等企業帳單出來才知道
Inference產業鏈很容易把Token增長簡單換算成所有公司同步增長,實際上儘管算力需求會擴大,利潤分配卻可能更加殘酷。因為模型價格下降、晶片效率提升、雲廠商自研ASIC、客戶壓縮推理成本,都可能讓Token數量與收入增長出現背離。
供應商最終要回答的是,同樣一度電和一台伺服器,究竟能完成多少有價值的任務。SNOW、PLTR、NOW和CRM處在這場檢驗的前端。
資料顯示,Snowflake最新季度產品收入14.9億美元,同比增長37%,管理層稱AI產品貢獻了近期增長加速的大約一半;Palantir第二季度收入同比增長93%至19.4億美元。Salesforce則在Dreamforce發佈基於輝達Nemotron訓練的CRM推理模型Koa,並將其運行在自有基礎設施中。
真正能決定整條產業鏈能走多遠的應用層。企業願意持續購買Token,前提是Agent能夠縮短銷售周期、提高研發效率、減少人工操作,或者直接創造收入。呼叫量很大、業務回報模糊的項目,遲早會被財務部門砍掉;能夠進入生產流程、掌握企業資料和客戶關係的軟體平台,才可能把算力成本變成持續收費。
所以,輝達仍然是Inference擴張中確定性最高的受益者,其有著計算、網路、軟體和系統協同等多方面的優勢;Broadcom、Marvell與Arista可以分享定製計算和資料連接的增量;Dell、HPE、Vertiv、Eaton與Generac則承接機房落地和電力擴容;Snowflake、Palantir、ServiceNow與Salesforce負責證明這些Token確實能夠賺錢。 (財報研究社Pro)
