半導體研究機構SemiAnalysis高度評價輝達在vLLM推理引擎上的性能最佳化,同時指出AMD在部分模型支援上仍有明顯差距。輝達憑藉二十年CUDA積累、主流框架優先適配及TensorRT等最佳化庫建構的軟體壁壘,在推理時代仍形成持久競爭優勢。
一、綜述:一次戲劇性的敘事反轉
7月13日,半導體研究機構SemiAnalysis在社交平台發佈推文,高度評價輝達在vLLM推理引擎上的性能最佳化成果,同時明確指出AMD在部分模型的vLLM支援上仍有較大追趕空間。
這一評價之所以值得關注,恰恰在於僅僅兩周前,同一機構剛剛指出輝達的"CUDA護城河正遭緩慢侵蝕",認為超大規模雲廠商和AI模型公司採用自研ASIC的趨勢正在動搖輝達的統治地位。從"CUDA神話鬆動"到"點贊vLLM",SemiAnalysis在短短兩周內完成了對輝達競爭力的重新評估。
這兩則判斷共同將AI晶片競爭的焦點從"誰的硬體更強"拉回到一個更根本的問題:在推理時代的規模化部署中,軟體生態的深度可能比單代GPU的硬體領先更具決定性。
二、深度剖析:從"硬體競賽"到"軟體護城河"
1. vLLM:衡量AI晶片真實性能的關鍵戰場
vLLM是當前大語言模型推理領域應用最廣泛的開源引擎。SemiAnalysis選擇vLLM作為評判基準,本身就傳遞了一個重要判斷:開源推理生態正在成為衡量AI晶片真實性能的關鍵戰場。
vLLM本身並非輝達的私有工具——它是一個開放原始碼專案,理論上任何硬體廠商都可以參與最佳化和支援。然而在實際運行中,輝達與AMD在vLLM上的表現差距懸殊,這恰恰揭示了軟體生態壁壘的實質。
2. 具體差距:12,000 token/s vs AMD的"力不從心"
差距在以Kimi K2.5為代表的千億參數級混合專家(MoE)模型上尤為突出。
輝達方面,GB200 NVL72通過機架級NVLink將72張GPU高速互聯,支援寬專家平行(Wide EP)達8至16的規模。這一架構使每張GPU承載的專家權重大幅減少,HBM頻寬壓力隨之降低,All-to-All通訊在高速NVLink域內完成,而非經由較慢的InfiniBand網路。最終每GPU吞吐量可達12,000 token/s以上。
在軟體層面,輝達推出的Dynamo分佈式推理框架將vLLM深度整合,專門針對MoE模型實現了預填充與解碼分離(Disaggregated Serving)、高效KV快取傳輸以及雙批次重疊等最佳化。
AMD方面,MI355X在同一測試中表現明顯遜色,主要原因在於其難以實現同等規模的專家平行與機架級互聯。在軟體層面,AMD目前仍主要依賴標準vLLM與DISAGG版本,針對超大MoE模型與寬平行場景的深度最佳化尚未跟上。
3. "部分模型"措辭背後的深刻含義
SemiAnalysis將AMD的落後限定在"部分模型"上,這一措辭包含兩層資訊:
第一,AMD並非全面落後。 在通用計算場景中,其MI系列GPU已具備一定競爭力,Meta近期簽署的巨額採購訂單也驗證了這一點。
第二,"部分"這一限定恰恰凸顯了差距的實質——全面性軟體生態覆蓋的缺失。在AI推理場景中,企業客戶追求的是穩定、可預期的部署體驗。維護兩套軟體棧以覆蓋不同模型的成本,往往是決策時的決定性因素。
對每天運行數十億次推理呼叫的AI企業而言,"部分模型支援良好"與"所有模型穩定最佳化"之間的鴻溝,在規模效應下會被急劇放大。
4. 輝達的軟體護城河:三層結構
SemiAnalysis的評估明確指出,輝達的軟體生態建立在三個層面之上:
這些層面形成的切換成本,超過任何單一硬體規格優勢。AMD要完成從"部分領先"到"全面可用"的跨越,所需的軟體工程投入可能比硬體迭代更為耗時——這不僅是寫更多驅動和適配層的問題,而是要在數以千計的模型架構、不斷演進的開源框架以及分散的開發者社區中建立廣泛的相容性和信任。
5. 推理時代:軟體護城河的結構性重估
當AI產業重心從訓練向推理遷移,軟硬體的戰略價值正在發生結構性重估:
- 訓練:任務集中、可控,硬體性能差距可憑資本投入彌補
- 推理:分佈式、持續性,微秒級延遲差異在每天數十億次呼叫中被成倍放大,直接轉化為成本結構的分化
更重要的是,輝達面臨的真正競爭並非來自AMD,而是來自超大規模雲廠商的自研ASIC——Google的TPU、Amazon的Trainium等。Broadcom和Marvell設計的定製AI加速器,每吉瓦基礎設施成本約60-110億美元,而輝達GB300方案約190億美元。摩根士丹利預計,四大超大規模雲廠商明年將在AI基礎設施上投入超1兆美元。
SemiAnalysis的最新評估表明,儘管硬體競爭日趨激烈,輝達在推理軟體棧上的積累深度並未同步縮小。
三、投資分析:機會、風險與策略啟示
機會面
1. 輝達的軟體護城河正在被重新定價。 市場此前對輝達的擔憂集中在硬體競爭和ASIC侵蝕,但SemiAnalysis的最新評估提醒投資者:在推理時代,軟體生態可能是比硬體更持久的壁壘。這一認知可能推動輝達估值的結構性重估。
2. AI推理需求爆發式增長。 vLLM性能最佳化的背後是推理工作量的指數級增長。摩根士丹利預計四大雲廠商明年AI基礎設施投入超1兆美元。輝達作為推理軟體棧的領導者,將直接受益於這一趨勢。
3. AMD的追趕空間也是投資機會。 AMD股價年初至今已上漲160%至557.89美元。如果AMD能在軟體生態上加速追趕,其在推理市場的份額提升將帶來顯著上行空間。vLLM社區近期已加入原生AMD GPU W4A16量化核心,使AMD成為與NVIDIA CUDA並列的一級推理目標。
風險面
1. ASIC侵蝕推理份額的結構性趨勢未變。 SemiAnalysis兩周前指出的"CUDA護城河遭侵蝕"邏輯依然成立——Google、Amazon、Microsoft等巨頭自研晶片的長期趨勢不會因為一篇推文而改變。
2. AMD的追趕是時間問題而非能否問題。 vLLM是開放原始碼專案,理論上AMD可以通過持續的工程投入逐步縮小差距。vLLM的AMD測試套件通過率在2026年1月已達93%。雖然從"93%通過"到"全面穩定最佳化"仍有距離,但方向是明確的。
3. 輝達的高估值已包含大量樂觀預期。 與蘋果類似,輝達的估值同樣處於歷史高位。任何軟體護城河被侵蝕的邊際訊號——無論是ASIC的進一步滲透,還是AMD在vLLM上的突破——都可能引發估值回呼。
四、總結和展望
SemiAnalysis的戲劇性敘事反轉——從"CUDA神話鬆動"到"點贊vLLM"——揭示了一個容易被忽視的真相:在AI推理時代,輝達最深的護城河不是硬體,而是軟體。
vLLM的性能差距(12,000 token/s vs AMD的明顯遜色)表面上是技術問題,實質上是生態問題。二十年CUDA積累、四百萬開發者、全框架優先適配——這些構成的切換成本,遠高於任何一代GPU的硬體優勢。
然而,這並不意味著輝達可以高枕無憂。真正的威脅來自兩個方向:自研ASIC對推理份額的長期侵蝕,以及AMD在開源生態中的持續追趕。vLLM的AMD測試套件通過率已達93%,從"93%"到"100%",再到"深度最佳化",只是時間與投入的問題。
對於投資者而言,SemiAnalysis的這一評價提供了重新審視AI晶片競爭格局的契機:在推理時代,軟體生態的深度可能比硬體參數更具決定性。理解這一範式轉換,比追蹤任何單一季度的業績資料都更為重要。 (invest wallstreet)
