過去幾年,“AI等於GPU”幾乎成了一條鐵律。輝達的晶片供不應求,價格一路飆升,超大規模資料中心為了搶到足夠多的顯示卡不惜一擲千金。
但一個趨勢正在悄然轉變——AI資料中心的焦點,正從單一的GPU叢集,轉向由CPU、GPU、NPU、光學互連和定製加速器組成的異構計算叢集。
推理流水線的“解構”
Arm雲與AI基礎設施晶片全球負責人Satadal Bhattacharjee指出,推理流水線解構將成為未來的常態。
推理大致分為幾個階段。首先是預填充(prefill) 階段——使用者輸入提示詞,系統理解使用者意圖。這一階段計算極其密集,需要瞬時處理海量提示詞。輝達在GTC 2026上宣佈將Groq 3 LPU(語言處理單元)用於預填充叢集。其次是解碼(decode) 階段——系統逐Token生成響應內容,對記憶體頻寬和延遲極為敏感。然後是工具呼叫(tool calling) 階段——AI代理執行具體任務,比如預訂網約車或酒店。
現在,業界正將這些階段分開處理:一個叢集負責預填充,一個叢集負責解碼,再一個叢集負責代理執行,每個叢集都採用最適合該任務的軟硬體組合,通過乙太網路等互連技術拼接在一起。
輝達通過名為Dynamo的軟體,實現了“解耦推理”——將AI推理的預填充和注意力部分交由Rubin GPU處理,而將解碼部分解除安裝給Groq LPU以降低延遲。
這一趨勢正在加速落地。
雲天勵飛在2026世界人工智慧大會上發佈了針對推理Prefill、Decode、Decode FFN三類差異化負載的三款專用晶片,適配萬卡異構叢集分離式協同部署。無問芯穹發佈的PDD跨叢集異構推理架構,實測可實現首Token延遲降低51.5%、單Token成本降低37.5%。
CPU的新角色:從“資料搬運工”到“編排者”
在AI資料中心中,CPU的角色正在被重新定義。
西門子EDA產品負責人Sathishkumar Balasubramanian指出:“CPU以前主要用於輸入資料並將其載入到不同的GPU中。現在這個用途正在從資料載入器轉變為資料編排器。整個編排層都由CPU處理”。
Arm的Bhattacharjee進一步解釋:“隨著AI系統變得更加複雜,CPU正在成為持續運行的智能循環的編排和執行引擎,管理上下文、工具呼叫、記憶體移動、安全邊界和加速器利用”。
英特爾公司副總裁宋繼強也指出,以CPU為核心、配合GPU、NPU、IPU、AI加速器等多類晶片的異構算力架構,正在成為支撐智能體AI的長期方向。複雜的推理循環、上下文維護、分支指令路由等難以平行化的任務,正越來越多地由CPU承擔。而加速器(不一定是GPU,也可以是定製ASIC)則專注於矩陣乘法等計算密集型任務。
經濟帳:Token成本的競爭
這一切變化的根本驅動力,是Token的成本。
在邊緣端,一次只處理幾個請求,故事很簡單。但在資料中心層面,目標是在API層面最大化整體利用率,關鍵是每秒處理多少個請求。
Expedera首席科學家Sharad Chole指出:“隨著模型規模持續膨脹,記憶體已經成為和計算繫結的核心瓶頸。HBM的成本與利用效率,也就成為GPU的關鍵影響因素”。
無問芯穹的PDD架構通過跨叢集異構推理,實現了單Token成本降低37.5%。商湯大裝置通過異構混合推理,將主流國產晶片的MFU提升85%至152%,整體推理性價比已達輝達H系列的1.25倍,同成本Token產出規模擴大2.5倍。
異構計算和推理流水線解構,最終都是為了一個目標——在保證性能的前提下,降低每個Token的處理成本。
軟體:從“輔助”到“核心”
在異構叢集環境中,軟體扮演的角色正在從輔助工具升級為核心競爭力。
當不存在單一廠商掌控端到端全流程時,軟體就成為挖掘異構硬體能力、完成跨叢集最佳化的關鍵。
西門子EDA的Cameron Brunner指出:“硬體廠商與大型系統整合商正在研發叢集網路組網方案。軟體則負責調度工作負載,最大化利用互連資源”。
超大規模雲服務商已經將這類理念做了大量落地實踐。多數雲廠商都有放置組(placement group)的概念,把虛擬機器集中部署,讓虛擬機器之間享有高速互連。
但跨機器擴展依然是巨大難題。Brunner坦言:“當應用跨多台伺服器運行,想要獲得接近線性的性能擴展,實現難度很高”。
多元平行:一種範式解決不了所有問題
計算叢集中的平行計算,遠比想像中複雜。
Chole指出,計算叢集存在多種平行範式:張量平行、資料平行、上下文平行、流水線平行,每一種範式對網路拓撲的要求各不相同。
流水線平行是點對點傳輸;張量平行依賴全歸約運算,之後再做廣播。在叢集規劃階段必須充分考慮這些差異。“正因如此,如果要做張量平行規模擴展,NVLink就至關重要;記憶體、記憶體傳輸也面臨類似約束”。
如何從單GPU擴展到8卡,同時接近8倍性能,始終是行業難題。
客戶已經用腳投票
DigitalOcean已宣佈部署了五層推理架構,專門針對異構叢集進行最佳化,明確整合AMD與輝達的產品。其AI原生雲平台從矽到智能體整合了五個層級。
Anthropic也正式組建了內部晶片團隊,為Claude大模型量身打造定製化AI晶片。Anthropic組建晶片團隊,意味著大模型公司自研晶片不再是個案,行業正從集中採購輝達GPU向多元晶片架構演進。
輝達也“親自下場”,推出了從零建構、專為智能體打造的Vera CPU。英特爾與SambaNova聯合推出異構推理架構,將AI推理任務分為三層:GPU負責預填充、SambaNova可重配置資料流單元負責解碼、英特爾至強6 CPU負責智能體任務編排與執行。
結語
AI資料中心正在經歷一場深刻的架構變革。從“GPU萬能”到“異構計算”,從“單體部署”到“推理解構”,從“專有互連”到“標準化”——每一個變化都在指向同一個方向:用最合適的工具,解決最合適的問題,以最低的成本,交付最好的結果。
異構算力架構正在從“CPU+GPU”為主向“CPU+GPU+XPU”多元發展路線演進,這已成為智能算力時代的主流技術範式。
輝達不會消失,但它將不再是唯一的答案。正如西門子EDA的Brunner所說,業務將驅動最高效的解決方案。而那個“最高效的解決方案”,正變得越來越多元、越來越有趣。(觀芯IC)
