首Token延遲降51.5%、成本降37.5%:AI推理“解構”之後,效果驚人

AI速讀
AI 算力市場正告別「GPU 萬能」時代,進入「異構計算」新階段。產業趨勢將 AI 推理過程解構,針對預填充與解碼等不同階段配置專屬晶片(如 GPU 處理預填充、LPU 處理解碼),使首 Token 延遲最高降低 51.5%、成本降低 37.5%。CPU 則升級為系統編排者。隨著 Anthropic 等大模型公司自研晶片以及 NVIDIA 推出 Vera CPU,多元晶片架構已成為降低 Token 成本、提升能效的必然選擇,計算格局正由單一壟斷轉向多元協作。

過去幾年,“AI等於GPU”幾乎成了一條鐵律。輝達的晶片供不應求,價格一路飆升,超大規模資料中心為了搶到足夠多的顯示卡不惜一擲千金。

但一個趨勢正在悄然轉變——AI資料中心的焦點,正從單一的GPU叢集,轉向由CPU、GPU、NPU、光學互連和定製加速器組成的異構計算叢集。

推理流水線的“解構”

Arm雲與AI基礎設施晶片全球負責人Satadal Bhattacharjee指出,推理流水線解構將成為未來的常態。

推理大致分為幾個階段。首先是預填充(prefill) 階段——使用者輸入提示詞,系統理解使用者意圖。這一階段計算極其密集,需要瞬時處理海量提示詞。輝達在GTC 2026上宣佈將Groq 3 LPU(語言處理單元)用於預填充叢集。其次是解碼(decode) 階段——系統逐Token生成響應內容,對記憶體頻寬和延遲極為敏感。然後是工具呼叫(tool calling) 階段——AI代理執行具體任務,比如預訂網約車或酒店。

現在,業界正將這些階段分開處理:一個叢集負責預填充,一個叢集負責解碼,再一個叢集負責代理執行,每個叢集都採用最適合該任務的軟硬體組合,通過乙太網路等互連技術拼接在一起。

輝達通過名為Dynamo的軟體,實現了“解耦推理”——將AI推理的預填充和注意力部分交由Rubin GPU處理,而將解碼部分解除安裝給Groq LPU以降低延遲。

這一趨勢正在加速落地。

雲天勵飛在2026世界人工智慧大會上發佈了針對推理Prefill、Decode、Decode FFN三類差異化負載的三款專用晶片,適配萬卡異構叢集分離式協同部署。無問芯穹發佈的PDD跨叢集異構推理架構,實測可實現首Token延遲降低51.5%、單Token成本降低37.5%。

CPU的新角色:從“資料搬運工”到“編排者”

在AI資料中心中,CPU的角色正在被重新定義。

西門子EDA產品負責人Sathishkumar Balasubramanian指出:“CPU以前主要用於輸入資料並將其載入到不同的GPU中。現在這個用途正在從資料載入器轉變為資料編排器。整個編排層都由CPU處理”。

Arm的Bhattacharjee進一步解釋:“隨著AI系統變得更加複雜,CPU正在成為持續運行的智能循環的編排和執行引擎,管理上下文、工具呼叫、記憶體移動、安全邊界和加速器利用”。

英特爾公司副總裁宋繼強也指出,以CPU為核心、配合GPU、NPU、IPU、AI加速器等多類晶片的異構算力架構,正在成為支撐智能體AI的長期方向。複雜的推理循環、上下文維護、分支指令路由等難以平行化的任務,正越來越多地由CPU承擔。而加速器(不一定是GPU,也可以是定製ASIC)則專注於矩陣乘法等計算密集型任務。

經濟帳:Token成本的競爭

這一切變化的根本驅動力,是Token的成本。

在邊緣端,一次只處理幾個請求,故事很簡單。但在資料中心層面,目標是在API層面最大化整體利用率,關鍵是每秒處理多少個請求。

Expedera首席科學家Sharad Chole指出:“隨著模型規模持續膨脹,記憶體已經成為和計算繫結的核心瓶頸。HBM的成本與利用效率,也就成為GPU的關鍵影響因素”。

無問芯穹的PDD架構通過跨叢集異構推理,實現了單Token成本降低37.5%。商湯大裝置通過異構混合推理,將主流國產晶片的MFU提升85%至152%,整體推理性價比已達輝達H系列的1.25倍,同成本Token產出規模擴大2.5倍。

異構計算和推理流水線解構,最終都是為了一個目標——在保證性能的前提下,降低每個Token的處理成本。

軟體:從“輔助”到“核心”

在異構叢集環境中,軟體扮演的角色正在從輔助工具升級為核心競爭力。

當不存在單一廠商掌控端到端全流程時,軟體就成為挖掘異構硬體能力、完成跨叢集最佳化的關鍵。

西門子EDA的Cameron Brunner指出:“硬體廠商與大型系統整合商正在研發叢集網路組網方案。軟體則負責調度工作負載,最大化利用互連資源”。

超大規模雲服務商已經將這類理念做了大量落地實踐。多數雲廠商都有放置組(placement group)的概念,把虛擬機器集中部署,讓虛擬機器之間享有高速互連。

但跨機器擴展依然是巨大難題。Brunner坦言:“當應用跨多台伺服器運行,想要獲得接近線性的性能擴展,實現難度很高”。

多元平行:一種範式解決不了所有問題

計算叢集中的平行計算,遠比想像中複雜。

Chole指出,計算叢集存在多種平行範式:張量平行、資料平行、上下文平行、流水線平行,每一種範式對網路拓撲的要求各不相同。

流水線平行是點對點傳輸;張量平行依賴全歸約運算,之後再做廣播。在叢集規劃階段必須充分考慮這些差異。“正因如此,如果要做張量平行規模擴展,NVLink就至關重要;記憶體、記憶體傳輸也面臨類似約束”。

如何從單GPU擴展到8卡,同時接近8倍性能,始終是行業難題。

客戶已經用腳投票

DigitalOcean已宣佈部署了五層推理架構,專門針對異構叢集進行最佳化,明確整合AMD與輝達的產品。其AI原生雲平台從矽到智能體整合了五個層級。

Anthropic也正式組建了內部晶片團隊,為Claude大模型量身打造定製化AI晶片。Anthropic組建晶片團隊,意味著大模型公司自研晶片不再是個案,行業正從集中採購輝達GPU向多元晶片架構演進。

輝達也“親自下場”,推出了從零建構、專為智能體打造的Vera CPU。英特爾與SambaNova聯合推出異構推理架構,將AI推理任務分為三層:GPU負責預填充、SambaNova可重配置資料流單元負責解碼、英特爾至強6 CPU負責智能體任務編排與執行。

結語

AI資料中心正在經歷一場深刻的架構變革。從“GPU萬能”到“異構計算”,從“單體部署”到“推理解構”,從“專有互連”到“標準化”——每一個變化都在指向同一個方向:用最合適的工具,解決最合適的問題,以最低的成本,交付最好的結果。

異構算力架構正在從“CPU+GPU”為主向“CPU+GPU+XPU”多元發展路線演進,這已成為智能算力時代的主流技術範式。

輝達不會消失,但它將不再是唯一的答案。正如西門子EDA的Brunner所說,業務將驅動最高效的解決方案。而那個“最高效的解決方案”,正變得越來越多元、越來越有趣。(觀芯IC)