郭明錤:輝達重啓推理預填充優化晶片Rubin CPX項目

AI速讀
分析師郭明錤透露,輝達將於 2027 年初量產 AI 推理專用晶片「Rubin CPX」,旨在優化長上下文推理的預填充階段。新版 CPX 搭載 168GB HBM4 顯存,功耗達 2300 瓦,並採用獨立 MGX ETL 機架模塊化設計,提升部署靈活性。該方案採取分層互聯架構以降低成本,並建議與 Rubin GPU 以 1:1 比例協同工作,將推理流程拆分為「預填充」與「解碼」兩階段,為企業提供高性價比的長上下文處理方案。
知名分析師郭明錤調查顯示,輝達重啓AI推理預填充晶片「Rubin CPX」,預計2027年初量產。新版採用168GB HBM4顯存,功耗2300瓦,算力接近標準Rubin GPU。該晶片採用獨立模塊化機架與分層互聯設計,與Rubin GPU按1:1協同部署,專攻預填充與KV Cache生成,以降低長上下文推理成本。

輝達悄然重啓一項一度被市場認為已經放棄的晶片項目,目標直指AI推理成本較高的預填充(Prefill)環節。

知名分析師郭明錤最新產業調查顯示,輝達已重新啓動AI推理預填充加速GPU項目「Rubin CPX」,並對產品設計進行大幅調整。按照目前規劃,新版Rubin CPX預計於2027年第一季度開始生產。

此次項目重啓釋放出一個明確信號:輝達正在加碼解決AI推理階段的預填充性能與成本瓶頸。隨著大模型上下文長度持續增加,預填充階段需要處理大量輸入資訊並生成KV Cache,其效率直接影響AI推理的整體成本和部署經濟性。

郭明錤稱,目前超過50%的AI推理工作負載來自輸入上下文處理及KV Cache構建。

晶片規格大幅調整,算力接近標準Rubin

新版Rubin CPX的核心規格較此前方案出現明顯變化。

在算力和功耗方面,新版CPX的性能已接近標準Rubin GPU,單卡最高功耗同樣達到2300瓦。內存方面,新版CPX改用168GB HBM4顯存,較此前方案的128GB GDDR7明顯升級,但仍低於標準Rubin GPU的288GB HBM4。

按照郭明錤的說法,8卡CPX計算托盤的HBM4容量合計約1.34TB,能夠覆蓋大多數長上下文預填充工作負載及對應的KV Cache需求。這意味著,Rubin CPX並非單純追求更高的通用算力,而是針對長上下文場景對顯存容量和預填充效率進行了重新設計。

從共享機架轉向獨立部署,配置更加靈活

機架架構也是此次調整的重點。

此前方案中,CPX計劃與Rubin GPU共享機架;新版則改為採用獨立的MGX ETL機架,從而允許客戶根據實際需求單獨擴展CPX算力。

具體來看,客戶可以選擇64、128、192或256張CPX GPU的部署規模。每64張CPX GPU構成一個機架模塊,包括8個計算托盤,每個托盤搭載8張CPX GPU,同時配備一個交換機托盤。

模塊化設計意味著,客戶無需按照固定的大規模Rubin機架進行採購,可以根據預填充負載的實際需求靈活增加CPX算力。

分層互聯設計,降低預填充部署成本

在互聯架構上,Rubin CPX採用分層設計,在性能與成本之間進行取捨。

在單個計算托盤內部,8張CPX GPU通過NVLink進行Scale-up擴展。每張CPX GPU的NVLink帶寬為1至1.5TB/s,低於標準Rubin GPU的3.6TB/s。

在托盤之間以及機架模塊內部的Scale-out層面,CPX採用Spectrum-6以太網全銅L1鏈路;跨機架模塊連接時,則通過各模塊的Spectrum-6交換機,經OSFP光纖鏈路完成互聯。

相比完全依賴高帶寬GPU互聯的方案,這種分層架構更強調針對預填充場景進行成本優化。

與Rubin GPU協同,瞄準長上下文推理

Rubin CPX並不是獨立運行的通用GPU,而是作為預填充加速器與Vera Rubin NVL72配套使用。

按照郭明錤的說法,輝達推薦CPX與Rubin GPU按照1:1的比例部署:CPX負責預填充階段的計算並生成KV Cache,隨後通過以太網RDMA將KV Cache傳輸至Rubin GPU,由後者完成後續解碼。

從產品定位來看,Rubin CPX的核心並不是取代標準Rubin GPU,而是將AI推理流程進一步拆分,讓不同GPU分別承擔預填充和解碼任務。

郭明錤將其定位為「長上下文預填充的最佳性價比方案」。隨著AI模型上下文窗口不斷擴大,預填充階段的計算量和KV Cache規模持續增長,輝達此次重啓CPX項目,或正是試圖通過專用硬體和異構部署方式,進一步降低長上下文推理的成本。 (華爾街見聞)