知名分析師郭明錤調查顯示,輝達重啓AI推理預填充晶片「Rubin CPX」,預計2027年初量產。新版採用168GB HBM4顯存,功耗2300瓦,算力接近標準Rubin GPU。該晶片採用獨立模塊化機架與分層互聯設計,與Rubin GPU按1:1協同部署,專攻預填充與KV Cache生成,以降低長上下文推理成本。
輝達悄然重啓一項一度被市場認為已經放棄的晶片項目,目標直指AI推理成本較高的預填充(Prefill)環節。
知名分析師郭明錤最新產業調查顯示,輝達已重新啓動AI推理預填充加速GPU項目「Rubin CPX」,並對產品設計進行大幅調整。按照目前規劃,新版Rubin CPX預計於2027年第一季度開始生產。
此次項目重啓釋放出一個明確信號:輝達正在加碼解決AI推理階段的預填充性能與成本瓶頸。隨著大模型上下文長度持續增加,預填充階段需要處理大量輸入資訊並生成KV Cache,其效率直接影響AI推理的整體成本和部署經濟性。
郭明錤稱,目前超過50%的AI推理工作負載來自輸入上下文處理及KV Cache構建。
晶片規格大幅調整,算力接近標準Rubin
新版Rubin CPX的核心規格較此前方案出現明顯變化。
在算力和功耗方面,新版CPX的性能已接近標準Rubin GPU,單卡最高功耗同樣達到2300瓦。內存方面,新版CPX改用168GB HBM4顯存,較此前方案的128GB GDDR7明顯升級,但仍低於標準Rubin GPU的288GB HBM4。
按照郭明錤的說法,8卡CPX計算托盤的HBM4容量合計約1.34TB,能夠覆蓋大多數長上下文預填充工作負載及對應的KV Cache需求。這意味著,Rubin CPX並非單純追求更高的通用算力,而是針對長上下文場景對顯存容量和預填充效率進行了重新設計。
從共享機架轉向獨立部署,配置更加靈活
機架架構也是此次調整的重點。
此前方案中,CPX計劃與Rubin GPU共享機架;新版則改為採用獨立的MGX ETL機架,從而允許客戶根據實際需求單獨擴展CPX算力。
具體來看,客戶可以選擇64、128、192或256張CPX GPU的部署規模。每64張CPX GPU構成一個機架模塊,包括8個計算托盤,每個托盤搭載8張CPX GPU,同時配備一個交換機托盤。
模塊化設計意味著,客戶無需按照固定的大規模Rubin機架進行採購,可以根據預填充負載的實際需求靈活增加CPX算力。
分層互聯設計,降低預填充部署成本
在互聯架構上,Rubin CPX採用分層設計,在性能與成本之間進行取捨。
在單個計算托盤內部,8張CPX GPU通過NVLink進行Scale-up擴展。每張CPX GPU的NVLink帶寬為1至1.5TB/s,低於標準Rubin GPU的3.6TB/s。
在托盤之間以及機架模塊內部的Scale-out層面,CPX採用Spectrum-6以太網全銅L1鏈路;跨機架模塊連接時,則通過各模塊的Spectrum-6交換機,經OSFP光纖鏈路完成互聯。
相比完全依賴高帶寬GPU互聯的方案,這種分層架構更強調針對預填充場景進行成本優化。
與Rubin GPU協同,瞄準長上下文推理
Rubin CPX並不是獨立運行的通用GPU,而是作為預填充加速器與Vera Rubin NVL72配套使用。
按照郭明錤的說法,輝達推薦CPX與Rubin GPU按照1:1的比例部署:CPX負責預填充階段的計算並生成KV Cache,隨後通過以太網RDMA將KV Cache傳輸至Rubin GPU,由後者完成後續解碼。
從產品定位來看,Rubin CPX的核心並不是取代標準Rubin GPU,而是將AI推理流程進一步拆分,讓不同GPU分別承擔預填充和解碼任務。
郭明錤將其定位為「長上下文預填充的最佳性價比方案」。隨著AI模型上下文窗口不斷擴大,預填充階段的計算量和KV Cache規模持續增長,輝達此次重啓CPX項目,或正是試圖通過專用硬體和異構部署方式,進一步降低長上下文推理的成本。 (華爾街見聞)
