算力盡頭是電力?Google揭秘AI晶片從1000A垂直供電到800VDC的技術路線!

美股艾大叔
•
AI速讀
AI 算力的瓶頸已從製程移轉至電力供給。Google 揭秘其電力架構演進路徑:在晶片端導入 1000A 級垂直供電 (VPWR) 以降低損耗,並研發 3D IVR 將電源轉換整合至封裝內部;在機架端則推動 48V 升級至 800VDC,並透過 Power Sidecar 將供電模組與計算機架解耦。此外,供電與液冷系統開始深度融合,形成「電-熱-機械」協同設計。最終目標是實現從晶片到電網的全端電源管理 (Full-Stack Power Management),透過工作負載感知優化,在提升性能的同時降低能耗。

🔷10kW晶片、1MW機架、1GW資料中心,AI算力正在突破傳統供電極限

🔷垂直供電、3D IVR、Power Sidecar與800VDC成為下一輪升級方向

最近在看AI晶片的發展時,小編越來越明顯地感受到:AI算力真正的瓶頸,已經不只是製程、HBM和先進封裝,供電正在成為一個越來越繞不開的問題。 當單顆AI晶片向10kW級邁進、單機架衝向1MW級,甚至資料中心走向GW級之後,傳統的伺服器供電架構顯然已經很難繼續支撐這種增長。

這份報告,就把這條技術路線講得非常清楚:從1000A級垂直供電VPWR、Chiplet IVR、3D IVR,到48V向±400V/800VDC升級,再到Power Sidecar、液冷、超級電容與BESS儲能,Google正在重新思考從晶片一直到資料中心的整套供電體系。

今天小編就藉著這份報告,帶大家看看:當AI晶片功耗一路狂飆之後,一場從晶片、封裝、機架一直延伸到資料中心的“電力架構革命”,究竟會如何展開。

一、這份材料真正想說明什麼?

它討論的並不是單一的“晶片電源設計”,而是站在 Google 資料中心的系統視角,分析 AI算力功耗快速增長之後,從晶片、封裝、PCB、機架一直到資料中心電網側,整個供電體系將如何被重新設計。

二、AI算力正在把供電問題從“晶片問題”升級為“資料中心系統問題”

Google首先給出了一個非常鮮明的功率演進方向:未來AI基礎設施正在朝著 10kW級晶片、1MW級機架、1GW級資料中心演進。也就是說,AI算力增長已經不只是讓GPU/TPU功耗增加,而是在同步推高晶片、機架乃至整個資料中心的功率規模。

其中晶片側的問題尤其突出。隨著 Dennard Scaling結束,性能繼續增長越來越依賴更高功耗;與此同時,3D IC逐漸成為主流,又進一步推高單位面積的功率密度。報告還特別指出,真正棘手的不只是TDP:EDP(Electrical Design Power)通常達到TDP的1.5~3倍,並逐漸成為VR設計的瓶頸;di/dt增長甚至快於TDP和EDP。 Chiplet和3D IC還會顯著增加Power Domain數量,讓PDN設計進一步複雜化。

因此,這份報告實際上提出了一個重要判斷,AI晶片的下一輪競爭,不只是電晶體、HBM和先進封裝的競爭,也將越來越成為“供電能力”的競爭。

三、晶片供電架構正在從橫向供電走向“垂直供電”,Google已經實現1000A級量產

面對數千安培級AI ASIC供電需求,傳統PCB橫向輸電路徑的損耗越來越難以接受,因此Google正在大規模推進 Vertical Power Delivery(VPWR,垂直供電)。

報告披露,VPWR已經成為Google TPU和高功率定製ASIC的 POR(Plan of Record)方案。Google此前已經部署了業內首個 1kA級量產VPWR方案,通過Z方向直接向ASIC輸送超過1000A電流,使配電功率損耗降低約70%,對應大約 ASIC TDP的7%;同時還可以縮短高速SerDes通道。該方案已經在Google資料中心實現大規模部署,並在超過一年運行後保持個位數DPPM。

更重要的是,Google直接給出了 VPWR路線圖:

Gen 1 → Gen 1.5 → Gen 2 → Future Generations

Gen 1解決1kA垂直供電;Gen 1.5加入多供應商方案以及TLVR,提高瞬態響應能力;Gen 2進一步引入多電源軌、多模組設計和液冷VPWR;未來方案則瞄準 TDC超過2kA、EDC超過5kA甚至更高,整體方案功率密度提高2~4倍。

這意味著AI晶片供電正在從傳統“PCB旁邊放VRM”的思路,逐漸轉向更靠近晶片、更短供電路徑、更高垂直整合度的架構。

四、IVR將進一步進入封裝甚至矽片,最終可能形成真正的3D供電網路

Google並沒有把Vertical Power視為終點,而是繼續討論了 IVR(Integrated Voltage Regulator,整合式電壓調節器)。

短期可以採用 On-PCB IVR,降低Z-height並改善瞬態響應,但隨著AI晶片向5kW以上發展,1.8V/3.3V低壓輸入在PCB橫向傳輸中的損耗會越來越嚴重。

下一階段是 On-package Chiplet-based IVR,即把IVR進一步推進封裝內部,可以部署在Die側、Land側、封裝基板內部等不同位置。但這些架構都必須在主動散熱、BGA電流擁擠、系統裝配複雜度以及PDN損耗之間進行權衡,因此Google認為目前還沒有明顯的最終贏家。

更長期的方向則非常值得關注——Silicon-based 3D IVR。

Google設想將 PCB Vertical Power + Bottom-in/Top-out IVR結合,通過矽中介層或類似EMIB的先進封裝結構,實現真正意義上的 Pure Vertical Power Delivery。

換句話說,未來AI晶片的先進封裝裡整合的可能不只是Compute Die、HBM和高速互連,電源轉換模組本身也可能逐漸進入先進封裝甚至3D堆疊體系。

五、供電和散熱開始融合,AI晶片正在進入“電—熱—機械”協同設計時代

當電流進入數千安培、功率進入數千瓦之後,電源已經無法作為獨立模組進行設計。

Google特別強調了 Multiphysics(多物理場)問題,其中同時涉及機械結構與可靠性、熱管理、Power Integrity、BGA電遷移、雙面BGA裝配、重量以及可返修性。

這意味著AI晶片的電源設計正在和封裝、PCB、結構以及散熱系統深度耦合。

還明確展示了 ASIC + VRM液冷思路。Google提到Project Deschutes,通過In-row CDU以及直接連接Cold Plate,同時為ASIC和VRM散熱。

因此未來AI伺服器液冷對象可能不再只是GPU/TPU:

GPU/TPU液冷 → HBM/封裝散熱 → VRM液冷 → 整個高功率計算節點協同熱管理。

這也是為什麼AI伺服器供電與液冷產業鏈正在越來越緊密地繫結在一起。

六、機架供電將從48V繼續升級,±400VDC和800VDC成為下一階段方向

晶片功耗增加最終會傳導到機架。

Google指出,AI/ML晶片推動的Rack Power增長速度已經超過電池模組以及AC/DC電源功率密度提升速度。因此繼續在伺服器機架內部堆疊越來越多的電源模組和BBU並不可持續。

於是供電架構正在經歷12VDC → 48VDC → 更高直流電壓,進一步給出了明確方向:將更多甚至全部 Power Conversion + Battery Backup 從Payload Rack中移出去,同時從48VDC升級到 ±400VDC或者800VDC。

Google還介紹了與Meta、Microsoft共同推進的 Project Mt Diablo Power Sidecar。它的核心思想就是把供電基礎設施從電腦架中解耦出來,讓計算Rack更多用於放置TPU/GPU、CPU、網路以及互連裝置。

所以未來AI伺服器可能出現非常明顯的架構變化 “電腦架 + Power Sidecar + 液冷系統”逐漸成為一個整體。

再往資料中心層面發展,則可能進一步演變成 800VDC級直流母線 + 固態變壓器SST + BESS儲能的Facility-Level供電體系。已經展示了Google從Sidecar方案進一步向Facility Level DC Distribution演進的構想。

七、最終方向不是單純“造更大的電源”,而是Chip-to-Data Center全端電源管理

這份報告最後一個非常重要的思想,是 Full-Stack Power Management。

AI負載與傳統伺服器負載不同。大規模AI訓練任務具有高度同步特徵,當大量GPU/TPU同時開始計算、停止計算,或者在Compute-intensive和Networking-intensive階段之間切換時,會產生劇烈的功率和溫度波動。

這種波動不僅影響晶片,還會沿著供電鏈一路向上傳遞 Chip → Package → Board → Rack → Data Center → Grid。

因此Google提出的解決方案並不是單獨增加VRM,而是進行跨層協同設計,包括 Compiler、ASIC硬體功能、Rack級Supercapacitor(超級電容)以及Facility級BESS儲能系統。

更進一步,Google提出 Workload-Aware Perf/W Optimization:利用不同AI工作負載的特徵,動態尋找不同任務對應的最佳電壓、電流和工作頻率,而不是讓所有AI任務都按照固定的最壞情況進行供電設計。報告展示的示意結果指向了 約1.1× Performance、0.8× Power 的最佳化空間。

小編總結

隨著AI晶片邁向10kW、機架邁向1MW、資料中心邁向GW級,傳統伺服器供電架構已經接近極限,未來AI基礎設施將從“晶片VRM”升級為覆蓋晶片、先進封裝、垂直供電、液冷、800VDC機架、儲能乃至電網的全端電源系統。(芯聯匯)