來自華為新款昇騰950與Atlas 950 SuperPoD的啟示
大語言模型參數規模已經擴展至兆級,MoE(混合專家)架構帶來了沉重的All-to-All通訊開銷,而推理工作負載對低時延和高吞吐的要求也越來越高。與此同時,在美國出口管制背景下,中國領先本土製程節點(7nm)與海外先進製程(3nm/2nm)之間的差距正在擴大,過去不夠成熟的工具鏈也限制了國產加速器的有效利用率。根據我們對公司披露資訊以及對行業專家管道調研的評估,華為新推出的昇騰950 NPU和Atlas 950 SuperPoD雖然採用較落後的工藝製程,但部分規格已經可以與輝達H100相媲美(見圖1)。我們認為,這是以系統級工程能力彌補製程劣勢的典型路徑,預計其他國內廠商也會複製這一策略。以下我們結合昇騰950白皮書,評估其對供應鏈的影響。
兩種記憶體配置指向“工作負載級定製”
與客戶進行緊密合作,使晶片設計公司可以更深入地理解具體工作負載的要求,並在既定晶片面積與製程條件下對架構進行針對性最佳化。昇騰950提供兩個SKU,對應當前AI基礎設施設計中日益重要的Prefill/Decode(預填充/解碼)解耦趨勢:根據華為披露,950PR配備128GB容量、1.6TB/s頻寬,主要面向Prefill/推薦類工作負載;950DT配備144GB容量、4TB/s頻寬,主要面向Decode和訓練工作負載,二者在統一介面下運行。