2026世界人工智慧大會上,兩座算力“巨無霸”再次上演巔峰對決。一邊是中國首個全國產十萬卡AI超叢集——曙光8000,開放式計算路線的集大成者,本屆WAIC的鎮館之寶。另一邊是昇騰950超節點,垂直一體化算力路線的佼佼者,以1024卡超節點規模首次亮相。
兩家同時在超大規模算力賽道亮出底牌,吸引了業界眾多探究目光。兩種技術路線、兩種工程方案、兩套計算基礎設施,究竟有何差異?下面一組核心技術指標盤點,或許能揭開答案。
需要說明的是,本次盤點僅依據網路公開資料,這些指標也並非孤立的技術參數——叢集規模化擴張下,算力密度決定了物理空間的上限,網路延遲決定了有效算力的下限,散熱能效決定了系統能否持續運轉,記憶體調度決定了算力能否真正被用起來。
每一項指標的優劣,最終都會反映在同一個問題上:叢集的實際算力輸出,能打多少折扣。
一、算力密度:物理空間內的算力“容積率”
當叢集規模達到十萬卡,機房空間和基礎設施投入成為剛性約束。在同等面積下能部署多少算力,直接決定了單位固定資產投資能產出多少有效算力。算力密度,就是資料中心領域的“容積率”。
據悉,曙光8000憑藉單機櫃“一拖二”高密架構設計,實現了單機櫃超高速匯流排互連,建構起大規模、高頻寬、低時延的超節點通訊域,單計算單元算力密度是同類超節點的20倍。
相較來看,昇騰950超節點以單櫃64張計算卡為基本單元,現場展出的1024卡版本由16台計算櫃組成。若將兩者置於同等叢集規模標準,昇騰950的機櫃數可能需要更多配置數量。
當然,這也意味著,固定機房面積下,曙光8000可部署的算力規模更大,單位固定資產投資能產出更多有效算力,也為未來向更大規模叢集擴展預留了物理空間。
二、網路互連:決定有效算力的“輸油管道”
超大規模叢集的運行不是把卡插上就行。網路延遲每增加1微秒,大規模平行訓練的整體效率就下降幾個百分點。網路互連能力決定了“理論峰值算力”有多少能變成“實際可用算力”。
曙光8000採用自研scaleFabric類IB原生RDMA無損互連技術,無需光通訊裝置即可支撐十萬卡規模叢集超高速穩定互連。採用信用基流控+LLR無損機制,端到端網路卡傳輸延遲低至0.93μs,交換延時最低200ns;毫秒級鏈路故障自癒,網路穩定性不隨叢集規模擴張衰減。
昇騰950的互聯技術以華為自研的“靈衢2.0”協議為核心,採用“Scale-up(節點內)與Scale-out(跨節點)協同”的架構設計,旨在將單卡計算單元高效組織為大規模超節點叢集,解決大模型訓練和推理中的通訊瓶頸,目前可提供TB級NPU互聯頻寬,3微秒RTT時延。
在交換延時和端到端傳輸延遲兩個關鍵指標上,前者展現出一定的數量級優勢。換算到實際訓練任務中,也代表著更高的算力利用效率、更短的訓練周期和更低的Token生產成本。對於動輒數月的兆參數大模型訓練而言,幾個百分點的效率提升就意味著千萬級的成本差異。
三、散熱能力:決定叢集能效的“生存底線”
十萬卡級叢集的功耗相當於一座小型城市的居民用電量。如果散熱方案跟不上,晶片溫度上升1℃,壽命和穩定性都會打折扣;如果PUE每高出0.1,一年的電費差距就是千萬級。散熱不再是“輔助系統”,而是決定叢集能不能轉起來、轉多久的生存底線。
曙光8000採用整機櫃浸沒相變液冷技術,可承載高功率晶片散熱需求,最高支援單機櫃功率達MW級;可實現全年自然冷卻,PUE低至1.04,超高密度部署大幅節省機房佔用面積。
昇騰950DT單晶片功耗達到1000W,單機櫃功耗70至240kW,同樣採用全液冷方案,官方標稱PUE值≤1.08 或 ≤1.15,相較於同類超節點產品,該項指標也已觸達國際領先水平。
PUE降低,不僅意味著計算叢集每年海量電費節省,更關鍵的是,浸沒式相變液冷讓單機櫃MW級部署成為可能,為未來更高密度的算力演進鋪平了道路。
四、記憶體與調度:讓算力真正被“用起來”的關鍵
算力再強,資料喂不進來,晶片就在空轉。記憶體頻寬不足,GPU利用率可能跌到50%以下;調度系統跟不上,十萬張卡就可能各自為政。這兩項能力決定了叢集的“實際利用率”。
曙光8000配套ParaStor分佈式記憶體系統,在2026年IO500榜單中獲生產型全節點和10節點兩項全球性能第一,系統可隨叢集節點擴容實現記憶體能力同步增長。
調度層面,Gridview 7.0一站式智能化算力管理平台,以MetaStack+K8s雙融合調度架構為核心,內建數百款行業應用範本,具備支撐十萬卡線性擴展的自研調度最佳化能力。
昇騰950(含昇騰950PR與昇騰950DT)的記憶體性能,同樣在國產AI算力基礎設施中相對領先。據悉,該超節點通過“大容量+高頻寬+智能快取”的架構設計,有效突破了“記憶體牆”瓶頸,尤其適合大模型訓練、長文字推理(KV Cache)及複雜推理場景。
總結
WAIC 2026上,開放式叢集與垂直路線超節點同台亮相,自然不免讓人對比探究一番。但更值得注意的是,國產計算叢集已進入規模化爆發期,無論走那條技術路線都目標一致——以系統級能力補全單卡算力短板,讓叢集的實際算力輸出儘可能接近理論峰值。
當前的技術指標比拚,本質是在不同路徑上查漏補缺、取長補短。隨著更多十萬卡、更大規模叢集落地,國產新基建必將從“技術追趕”邁向“標準定義”的新道路。屆時,才是中國算力最大的勝利。 (AI雲原生智能算力架構)
