在上海舉行的華為全聯接(HC)大會期間,華為輪值董事長徐直軍與海思首席科學家廖恆,就華為新發佈的AI時代的Peerium計算架構和靈衢匯流排(UnifiedBus),與媒體記者進行了問答交流。
今年HC大會期間,華為展出了昇騰950和Atlas 950超節點。徐直軍表示,“超節點”如今被廣泛提及,但不同廠商實現差異很大,真正的挑戰在於讓數千、數萬顆處理器組成一台電腦。華為將這一全新計算架構命名為Peerium,它能讓百萬顆處理器成為一台電腦。目前,華為正部署和測試25.6萬張卡規模的Atlas 950 SuperPoD超節點。
廖恆認為,未來兩年內,預計中國將出現約6至7個前沿AI實驗室,目標都是訓練參數規模在10兆到40兆之間的基礎語言模型。這些數字與超節點的記憶體容量和規模大致匹配,因此需要如此規模的基礎設施來做訓練。
華為昇騰950晶片推出PR和DT兩個版本。其中,昇騰950PR晶片已於2026年第一季度正式發佈並上市,主要面向推理場景。徐直軍透露,該晶片上市量不算大。而基於950DT的超節點主要用於訓練,目前還在測試中,規模供貨應該在今年年底或明年初。
“我們和各家模型廠商做了很多溝通交流,從目前測試結果來看,950DT 的訓練表現非常不錯,我相信從明年開始,大量模型的訓練會構築在 950DT超節點上。未來關鍵可能不在於我們推動的力度有多大,而在於我們的供貨能力有多大。現在能產多少就供多少,我們希望產業鏈加快擴產,快一點、多產一點。”徐直軍稱。
徐直軍表示,目前昇騰滿足國內市場需求還遠遠不足,所以沒有全面拓展海外市場的計畫。但確有少數國家做了測試和供給,但量非常少。在中國市場要統計輝達的市場佔有率很難,但如果從華為能夠統計到的資料看,昇騰應該已經超過了輝達。
當前,AI算力推動光通訊持續向“超高速、高能效、全光化”演進,NPO商業化加速、CPO多技術路線平行。針對路線選擇,徐直軍表示,華為很早就達成共識做NPO,沒做CPO。“而且我認為,在相當長時間裡,從工程實現、成本、維護、良率等角度講,NPO都是最佳選擇。”
華為不久前發佈了基於NPO的Hi-ONE模組,支援7.2T高頻寬。徐直軍表示,光引擎距離主晶片僅約5釐米,只有這部分還需要銅線做電連接,基本可以說是全光的超節點。同時,Hi-ONE模組把光源直接封裝進模組內部,實現內建光源。我們預計,未來兩到三年內都很難有其他廠商能做出來。這是華為多年來在光電相關領域的積累,才得以實現和量產。
廖恆表示,全光互聯最大的障礙是對可靠性的擔憂,因為器件會發生故障。目前大多數廠商選擇外接光源路線,用單個光源饋送32路訊號,功率就必須放大32倍。如此巨大的功率很容易引發許多問題,在耦合介面及其他各個環節都會出問題。我們選擇內建光源方案,是出於工程上的務實選擇,Hi-ONE正是經過多次權衡後達成的出色折中方案,很快將進入量產階段。
以下為交流摘要全文:
徐直軍:非常感謝大家來參加媒體溝通會,我有很長一段時間沒有跟媒體朋友們溝通了,今天很高興和大家相聚交流,主要聚焦在我們開創AI時代的計算架構和靈衢協議。
去年HC大會上,我在主題演講中發佈了昇騰晶片及其路標(950、960、970、超節點與叢集解決方案),並宣佈開放靈衢協議。
今年HC大會上,華為展出了昇騰950和Atlas 950超節點。"超節點"如今人人都在講,但不同廠商實現的差異很大。去年我曾一再強調,超節點的真正挑戰,是讓數千、數萬顆處理器組成一台電腦。
今天展出的基於950晶片的超節點,背後正是我們開創的全新計算架構。它能讓百萬顆處理器成為一台電腦。我們將這一架構命名為Peerium,它是基於巢狀平行、統一記憶體定址、平等互聯實現百萬級處理器強擴展的計算架構,突破了圖靈範式的序列,提出了Nested BSP。
同時,它也突破了馮・諾依曼單機架構,顛覆了長久以來的主從架構。但現有技術無法支撐這一架構的實現,為此我們發明了關鍵互聯技術——靈衢,最終實現讓百萬級處理器真正成為一台更大的電腦。
靈衢是基於一個開放協議、可無限擴展地聯接CPU、NPU、記憶體、SSD、網路卡和交換機的高速匯流排。有了靈衢,計算、記憶體、網路得以平等互聯,從而徹底顛覆原有的主從架構。
Atlas 950超節點就是華為採用Peerium計算架構的產品,目前25.6萬卡規模的叢集已經在部署和測試中。
問:廖博論文裡面寫的25.6萬張卡組成一個超節點,這是該技術的上限嗎?目前整體市場需求情況如何?
廖恆:25.6萬或約20萬這個數字,並不是隨便定的。
首先,這類大型叢集用於訓練,硬體基礎設施需要支撐基礎模型訓練,而目前模型參數規模已達到5兆等級。
未來兩年內,預計中國將出現約6至7個前沿AI實驗室,目標都是訓練參數規模在10兆到40兆之間的基礎語言模型。這些數字與超節點的記憶體容量和規模大致匹配,因此需要如此規模的基礎設施來做訓練。
第二,在中國,大多數資料中心都接入了國家電網。考慮到單個區域、單個資料中心園區的電力輸送系統設計,20萬是一個相對保守的數字。
正如我所說,大家一定對全球範圍內正在發生的AI模型競賽非常熟悉。在中國,至少有3到4家一線參與者已獲得廣泛認可,並達到了一線地位。
問:華為接下來將如何推動中國的模型廠商將昇騰系列晶片用於訓練?
徐直軍:950率先推出的是PR版,主要面向推理,目前上市量不算大。基於950DT的超節點則主要用於訓練,目前還在測試中,規模供貨應該在今年年底或明年初。我們和各家模型廠商做了很多溝通交流,從目前測試結果來看,950DT的訓練表現非常不錯,我相信從明年開始,大量模型的訓練會構築在950DT超節點上。未來關鍵可能不在於我們推動的力度有多大,而在於我們的供貨能力有多大。現在能產多少就供多少,我們希望產業鏈加快擴產,快一點、多產一點。
問:現在美國部分領先模型廠商呼籲放緩AI產業的發展,對此華為怎麼看?
徐直軍:從中美AI發展的水平和節奏來看,中國的模型基本都是開放原始碼的,相對而言,發展到那一步也是透明的;而美國幾家主流模型廠商由於擁有更強大的算力,到底發展到了那一步,目前可能只有他們自己知道。他們感受到的AI風險,在中國可能感受並不強烈。中國現在還是要加快自己的節奏,等真正能夠感受到這種風險時,或許會與美國頭部模型廠商有同樣的感覺。但我一直認為,AI既要發展又要管控風險,要讓AI"向善",而不是"向惡"。
問:950超節點目前有沒有在海外擴展的計畫?如果有的話,會在那些市場上開展?國內市場份額情況如何?如何看待晶片自主化率的問題?
徐直軍:目前昇騰滿足國內市場需求還遠遠不足,所以沒有全面拓展海外市場的計畫。但確有少數國家非常需要,我們做了測試和供給,但量非常少。
在中國市場要統計輝達的市場佔有率很難,但如果從我們能夠統計到的資料看,昇騰應該已經超過了輝達。
中國推進晶片自主化是一條必然之路。中國有14億人口,又是一個工業化大國,所有的生活、工作都與晶片相關。中華民族又是一個憂患意識很強的民族,不能一直受制於人,不能今天被說賣一顆給你,明天又說不賣給你。儘管水平差一點、先進性差一點,但解決"有無"問題,不要天天提心吊膽,應該是必然之路。相信無論是中國政府還是中國產業界,包括華為在內,推動晶片的全面自主化、推動半導體產業整個鏈條的全面自主化,肯定是一條必由之路,而且我也相信總有一天會變為現實。
問:華為推出了靈衢互聯技術,是基於在計算和通訊領域的長期積累,其中有多少是來自華為網路部門的貢獻?
徐直軍:UB不僅僅是華為網路部門的貢獻,我們在各種各樣的互聯協議基礎上,最終將其做成一個統一協議。網路領域一般是IP協議,時延都很高。計算互聯和傳統網路不一樣,我們提的是匯流排,需要低時延、超高速。當時在決策做這個產品時,我們將其放在計算部門而不是傳統的網路部門,這樣才能真正做出一個高速、低時延、又統一協議的UB出來。
廖恆:如果把UB看作一群人的智慧結晶,它是由電腦架構師孕育,但是由網路技術撫養長大。
問:UB是一個同時兼顧Scale-out和Scale-up的技術。輝達分別做了NVLink和InfiniBand。為什麼華為把Scale-up和Scale-out做成一個技術?這和現在其他方案相比有什麼優勢?
徐直軍:首先,不是他們不做,而是能不能做出來的問題。當前最新的NVL72櫃內頻寬很寬,達到1.8TB/s,但一出櫃就降到0.2TB/s。要把百萬台處理器變成一台電腦,櫃間如此低的頻寬根本不可能。大家都希望櫃內、櫃間、資料中心之間乃至跨區,速度最好都一樣,那才能讓一個巨大的物理空間成為一台電腦。這正是UB的價值,它基於一個統一協議,做到全程高速互聯。因此UB技術路線上做的是匯流排,就像電腦內部的匯流排一樣,而不只是Link。基於UB,我們的櫃間頻寬最高可達800GB/s。
去年我們開放UB協議後,最大的下載量其實來自矽谷。輝達最早的目標可能不是做NV72,而是NV256,但最終它的256變成了72;而華為的910C超節點做到了384,還交付了一千多套。最主要的差別在於,我們在910C超節點上採用了UB,而當時輝達的NVLink主要侷限於櫃內,櫃間網路速度太慢,不可能擴展太多。
廖恆:我補充一下為何採用單一協議。輝達及大多數其他廠商至少使用了兩種協議,分別應對不同的場景,就像一次旅行往往要同時選擇飛機、高鐵、汽車等多種交通工具,轉換過程相當麻煩費時。而在這些超節點中,大量流量需要中轉,如果從NVLink切換到InfiniBand,至少涉及微秒級的轉換時間,即從一個協議到另一個協議的中轉時間,時延很難滿足。
UB採用統一協議,將封包從scale-up網路傳輸到scale-out網路,可能只需要大約150納秒。相比而言,與這些協議轉換開銷至少可節省一個數量級。
問:在採用靈衢匯流排(UB)的Atlas950中,Scale-up場景下光互聯和電互聯分別佔多少?未來櫃內有沒有可能全部實現光互聯,主要障礙是什麼?
徐直軍:華為剛剛發佈了基於NPO的Hi-ONE模組,支援7.2T高頻寬,光引擎距離主晶片僅約5釐米,只有這部分還需要銅線做電連接,基本可以說是全光的超節點。同時,Hi-ONE模組把光源直接封裝進模組內部,實現內建光源。我們預計,未來兩到三年內都很難有其他廠商能做出來。這是華為多年來在光電相關領域的積累,才得以實現和量產。
廖恆:在我職業生涯初期,20年多前我們就已經在討論讓晶片連接走向光學化。因為光的傳輸距離和衰減非常小,訊號可以高速傳輸更遠。
從電路角度看Hi-ONE內部其實非常簡單,器件並不多。但走向量產這條路,我們走得非常艱難:光學技術涉及大量物理原理,溫度稍微變化,就會影響二極體的物理特性,改變折射率,影響波導性能,導致無法正常工作。
我認為全光互聯最大的障礙是對可靠性的擔憂,因為器件會發生故障。目前大多數廠商選擇外接光源路線,用單個光源饋送32路訊號,功率就必須放大32倍。如此巨大的功率很容易引發許多問題,在耦合介面及其他各個環節都會出問題。我們選擇內建光源方案,是出於工程上的務實選擇,Hi-ONE正是經過多次權衡後達成的出色折中方案,很快將進入量產階段。
問:關於昇騰晶片的工藝和產能問題,目前限制產能進一步釋放的主要瓶頸是那些環節?華為預計還需多久可以實現大規模穩定的算力晶片供應?
徐直軍:中國的瓶頸問題與全球瓶頸問題基本一致。全球產業界都沒有為AI如此浪湧式的發展做好準備。現在所有光模組公司、記憶體公司之所以能賣高價,並不是因為產品有多好,而是嚴重供不應求所致。因此,只有全球和中國同時達到供需平衡,瓶頸問題才能徹底結束。我預計全球的供需平衡差不多在2029年能得到解決,中國可能還要慢一點。這裡的供需平衡,還要考慮AI發展過程中不斷髮生的技術變化,包括CPO、NPO等。
從華為的角度講,相比過去的通訊、IT產業,現在我們的供應量已具備相當規模;但如果和當前產業對AI基礎設施的需求相比,規模確實又遠遠不夠。要實現客戶要多少就能供多少,華為要達成這個平衡,取決於整個中國產業界的平衡。
問:有報導說馬來西亞正在考慮基於華為昇騰910C來部署主權AI,華為如何來平衡國內客戶和海外客戶的需求?
徐直軍:從客戶部署華為解決方案的選擇來看,肯定是基於地緣政治和多供應商的考量。每個企業都要為其長遠發展消除安全風險,因此昇騰必然是所有客戶的一個選項,儘管相比競爭對手它還有差距。至於平衡國內與海外,我們的原則很簡單:國內為主,優先供應急需算力的中國客戶;海外則服務於少數買不到的客戶,或一定要另一個選擇的客戶。
問:華為在NPO、CPO這兩個技術路線上,當時內部選擇或者博弈是什麼?
徐直軍:這個問題在華為好像沒有過爭論。因為華為既做光器件,又做光模組和昇騰晶片,清楚那種情況才是最佳選擇,所以我們很早就達成共識做NPO,沒做CPO。而且我認為,在相當長時間裡,從工程實現、成本、維護、良率等角度講,NPO都是最佳選擇。
經過產業界這幾年關於NPO、CPO的辯論,從兩次OIF的討論來看,產業認知也在進一步清晰。OIF第一次討論時,有一部分廠家不支援NPO,一心要搞CPO;而最近一次NPO立項時,反對的已經寥寥無幾。相比CPO方案,NPO的銅線連接有5釐米左右,比CPO的5毫米左右要長一點,但帶來了成本接近40%的下降,同時還帶來另一個好處,即一旦光引擎出問題,不會把整個AI晶片一起報廢。當然,CPO和NPO並不是誰消滅誰的問題,而是工程、成本、產業鏈、維護等各個方向上平衡的選擇,沒有對錯。
所以,我們堅定不移走NPO的道路,推動產業界形成標準,全產業鏈共同把NPO發展好,但也不是說CPO不行。在OIF上NPO得到了40家產業鏈廠商的支援,應該來講,大家也看到了NPO的好處。
問:模型廠商對於950DT用在模型訓練上,給華為反饋了那些需要改進的領域和問題?華為對大模型的預訓練做了那些晶片和底層方面的調整和最佳化?
廖恆:此前昇騰晶片遇到的第一個障礙其實並非硬體本身,而主要是生態壁壘。就在兩年前,昇騰軟體層面仍存在巨大障礙,而CUDA在這方面顯然具有壓倒性優勢,因為整個學術界都是伴隨CUDA成長起來的,所有演算法開發者都已習慣了PyTorch加CUDA的便利。
過去18個月發生了巨大變化。首先,模型的數學複雜程度發生了巨大變化,程式設計複雜度也隨之增加。其次,模型正變得非常細粒度,這意味著無法再僅用PyTorch編寫程序並保持效率。因此,即便是演算法開發者,也必須轉向超大規模核心的程式設計風格,需要新的程式語言,這已經是前沿實驗室的發展方向。
如今,隨著新的編譯器語言出現,它們正在逐步取代並平衡CUDA的壁壘,前沿實驗室已不再像兩年前那樣重視CUDA。這是軟體層面的壁壘消解。我認為我們正在接近甚至達到平衡,差距已大幅縮小。
其次,關於晶片本身,我們擁有自身優勢,正如我講到的UB和Nested BSP模型。這不僅是對單個晶片程式設計,更是以便捷的方式對大量晶片程式設計,我們正在提供這些能力。而在晶片內部,我們也吸取了此前的教訓,做出了大量改進。
整體上,我們正在縮小輝達與昇騰之間的差距。我認為如今主要差異已大幅縮小,當人們使用這些處理器開發時,不再感到陌生。
問:關於UnifiedBus技術,這是國內在先進製程受限情況下走出的中國特色路線,還是未來全行業都可能的方向,輝達也有可能往這個方向走嗎?
徐直軍:UB是一條創新之路,我認為也是未來AI計算的必由之路。
因為只有UB這種互聯技術,才能實現百萬級處理器的巨大電腦。而上百萬的處理器像一台電腦一樣工作,才能真正實現更好、更高效率的訓練和推理,所以它是必由之路。相信過不了幾年,大家都會朝著這條路走。
為什麼開放UB協議?就是因為相信整個產業界會朝著這條路線走。這樣,為AI走向AGI,需整個產業界共同努力。廖博為什麼以論文形式公佈Peerium計算架構,也是因為這一創新架構就是AI時代的計算架構。960隻是節奏變快了,規格和我去年講的一樣;HBM是在960里面的,沒有HBM的進步,也沒有960的進步。
今天UB互聯技術是整個Peerium計算架構實現的基礎。無論是UB互聯技術還是Peerium計算架構,我們都認為是AI時代的未來之路。
我多次講過,在單晶片上,我們的設計沒有任何問題,只是仍受制於國內的工藝。但將多晶片互聯起來成為一台電腦,我們已經處於全球領先的地位。這是基於架構的創新和互聯技術的創新,而且這些研究工作不是在制裁後才開始的,而是在制裁之前就開始了。第一顆AI晶片以及華為的整個AI戰略,是我在2018年HC大會上發佈的;2019年,我們發佈了超節點和叢集。自那以後我們就認為,AI要支撐大規模的訓練和推理,需要新的架構、新的互聯技術,也是從那時開始不斷投入研究、不斷創新,才有了今天講的創新計算架構和UB互聯技術。
我相信現在產業介面臨的問題都是一樣的。在多卡計算系統中,MFU(模型浮點算力利用率)是很關鍵的指標。大模型訓練過程中,突然一個卡故障,或一個卡性能忽然下降,都會對訓練造成巨大損失。
基於UB互聯技術、基於Peerium計算架構做出的超節點和叢集,可以大幅提升MFU,這已經被驗證了。這也是頭部模型廠商採用昇騰950訓練最喜歡的一點。我們還能提供原廠服務,讓提升MFU更有保障,訓練成本反而降低,訓練迭代速度加快。 (財聯社AI daily)
