徐直軍:華為昇騰(中國份額)已超輝達!

北風窗
•
AI速讀
華為輪值董事長徐直軍表示,昇騰晶片在中國市場份額已超越輝達,主攻以 Peerium 計算架構與 UnifiedBus 高速匯流排技術為核心的 SuperPoD 解決方案,可支援百萬級處理器協作。針對美國製程限制,華為透過架構創新與互連技術突破,大幅提升模型浮點運算利用率 (MFU),並強調 NPO 光互連技術在成本與可維護性上優於 CPO。同時,廖恆博士指出,隨著新編譯器語言的出現,昇騰與 CUDA 的軟體生態差距正在縮小,華為正致力於推動中國半導體價值鏈的全面自給自足。

軟體生態與CUDA差距正在縮小

近日,華為全連接大會期間,華為輪值董事長徐直軍與海思首席科學家廖恆博士與多家媒體機構的記者進行了問答環節,討論了華為面向人工智慧時代的Peerium計算架構以及UnifiedBus(UB,靈衢匯流排)。

在去年的華為全連接大會上,徐直軍發表了主題演講,發佈了昇騰晶片及其路線圖(包括950、960、970,以及SuperPoD和SuperCluster)。他還宣佈了UnifiedBus協議的開放發佈。

在今年的華為全連接大會上,華為發佈了昇騰950和Atlas 950 SuperPoD。當業界都在談論SuperPoD或超級節點時,實現這些產品的方式卻有著巨大差異。SuperPoD的關鍵在於讓數千甚至數萬個處理器像一台電腦一樣工作。

Atlas 950 SuperPoD由華為首創的新計算架構驅動。這一架構如今可以讓一百萬個處理器像一台電腦一樣工作。該架構被稱為Peerium,它通過巢狀平行、統一記憶體定址和對等互連,實現了百萬處理器等級的強擴展。它通過引入巢狀BSP(巢狀批次同步平行)擴展了圖靈的平行範式。

該架構還擴展了馮·諾依曼單機架構,超越了數十年來盛行的主從設計範式。鑑於業界現有技術無法支援這一架構,華為發明了一項關鍵互連技術——UnifiedBus。最終,一百萬個處理器能夠真正像一台更大的電腦一樣工作。

UnifiedBus是一種高速匯流排,採用開放協議,可無限擴展,用於連接CPU、NPU、記憶體、SSD、介面卡和交換機。借助UnifiedBus,實現了跨計算、記憶體和網路的對等互連。這從根本上超越了傳統的主從架構。

Atlas 950 SuperPoD是基於Peerium計算架構建構的產品。目前,一個擁有25.6萬張計算卡的SuperCluster正在部署和測試中。

以下為採訪實錄(深科技略做整理):

1、華為昇騰950加速供應:中國市場份額已超輝達

問:廖博士,您的論文提到了一款由25.6萬張卡組成的SuperPoD。這是你們技術的上限嗎?能否進一步談談市場對你們產品的需求?

廖恆:25.6萬,或者說大約20萬,這個數字不是隨意選擇的。

首先,這些大型叢集的目的是用於訓練。它擁有能夠支援基礎模型訓練的硬體基礎設施,而如今的基礎模型已經達到5兆參數的規模。

未來兩年,中國大約會有6到7家前沿AI實驗室,它們都將致力於訓練規模在10兆到40兆參數之間的基礎語言模型。這些數字大致與記憶體容量和SuperPoD的規模相匹配。所以,你需要如此規模的 infrastructure 來訓練這些模型。

第二,在中國,大多數資料中心在電網方面都有國家規劃。因此,考慮到單個自治區域和單個資料中心園區的電力輸送系統設計,20萬是一個相對保守的數字。

正如我所說,大家肯定對全球正在發生的AI模型競賽非常熟悉。在中國,至少有三到四家一線玩家已經得到廣泛認可,並達到了一線地位。

問:你們有什麼計畫鼓勵中國的模型提供商使用昇騰晶片進行訓練?

徐直軍:對於昇騰950,我們首先向市場推出了950PR。它主要用於AI推理,目前市場上可供應的總量不是很大。基於昇騰950DT的SuperPoD主要用於AI訓練。目前它們正在測試中,大規模供應將在今年年底或明年年初開始。我們正在與AI模型提供商進行廣泛的對話和討論。使用昇騰950DT進行訓練的測試結果相當不錯。我相信從明年開始,大量AI模型訓練將基於使用昇騰950DT的SuperPoD。我認為歸根結底,不在於我們要多努力去推動模型提供商,而在於我們有多少供應能力。我們只能根據生產多少來供應。我們希望價值鏈能更快地擴大產能,增加供應。

問:華為對美國領先AI模型提供商近期呼籲放緩AI開發有何看法?

徐直軍:我們需要看中國和美國AI發展的水平和節奏。中國的AI模型主要是開源模型,其進展相對透明。如果我們看美國的主流模型提供商,他們擁有更多算力,所以也許只有他們自己知道其模型的複雜程度處於什麼水平。中國市場對AI風險的感覺可能比美國弱。中國的模型提供商需要加快步伐,達到他們也能感受到AI發展風險的水平。然後,也許他們會與美國領先的模型提供商有同樣的感受。但我始終相信,我們需要在推動AI發展和管控AI風險之間取得平衡。至少,底線是我們需要確保AI向善,而不是AI作惡。

問:華為是否有計畫將Atlas 950 SuperPoD推向中國以外的其他市場?如果有,你們的目標市場是那些?能否分享你們在中國市場份額的資料?你對中國推動晶片自給自足有何看法?

徐直軍:由於我們甚至沒有足夠的產能滿足中國國內的需求,我們沒有計畫全面拓展國際市場。但確實有幾個國家有非常強勁的需求。我們正在進行一些測試,並向這些國家提供一些供應,但數量相當有限。

目前,很難收集輝達在中國市場份額的資料。但根據我們收集的資料,昇騰已經超越了輝達。

中國推動晶片自給自足是必然的前進道路。中國是一個擁有14億人口的國家,是一個工業強國,人們的工作和生活方式與晶片緊密相連。中國人有強烈的緊迫感,不會接受由別人決定我們能否獲得某些產品的未來。即使我們的晶片可能不那麼先進,至少供應是有保障的,這樣你就不必日復一日地擔心晶片供應。我認為這肯定是前進的道路。對於中國政府、對於國內產業、對於華為來說,前進的道路無疑是推動晶片和整個半導體價值鏈的全面自給自足。我們也相信這遲早會成為現實。

2、華為UnifiedBus靈衢匯流排:百萬處理器如何像一台電腦工作?

問:你們的UnifiedBus互連技術源自你們在計算和通訊領域的長期優勢。UnifiedBus有多少來自你們的網路部門?

徐直軍:UnifiedBus不僅僅源自我們業務的網路部分。我們整合了不同的互連協議,開發出一個統一的協議。網路更多地與IP協議相關,其延遲要高得多。當我們看計算互連時,它與傳統網路不同,它更多地與匯流排相關,匯流排應該提供低延遲和高速度。當我們決定做這個產品本身時,我們的想法是把它放在計算部門,而不是傳統的網路部門。我們認為,如果我們想提供高速、低延遲和統一協議的UnifiedBus,這是更好的選擇。

廖恆:如果你把UnifiedBus看作一群人的智慧結晶,它是由電腦架構師構思的,但是由網路團隊養大的。

問:UnifiedBus同時適用於橫向擴展和縱向擴展,而輝達分別用NVLink和InfiniBand應對這兩種場景。那麼華為將協議統一為一個UnifiedBus同時支援縱向和橫向擴展,是出於什麼考慮?與類似解決方案相比,UnifiedBus有那些優勢?

徐直軍:這不是輝達是否開發統一技術的問題。這是他們是否有能力開發這種技術的問題。他們最新的NVL72解決方案在機架內通訊頻寬高達1.8 TB/s。但一旦使用InfiniBand進行機架間通訊,頻寬就降至0.2 TB/s。如此低的機架間通訊頻寬,根本無法讓一百萬個處理器像一台電腦一樣工作。我認為每個人都希望擁有超高速互連,用於機架內、機架間、資料中心間,甚至自治區域間的通訊,因為這樣我們才能將大量處理器變成一台電腦。這就是UnifiedBus的價值所在。我們可以使用一個統一的協議,在所有層級實現高速互連。從技術上講,UnifiedBus的功能就像電腦的匯流排,它不僅僅支援鏈路。基於UnifiedBus,我們可以實現高達800 GB/s的機架間通訊頻寬。

去年我們將UnifiedBus協議開放後,下載量最多的地方是矽谷。最初,輝達可能不想做NVL72解決方案;他們可能瞄準的是NVL256解決方案。但最終他們做出了NVL72解決方案,而不是NVL256解決方案。然而,華為開發了搭載384個910C處理器的SuperPoD解決方案,我們已經出貨了1000多套。這很大程度上是因為我們有UnifiedBus用於這個解決方案。輝達使用NVLink進行機架內通訊,他們的機架間通訊速度不夠高,這使得他們很難按自己的意願擴展。

廖恆:你問題的一部分是關於為什麼單一協議是必要的,因為顯然輝達和大多數其他廠商至少使用了兩個協議,在某些情況下可能更多。想像一下,如果你的旅程涉及飛機、高鐵和汽車,中轉相當耗時。超級節點內部需要大量的流量交換。如果你從NVLink轉換到InfiniBand,至少需要微秒級的時間從一個協議轉換到另一個協議。有了這兩個獨立的協議,很難滿足延遲要求。

有了UnifiedBus,我們使用單一協議。這意味著如果你將一個封包從縱向擴展網路移動到橫向擴展網路,可能只需要150納秒。協議轉換開銷至少節省了一個數量級。

3、華為Hi-ONE光互連:為什麼選擇NPO而不是CPO?

問:在採用UnifiedBus的Atlas 950 SuperPoD中,有多少縱向擴展是通過電訊號實現的,有多少是通過光訊號實現的?你認為光學最終會佔據整個機架嗎?最大的障礙是什麼?

徐直軍:華為今天上午發佈的Hi-ONE模組是一個NPO模組,支援7.2T頻寬,距離主晶片僅5釐米。我們使用銅線連接這兩者,其餘全部是光學。所以我們可以說這個SuperPoD幾乎是一個全光SuperPoD。光源也整合在Hi-ONE模組中。我想說,在未來兩到三年內,沒有其他廠商能夠生產類似的模組。華為能夠開發和量產這個模組,是因為我們在光子學方面有多年的經驗。


廖恆:在我職業生涯的早期,幾乎可以追溯到20年前,我們就已經在談論讓晶片走向光學。因為我們都知道光學傳輸距離短、衰減很小,所以訊號可以高速傳輸更長的距離。

但如果你看Hi-ONE內部的電路,元件並不多。但量產過去對我們來說非常困難。因為光學涉及很多物理問題。如果溫度變化幾度,就會影響二極體的物理特性、折射率和波導特性,導致無法工作。

我認為最大的採用障礙是對可靠性的擔憂,因為東西會壞。大多數其他提供商幾乎主要選擇將雷射器放在外部。想想如果你必須用單個光源饋送32路訊號,光源的功率必須乘以32倍。這是很大的功率,會在耦合介面和其他所有地方導致問題。我們選擇將光源整合到模組中。這純粹是工程上的務實選擇。Hi-ONE是經過一個又一個妥協後的絕佳方案,很快就會進入量產狀態。

問:你提到昇騰晶片在中國大陸的產能和供應有限。那麼阻礙中國大陸產能提升的最大障礙是什麼?到什麼時候華為能夠確保大規模穩定供應?

徐直軍:中國大陸的瓶頸基本上與世界各地的瓶頸相同。全球產業沒有為我們所看到的AI激增做好準備。當我們看光模組和記憶體產品的供應商時,他們以非常高的溢價銷售,不一定是因為他們產品非常好,而是因為供應相比市場需求非常短缺。只有當中國大陸和全世界的供需達到平衡時,這個瓶頸才能完全解決。在我看來,全球範圍內的供需平衡將在2029年左右實現。在中國大陸,可能還會更慢。當我們看這種供需平衡時,我們必須考慮到AI領域不斷發展的技術,如NPO(近封裝光學)和CPO(共封裝光學)。

如果我們回顧華為的歷史,無論是在通訊業務還是IT業務,我們目前向市場供應的量已經可以稱為“規模化供應”。但如果我們將供應量與AI基礎設施的需求相比,我認為還非常少。如果我們要滿足客戶想要的供應量,這種平衡最終將依賴於整個中國行業的供需平衡。

問:有報導稱馬來西亞正在考慮將華為昇騰910C加速器作為其主權AI計畫的核心。你如何平衡國內和國外客戶的需求?

徐直軍:對於任何客戶來說,他們部署華為解決方案的決定是基於地緣政治和多供應商策略的考慮。所有公司都必須著眼長遠,努力確保供應安全。在這種背景下,昇騰當然是很多客戶的選擇之一,儘管可能與一些競爭對手存在一些差距。滿足國內客戶和國際客戶需求之間的平衡其實很簡單:我們優先考慮對算力有迫切需求的中國客戶;在中國以外,我們只向非常有限的客戶供應,這些客戶要麼無法獲得替代解決方案,要麼想要一個替代解決方案。

問:當華為決定選擇NPO而非CPO時,華為內部最重大的反對意見是什麼?

徐直軍:華為內部似乎沒有就此進行辯論。華為從事光器件、光模組和昇騰晶片,所以我們知道那個是我們的最佳選擇。因此華為內部的共識很早就達成了。我們就選擇了NPO,而不是CPO。除此之外,我們認為從工程實施、成本、可維護性和良率等多個角度來看,NPO將在很長一段時間內是最佳選擇。

行業參與者隨著時間的推移對NPO和CPO有了更清晰的認識。這在光互聯論壇(OIF)最近的兩次討論中得到了完美體現。在第一次OIF討論中,一些成員不支援NPO——他們決心做CPO。但在最近的OIF討論中,只有非常有限的參與者仍然反對NPO,並且啟動了一個新的NPO項目。NPO仍然有大約5釐米的銅互連,比CPO大約5毫米的銅互連要長。然而,與CPO相比,NPO將成本降低了近40%。NPO還有另一個好處:如果光引擎出問題,整個AI晶片不會隨光引擎一起報廢。當然,CPO和NPO不是誰取代誰的問題;而是在工程實施、成本、供應鏈和可維護性等因素之間的平衡選擇。這裡沒有對錯之分。

華為完全致力於NPO。我們正在推動標準化努力,也幫助發展整個產業生態,以便NPO有一條技術路徑可以蓬勃發展。我們不是說CPO不好。OIF的40家廠商在看到NPO能帶來的好處後,現在都支援NPO。

4、昇騰950DT大模型訓練:軟體生態與CUDA差距正在縮小

問:關於使用950DT進行訓練,你們從模型提供商那裡收到了那些關於需要改進的領域和問題的反饋?你們做了那些改變來讓昇騰上的預訓練更好?

廖恆:昇騰遇到的第一個障礙實際上不是硬體本身。主要是生態障礙,因為兩年前昇騰仍然存在巨大的軟體障礙,而CUDA顯然具有主導優勢,因為整個學術界是與CUDA一起成長起來的。所以所有演算法開發者都習慣了PyTorch加CUDA的便利。

過去18個月發生了巨大變化。首先,模型數學的複雜程度發生了巨大變化,程式設計複雜度也相應增加。其次,模型變得非常細粒度,意味著你不能再只靠PyTorch寫程序並保持效率。所以,即使對演算法開發者來說,他們也必須轉向這種大核心風格的程式設計,需要採用新的程式語言。這已經是前沿實驗室的開發方式。

現在,隨著新的編譯器語言出現,這些新編譯器正在取代並逐漸平衡CUDA的障礙,因為CUDA不再被前沿實驗室視為重要,遠不如兩年前那麼重要。這就是軟體障礙的消解。我認為我們正在達到同等水平,甚至更接近平衡。差距大大縮小了。

其次,晶片本身,我們有我們自己的優勢,如我所說,UnifiedBus和巢狀BSP模型。這不僅僅是程式設計單個晶片,還涉及以便捷的方式程式設計大量晶片。我們正在提供這些。在晶片內部,我們吸取了教訓,做了很多改進。

總的來說,我們正在縮小輝達和昇騰之間的差距。我認為如今,主要差異已經小得多。當人們使用這些處理器進行開發時,不再感到那麼陌生了。

問:下周,中國領導人將會見美國總統,AI將是他們討論的一部分。作為中國企業家,你對那次會晤有什麼樣的合作期待?

徐直軍:所有中國企業可能都有一個共同的願望,那就是在市場競爭中和平共處,不受政府干預。我們以前生活在全球化和充分競爭的時代,企業依靠創新和產品贏得客戶。但隨著地緣政治影響日益加劇,全球化正在離我們遠去。企業希望進入全球市場,通過創新和產品贏得客戶,而不是被困在無法買賣自己想要的東西的境地。

過去30多年,華為依靠創新在市場上贏得了一席之地。我們依靠持續、大量的研發投入來提高產品競爭力,從而贏得客戶的信任。2007年至2025年間,我們的累計研發投入超過1.8兆元人民幣。我們還承諾將其中10%的研發支出用於基礎研究。正是因為我們大量的研發投入和對創新的強烈關注,才轉化為更具競爭力的產品。我們在競爭激烈的市場中以創新驅動的方式,解釋了華為如何成為今天的華為。

關注通訊行業的記者朋友們可能知道華為過去幾十年走過的歷程。AI也是一樣。我們只是走一條我們擅長、能夠引領我們建立面向未來競爭力的道路。

5、徐直軍談AI算力未來:Peerium與UnifiedBus突破先進製程限制

問:考慮到中國大陸無法獲得先進製程節點,UnifiedBus是中國大陸的獨特路徑嗎?還是整個行業遲早都需要它?輝達可能會朝你們的方向發展嗎?

徐直軍:UnifiedBus是一條創新之路,也是AI計算的未來之路。

因為只有借助UnifiedBus互連技術,你才有可能建構一台擁有百萬處理器的巨型電腦。當一百萬個處理器像一台電腦一樣工作時,這為更好、更高效的AI訓練和推理奠定了基礎。因此,我將UnifiedBus視為未來AI時代的路徑。我相信,在未來幾年,其他參與者肯定會跟進。

這也是我們將UnifiedBus協議開放的原因。因為我們相信整個行業將朝著同一方向前進,我們期待全行業共同努力,邁向通用人工智慧(AGI)。這也是廖博士發表論文介紹我們Peerium計算架構的原因,因為Peerium是AI時代的架構。對於960,它的規格與我去年介紹的基本相同,唯一的變化是市場供應的步伐更快了。HBM是960的一部分。沒有HBM的改進,就不會有整個960的改進。

UnifiedBus互連技術是我們實施Peerium計算架構的基礎。UnifiedBus互連技術和Peerium計算架構都是通往未來AI時代的路徑。

我已經說過很多次,當我們看單個晶片時,華為面臨的問題不是設計本身,而是中國大陸可用先進製程節點的限制。但如果我們互連大量晶片建構一台電腦,我認為我們在這方面已經取得了全球領先地位。這是建立在我們架構和互連技術創新基礎上的。這些領域的努力始於美國限制之前,而不是之後。正是在2018年華為全連接大會上,我發佈了華為的首款AI晶片以及我們的AI戰略。2019年,我們發佈了SuperPoD和叢集。從那時起,我們就一直認為,為了支援AI訓練和推理,行業需要新的架構和新的互連技術。也是從那時起,我們開始加大研發和創新投入。這為我們發佈新的計算架構和UnifiedBus互連技術奠定了基礎。

我相信整個行業都面臨同樣的問題。一旦你處於多計算卡或多加速器環境中,模型浮點運算利用率(MFU)就是一個非常關鍵的指標。當你進行大型AI模型訓練時,一旦一張計算卡出現故障或性能下降,就會給整個AI訓練帶來重大損失。

基於UnifiedBus互連技術和Peerium計算架構,我們開發了SuperPoD和基於SuperPoD的SuperCluster。這些解決方案可以大幅提高MFU,這是已經得到驗證的事實。這也是頂級模型提供商在使用昇騰950訓練AI模型時最看重的。我們還可以提供原廠服務。這可以幫助進一步提高MFU,降低AI訓練成本,並使AI訓練迭代更快。 (深科技)