16萬張昇騰砸進內蒙古:算力反圍剿開打! 輝達在華份額暴跌至8%!

北風窗
•
AI速讀
中國AI算力版圖發生劇變,輝達在華市佔率崩跌至8%,而華為昇騰憑藉近50%的市佔率反超。主因在於輝達特供版H20性能嚴重縮水,導致客戶轉向國產方案。華為採取「系統化」策略,透過高效能封裝與光互連技術克服單卡性能差距,並結合內蒙古的低成本電力與散熱優勢降低營運成本。同時,DeepSeek等頂尖團隊透過重寫算子適配華為CANN軟體棧,打破CUDA壟斷。此次轉型顯示美國的技術封鎖反而加速了中國AI底層生態的自主化與二次發育。

內蒙古烏蘭察布,風吹草低,見到的不是牛羊,是資料中心。

這片戈壁風光富集,冬天漫長寒冷,一座吉瓦級算力基地晝夜轟鳴。穿過機架和風道,讓矽谷睡不著的是:DeepSeek正部署至少16萬枚昇騰晶片。

墨卡托中國研究中心的資料擺在這裡,曾拿下中國AI晶片95%份額的輝達,在華跌到8%,昇騰吞下近50%,2026年收入預計破120億美元。徐直軍確認,昇騰在華銷量已反超輝達。

從95%到8%,這是算力反圍剿。

轉折要從特供晶片H20說起。A100、H100、B200被禁後,黃仁勳為保市場推出降規版H20,賭中國客戶會含淚買單。

各家CTO算完帳就清醒,H20保留96GB記憶體,算力被砍80%以上,等於賣你一輛法拉利,後備箱夠大,引擎蓋底下是割草機。

更要命的是固定成本,機櫃、供電、散熱一樣不少,湊齊同樣算力要買3倍伺服器,佔3倍機架,耗3倍電,還可能二次斷供。這不是買晶片,是請回一個吃電不幹活的祖宗。

單卡製程被卡死,國內沒在單卡極限上死磕,換了打法。

輝達頂級單卡是昂貴的百噸重卡,華為不造重卡,改鋪十萬節車廂的高鐵網。十萬卡叢集裡,決定訓練速度的早不是單顆算力,而是通訊牆和記憶體牆,也就是晶片之間說話快不快。

兩塊硬骨頭被啃下來。國產2.5D、3D封裝加自研記憶體合封,單卡記憶體頻寬拉到1.6TB每秒;近封裝光互連把光模組封在晶片旁,靠靈衢光網路把4096顆晶片組成超節點。16萬張昇騰這樣連起來,微秒級延遲讓它們協同得像一顆晶片,單顆電晶體的差距靠系統吞吐抹平了。

這裡有個被忽略的真相,為什麼偏偏是內蒙古。算力到今天已不只是晶片生意,是把電變成智能的生意。誰拿到便宜的電,誰能免費排掉熱量,誰就捏住成本命門。戈壁的風光和冬天就是天然電源和散熱器。輝達贏了製程,中國正把戰場拖回有優勢的電網和土地。

軟體更難。過去15年全球AI泡在CUDA閉環裡,早年做翻譯層直接挪程式碼,性能損失30%到50%,複雜指令直接崩。套殼沒有出路。

DeepSeek乾脆切掉CUDA遷入CANN,和華為工程師用Ascend C把400多個算子逐個重寫。華為下一代還做了分工,950PR負責吞下十幾萬字上下文,950DT負責吐答案。軟體棧在內蒙古跑通後,推理效率已能媲美同規格叢集。

封鎖本想把中國AI卡進黑暗時代,結果幫華為清掉最強對手,逼著頂尖演算法團隊和國產底層綁死。最狠的壓力沒掐死這個產業,反倒逼出二次發育。

當年拿來築牆的磚,被拿來墊了腳。 (科技直擊)