DeepSeek加速向華為靠攏

北風窗
•
AI速讀
DeepSeek 近日宣布開源面向華為昇騰平台的 TileLang 及一系列基礎設施元件,實現與輝達平台功能的「一一對應」,將合作深度由推理適配提升至核心模型研發與訓練層級。雙方共同優化昇騰 950 超節點方案,旨在降低國產硬體適配成本並提升運算效率。在籌備 500 億元融資與潛在 IPO 之際,DeepSeek 此舉象徵其正致力於構建獨立於 NVIDIA 之外的算力硬體路線,對推動國產 AI 生態具有示範意義。

9月30日,DeepSeek宣佈開源面向華為昇騰的基礎設施元件,涵蓋TileLang算子程式語言及其編譯支援、計算庫和分佈式通訊庫,並強調:“所有元件與此前面向輝達平台的開源元件一一對應。”

DeepSeek正將支撐自家模型研發的核心工具和算子能力,系統地擴展到昇騰平台。雙方的合作,由模型適配進一步深入訓練與推理所依賴的基礎軟體。

官方還披露,DeepSeek與華為共同推進基於昇騰950的128卡超節點方案,並對計算與通訊進行深度最佳化。


01 讓核心研發工具有另一條硬體路線

這套開源裡,最關鍵的角色是TileLang。

大模型研究中的新想法,需要通過算子變成晶片能夠執行的計算。算子開發越複雜,研究者驗證新結構、最佳化訓練效率所需的時間就越長。DeepSeek對TileLang的期待,是讓開發者用更簡單的語言程式設計,同時保留充分利用晶片性能的能力。

按照DeepSeek的介紹,相較CUDA,TileLang能夠簡化程式碼邏輯、提高開發效率;相較其他同類高級語言,其程式設計模型能夠更充分地發揮晶片特性。這條路線先在輝達平台得到驗證,如今已承載V4系列模型訓練中大部分算子的實現,是DeepSeek開發高性能算子的核心工具。

此次昇騰版本封裝了底層Ascend C指令。DeepSeek稱,目前訓練中使用的每一個TileLang算子,在昇騰上都有對應的高性能實現。

這項進展的意義,是DeepSeek能夠將已經熟悉的研發工具延伸到另一種硬體上,減少為不同平台重複開發的負擔。昇騰獲得的支援,也更貼近模型團隊自身的訓練需求。

但程式設計工具只是其中一環,模型還需要高效執行具體計算,並在多張卡之間交換資料。

因此,此次開放的元件還包括加速矩陣運算的DeepGEMM、處理跨裝置通訊的DeepEP,以及覆蓋向量計算與訪存、稀疏注意力,以及用於注意力索引和採樣的Top-K選擇等操作的TileKernels、FlashMLA和DeepSelect。它們為常見任務提供可復用的實現,讓開發者不必逐項從頭最佳化。

“一一對應”也由此有了實際含義。部分項目已經對齊上層介面,例如TileKernels支援同一套Python介面在輝達GPU與華為NPU上運行,底層實現根據硬體選擇。

不過,介面能夠復用,性能仍需針對硬體打磨。DeepSeek在公告中感謝華為團隊給予“毫無保留的大力支援”,雙方圍繞128卡超節點共同最佳化計算與通訊,正是為了讓這些軟體能力在具體系統中發揮作用。

DeepSeek稱,多項關鍵測試用例的性能已接近硬體上限。這些成績仍屬於特定測試條件下的結果,但顯示雙方的工作已經進入性能深度最佳化階段。

此次進展之前,昇騰生態已圍繞DeepSeek模型開展多輪適配。

02 從推理服務,逐步進入模型研發

2025年8月,DeepSeek發佈V3.1時,解釋其UE8M0 FP8設計面向即將發佈的下一代中國國產晶片。雖然沒有點名華為,但這一表態說明,中國國產硬體需求已開始進入模型團隊的技術設計考量。

2025年9月29日,DeepSeek-V3.2-Exp發佈,引入稀疏注意力機制,並開放相關算子實現。同一天,TileLang-Ascend開源,圍繞昇騰建設高級語言開發能力的工作由此公開。

2026年4月24日,V4預覽版發佈,昇騰適配已延伸至推理和訓練側。開放原子開源基金會披露,相關實踐包括推理最佳化、Ascend C融合算子,以及訓練最佳化和續訓練;TileLang-Ascend也發佈了V4算子。

此次DeepSeek明確將適配範圍對齊自家訓練使用的TileLang算子,並將計算與通訊元件成套開放,同時披露了與華為圍繞昇騰950開展聯合最佳化的進展。

從已發佈模型的部署適配,到面向新結構的算子最佳化,再到此次基礎設施元件開放,昇騰對DeepSeek的支援正進一步深入模型研發所需的軟體層。

03 擴充算力,需要跨過軟體這一關

9月24日,騰訊科技報導,DeepSeek規模為500億元的第二輪融資已接近結束,但部分稽核仍在進行,具體落地時間尚不確定。路透社此前也報導,DeepSeek已聘請中信證券籌備潛在的科創板IPO,上市時間及募資規模尚未確定。

資金可以支援研發和基礎設施投入,但新增硬體能否轉化為有效算力,還取決於軟體適配與運行效率。

據The Information報導,梁文鋒在近期投資者會議上表示,DeepSeek將超過70%的算力用於模型訓練,留給推理的算力不足30%。這也解釋了,為訓練所依賴的核心工具增加硬體選擇,具有怎樣的現實份量。

對DeepSeek而言,昇騰上的工具與元件越完善,未來選擇算力平台時,需要重新投入的工程成本就可能越低。對華為而言,與模型團隊共同最佳化,有助於讓晶片軟體更快跟上模型結構變化,將適配經驗用於後續產品。

開源又使這種合作具備向外擴展的可能。DeepSeek表示,希望TileLang昇騰版本能為更多AI晶片建立高可用軟體生態起到示範作用。如果其他團隊可以復用這些工具,更多中國國產晶片承接前沿模型的門檻也有望降低。

從元件開源到穩定承擔大規模生產任務,仍有工作要做。DeepEP昇騰版還列有開發中的功能,此次公告也未披露V4已在昇騰上完成全流程大規模訓練,但可以看出DeepSeek正與華為一起完善一條能夠持續支援模型研發的硬體路線。 (騰訊科技)