【WAIC 2026】WAIC 上那個 “ 埋頭造鏟子 ” 的摩爾線程,才是真狠人

剛從 WAIC 回來,腳板還隱隱作痛。

今年的 WAIC 有多誇張?展覽面積首次突破 10 萬平方米,1100 多家企業帶來了 3000 多項展品,超過 300 款產品全球首發。世博、張江、徐匯三大片區四館聯動,老狐在世博從 H1 逛到 H4,微信步數直接幹到幾萬步。

室外體感溫度逼近 40 度,有人說“上海彌補了人不能進空氣炸鍋的遺憾”。但最熱的還得是 WAIC,一張 168 元的單日票被黃牛炒到 1300 元,三日通票喊出  3000 元。就這麼熱、這麼大、這麼擠,還是擋不住大家往裡湧。

說實話,這屆 WAIC 看點太多了。

華為把 1024 卡的昇騰 950 超節點真機搬到了現場,宇樹的載人變形機甲 GD01 秀翻全場,H1 館的 AI 手機展台和 H3 的機器人館被擠得水洩不通。

但我卻想從 H2 館拎出摩爾線程跟大家聊聊。即便它不是“鎮館之寶”,也沒有機器人的熱鬧。

但當大家都在關注“AI能幹什麼”時,老狐想的卻是:AI 的算力從那來,怎麼來,怎麼才能更便宜地來?

摩爾線程恰好是一個值得觀察的樣本。

就像一個淘金熱現場,所有人都在炫自己淘到了多大的金子,而有人還在給他們埋頭造鏟子。

WAIC上“最不炫技”的展台

老狐在之前的文章裡提到過,H2 館的摩爾線程重點以概念展示為主。所以他們的展台,畫風看起來不太像一家晶片公司。

摩爾線程把展台分成三個區域:模型訓練工廠、詞元生產工廠、智能體生產工廠,並展示了十萬卡的算力叢集 MTT C256。

這三大工廠,聽起來像概念的東西,其實就是摩爾線程在 WAIC 上擺出來的整套解決方案。可以把它們理解為摩爾線程“ AI工廠”的具體形態:三條串在一起的智能生產線。

去年 WAIC 上,摩爾線程就提過“AI工廠”這個概念,但當時更像一個宏大的概念。

一年過去,這次他們帶來了實打實的成果——從零訓練的 MoE-236B 基礎模型、5D 世界模型全端原生訓練跑通、DeepSeek 等主流大模型“發佈即適配”。概念落到了地上。

但“AI工廠”這個詞,不是摩爾線程發明的。

黃仁勳最早在 2022 年就提出了“AI工廠”概念,他說“AI工廠的建設是人類歷史上最大規模的基礎設施擴張”。華為也在講“AI工廠”,去年昇騰的展台標語就是“AI工廠,算力底座”。

但不同階段、不同位置的公司,講出來的內涵卻不一樣。

輝達的“AI工廠”:核心是算力基礎設施本身,圍繞能源、晶片、基礎設施、模型、應用,建構從晶片到系統到生態的完整閉環。黃仁勳說“AI工廠”是基礎設施,本質上還是在賣他的 GPU 和叢集方案。

摩爾線程作為追趕者,它的“AI工廠”說的是“如何在現有基礎上把算力轉化為智能的生產效率”——從晶片設計、叢集搭建、軟體最佳化到模型訓練,一整套方法論。

摩爾線程提出“AI工廠”不是跟風,而是基於一個深層變化:AI 產業正在從“造模型”進入“造智能”的時代。或者說,從對話方塊走向真實應用,從實驗室走向社會化大生產。

這不是摩爾線程一家的事,是整個產業正在發生的變化。

摩爾線程的三大工廠,就是這個趨勢下的具體落地:

模型訓練工廠好比“煉鋼廠”,產出智能的“粗坯”(大模型本身)。這個環節門檻很高,動輒數萬塊 GPU,非常燒錢。華為昇騰的典型代表,去年昇騰 384 超節點已累計商用 750 多套。沐曦、燧原也在做同樣的事情。

詞元生產工廠好比“零件廠”,把“粗坯”加工成可計量的Token。這個環節拼的是成本和效率,誰能把每百萬 Token 的成本打下來,誰就能掌握定價權。

三大營運商、阿里百度等雲廠商都在瘋狂建這類工廠。趨境科技已經能做到日均兆級詞元供應。

智能體生產工廠好比“組裝廠”,把 Token 裝進會幹活的 AI 裡。這是離使用者最近的一環,也是創業公司最有機會的戰場。

階躍星辰做了智能體手機,百度做了“百度搭子”,形態各異,但本質都是把模型能力封裝成可執行具體任務的智能體。

三座工廠串起來,就是一座“AI工廠”裡一條完整的“智能生產線”。這不是 PPT,營運商已經在從賣流量轉向賣 Token,華為 Atlas 950 的賣點也換成了“Token 產出效能”,整個行業都在往這個方向走。

而摩爾線程在全鏈條上都有佈局,這在國產 GPU 廠商裡是獨一份。

三大工廠,到底做出了什麼?

概念講清楚了,來看看摩爾線程在 WAIC 上拿出來的真東西。

先說一個背景:這屆 WAIC 上,算力展區最大的變化不是誰發佈了新晶片,而是超節點幾乎成了標配。華為、沐曦、燧原、中興、阿里、摩爾線程,每家都在展示自己的超節點方案。

這意味著,行業已經形成共識:單顆晶片性能再強也沒用,叢集能力才是真正的護城河。

摩爾線程在展台上的核心展示,是圍繞三大工廠的主線來組織的。

模型訓練工廠:國芯訓國模,不再是口號

這是摩爾線程最硬的一張牌。

他們展示了從零起步完整訓練 MoE-236B 基礎模型。236B 參數,大概什麼量級?GPT-3 是 175B。也就是說,摩爾線程用自己的 GPU 完整訓練了一個比 GPT-3 還大的模型,不是跑推理,是從頭訓練。在國產 GPU 裡,能做到這個的並不多。

更牛的是,北大 EvoPhys 團隊用摩爾線程的 GPU,完成了全球首個5D世界模型的全端原生訓練,連續37天登頂WorldScore“世界生成”維度。所謂“世界模型”,就是讓AI理解物理世界運行規律的模型,是自動駕駛、具身智能的核心底座。

用國產晶片訓練出全球第一的世界模型。這句話放幾年前,沒人敢說。

支撐這一切的,摩爾線程的是誇娥萬卡叢集——10240 張 GPU、10EFLOPS 算力,Dense 模型利用率 60%,有效訓練時長超 90%。

這些數字看起來平常,但懂行的人知道,萬卡叢集最難的不是把卡連起來,而是讓它們持續穩定地跑下去不出錯。

詞元生產工廠:把 Token 的價格打下來

展台現場,摩爾線程展示了基於 MTT S5000 的高性能推理方案。

MTT S5000 的 FP8 算力是1000 TFLOPS,單卡推理吞吐能做到Decode 1000 tokens/s、Prefill 4000 tokens/s。

對 DeepSeek、GLM、Kimi、Qwen 等主流大模型實現了“發佈即適配”。可以說,模型一發佈,當天就能跑。

更重要的是他們推出的“PD分離異構推理”方案。什麼意思?大模型推理有兩個階段:Prefill(計算密集)和Decode(頻寬密集)。摩爾線程的方案是把Prefill放在自己的GPU上,把Decode放在國際主流GPU上,混合部署,性價比大幅提升。

趨境科技在摩爾線程分論壇上透露:他們用摩爾線程的全功能 GPU 與國際主流 GPU 深度融合,已具備日均兆級高品質詞元的供應能力。

1 兆 Token 是什麼概念?粗略算一下,如果每個使用者每天消耗 5000 個 Token,那就是 2000 萬使用者一天的用量。

智能體生產工廠:從數字到物理

這一塊可能是普通使用者最能感知到的。

摩爾線程展出了自研數字智能體“小麥”,掌握 60 多項技能,支援 38 款 APP 的跨應用控制。

還有全端具身智能模擬平台 MT Lambda,給機器人開發者提供從模擬訓練到真機部署的全鏈條工具。現場也開放了家庭 AI 中樞 AICUBE 和 AI 算力本 AIBOOK 的體驗。


寫在最後

華為秀超節點、沐曦秀超節點、燧原秀超節點,摩爾線程秀三大工廠,清微智能秀可重構架構。每家都在展示自己的系統能力,而不是單顆晶片。

DeepSeek V4 發佈當天同時適配華為昇騰、摩爾線程、沐曦、崑崙芯等八大國產算力平台,智譜 GLM-5.2 開 源首日就完成與八大平台的全適配。

這不是某一家公司的勝利,是整個國產算力產業鏈第一次集體亮相、協同作戰。

所以老狐覺得,今年 WAIC 最大的訊號,不是那家 AI 公司發佈了什麼產品,而是國產算力從“有沒有”進入了“能不能規模化落地”的新階段。摩爾線程只是這個變化的一個切片。 (科技狐)