登入
關鍵字
#中國算力
官方認證
北風窗
2026/09/14
•
全國算力網建設迎重大進展,太空算力從概念走向落地
作為數智時代的新型資訊基礎設施,“六張網”之一的算力網建設迎來多項重大進展。 第一財經記者從9月11~13日舉行的2026中國算力大會上獲悉,中國算力平台已實現全國一體化算力統籌監測,中國算力“一張網、一盤棋、一體化”發展格局基本形成。 大會還發佈了普惠算力服務清單,京津冀倡議共建太空算力產業長廊,中國銀行聯合三家營運商啟動“一網三融”算力金融生態共建行動,算力產業鏈上下游的多家企業發佈硬核技術成果。 工信部總工程師鐘志紅在大會上表示,接下來將加快建構“樞紐—區域—邊緣”多層次、梯次化算力架構,持續完善中國算力平台功能;搭建高速互聯、超低時延、韌性強健的算力傳輸通道,按需部署城域毫秒接入;推動算力設施、算電協同等領域創新,加快算力標準體系建設指南編制;降低用算成本和應用門檻,推動分行業凝練高價值場景等。
科技
#數智時代
#算力網建設
#中國算力平台
246人
讚
留言
分享
官方認證
北風窗
2026/07/02
•
中國首個在五萬卡國產算力叢集完成訓練與推理全流程的兆參數大模型深度洞察!
引言:一場被驗證的“豪賭” 2026年6月30日,中國AI產業迎來歷史性一刻。美團正式發佈新一代基礎大模型——龍貓2.0(LongCat-2.0),這是國內首個在五萬卡國產算力叢集上完成訓練與推理全流程的兆參數大模型。 這不僅僅是一次產品發佈,更是一次技術路線的終局驗證。 在此之前,行業普遍認為國產晶片在單卡性能、軟體生態上存在難以踰越的瓶頸,承載兆參數模型的訓練幾乎是天方夜譚。
科技
#中國
#算力
#大模型
246人
讚
留言
分享
官方認證
北風窗
2026/06/16
•
清華超算“冠軍隊”最佳化國產晶片,想把Token服務做到全球第一
這是一支自帶“冠軍基因”的團隊。 翟季冬是帶領清華大學學生超算隊十餘次站上世界冠軍領獎台的“總教頭”,但他心裡一直有個聲音:能否改變所有參賽隊伍都使用輝達圖形處理器(GPU)的境況,讓國產算力走到“台前”。 2023年12月,一群來自清華大學電腦系高性能計算研究所的年輕人聯手創立了北京清程極智科技有限公司(以下簡稱清程極智),清華大學教授翟季冬擔任首席科學家。他們選擇從軟體層面切入創新,為中國晶片量身打造系統軟體,讓國產算力也能高效運行最前沿的大模型。 翟季冬 受訪者供圖
科技
#清程極智
#中國算力
#Token
240人
讚
留言
分享
官方認證
RexAA
2026/05/30
•
讀懂華為τ定律的四層邏輯--中國算力突圍
華為τ定律的四層邏輯 一、"韜(τ)定律"的底層邏輯:不是新摩爾定律,是時間常數的全端壓榨 華為定義的 τ(時間常數)= RC 延遲 / 訊號傳播延時,本質是衡量電路中"資訊跑多快"的物理量。τ 定律的核心思想是:不靠單純縮小電晶體(受限於先進製程封鎖),而是通過四層協同降低系統整體 τ,換取等效性能密度提升。 華為預計 2031 年基於該體系的高端晶片可達等效 1.4nm 製程的電晶體密度/性能水平——注意這是"等效",是系統級最佳化疊加漸進式製程進步的共同結果,而非單靠架構就能無限制替代光刻。
科技
#華為
#韜定律
#半導體技術
240人
讚
留言
分享
官方認證
北風窗
2026/05/01
•
DeepSeek和中國算力下了好大一盤棋
DeepSeek與中國算力合力,實現token成本的大幅降低後,又會反向利多AI應用市場,催生更大的市場空間。兩天兩次降價,效率成了DeepSeek最深護城河2026年4月的最後一個周末,中國AI產業被一連串消息徹底點燃,而消息背後的主角只有一個,DeepSeek。4月24日,DeepSeek正式發佈V4系列預覽版,同步開源Pro與Flash兩款模型,均支援百萬token超長上下文。緊接著的25日與26日,DeepSeek連續兩晚出手降價——先是V4-Pro限時2.5折,再是全系API輸入快取命中價格永久降至首發價的十分之一。兩天兩次調價之後,V4-Flash每百萬tokens輸入快取命中價格僅為0.02元,V4-Pro為0.025元,創下全球大模型價格新低。這樣一場精心策劃的閃電戰,背後是DeepSeek長達一年的艱難求索。但如果依舊將目光放在“價格戰”的淺層敘事,就低估了DeepSeek此番出手的深意。V4的降價已經無關於燒錢換市場,其更大的意義是底層架構效率革命帶來的成本變化。正如高盛Ronald Keung團隊在最新研報中所指出的,“V4的核心意義在於以更低成本支援更複雜的智能體應用落地,從而打開AI應用規模化的新空間”。在DeepSeek-V4的技術報告裡,效率是極致的。V4-Pro在100萬token上下文場景下,單token推理所需浮點運算量僅為V3.2的27%,KV快取佔用僅為10%;V4-Flash更為激進——FLOPs降至10%,KV快取壓縮至7%。這意味著什麼?通俗地說,過去跑一條百萬字上下文需要三台機器的算力,現在一台機器就能從容應對,而且記憶體開銷僅是過去的十分之一。效率飛躍背後,有V4在架構層面的三項關鍵創新:混合注意力機制(CSA/HCA)、流形約束超連接(mHC),以及Muon最佳化器。其中最核心的突破在於混合注意力——CSA(壓縮稀疏注意力)沿序列維度壓縮KV快取後執行稀疏注意力計算,每m個token的KV快取被壓縮為一條記錄;HCA(重度壓縮注意力)則施加更激進的壓縮策略,將m'個token的KV快取合併為單條記錄,但仍保留稠密注意力。這套組合拳在幾乎不影響模型性能的前提下,將長上下文場景的計算與儲存成本砍掉了一個數量級。更精妙的設計體現在細節處:對KV條目採用混合儲存格式,旋轉位置編碼維度保持BF16精度,其餘維度使用FP8精度,這一項便將KV快取容量壓縮近半。閃電索引器內部的注意力計算以FP4精度執行,進一步加速長上下文下的注意力運算。技術壓縮效率,效率兌現成本。這才是DeepSeek敢於連續降價的真正底牌。理解了這一邏輯,便能看穿此次降價的產業含義:相比於其他AI大模型降價拚命上桌,這一次DeepSeek直接用技術優勢主動建構了成本壁壘。V4-Flash以0.02元/百萬tokens的價格橫掃市場背後,每一分錢的降價都有底層架構最佳化作為支撐,而不是資本燒錢補貼的邏輯。競爭對手要跟進,首先得在技術上追平這份效率——而這顯然不是一朝一夕之功。從模型等晶片,到晶片靠模型與兩次降價幾乎同步發生的,是國產晶片陣營的集體“起立”。V4發佈當日,華為昇騰、寒武紀、海光資訊、摩爾線程、沐曦股份、崑崙芯、平頭哥真武、天數智芯8家國產AI晶片品牌,以及輝達,均宣佈完成對DeepSeek-V4的適配。尤其值得注意的是,這是大模型產業首次實現“Day 0”等級的全端適配:模型發佈即適配上線,晶片廠商不再需要數月的“追逐式”偵錯周期。這裡有一個細節必須拆解清楚。DeepSeek官方在技術報告中表示,“我們在輝達GPU和華為昇騰NPU兩個平台上驗證了細粒度EP(專家平行)方案,在通用推理任務中實現1.50至1.73倍加速;在延遲敏感場景下最高達到1.96倍”。這是DeepSeek歷史上首次將國產晶片與輝達GPU並列寫入硬體驗證清單,確立對等地位。華為昇騰的反應也十分迅猛。昇騰官方在B站直播中稱,在推理部署層面,昇騰950PR平台針對V4實現了多項深度適配。量化方面,原生的硬體加速精度明確支援MXFP8與MXFP4等低精度資料格式,兼顧模型精度與記憶體佔用最佳化。算子層面,華為官方宣佈昇騰950通過融合kernel與多流平行技術,大幅降低了混合注意力機制的計算和訪存開銷,顯著提升了推理性能。而MoE模組中路由專家與共享專家的計算重疊等深度最佳化,則進一步確保了兆參數模型在國產硬體上的高效平穩運行。圖|昇騰直播間截圖寒武紀則在基於自研NeuWare軟體生態與vLLM框架上,完成了對V4的“Day 0”適配並同步開源自研算子庫。這已是寒武紀連續第二次在DeepSeek新模型發佈首日便推出適配方案,其技術迭代速度同樣不容小覷。更有說服力的訊號來自財務上的持續好轉,國產開源大模型的極速發展,正在把中國算力產業拉入良性發展的通道里。4月26日晚,摩爾線程發佈2026年一季報:一季度營業收入7.38億元,同比增長155.35%;歸母淨利潤2935.92萬元,同比扭虧為盈。這家被稱為“中國輝達”的國產GPU廠商,此前因研發投入高達營收86.68%而備受市場質疑,如今終於交出了一份逆轉的答卷。與此同時,摩爾線程還與某客戶簽訂了金額達6.6億元的誇娥智算叢集銷售合同。寒武紀此前發佈的年度業績快報亦顯示已率先實現盈利,沐曦股份則呈現出虧損持續縮小的態勢。三家國產AI晶片代表企業同步進入業績改善通道,已經是十分有力的回應。國產算力生態臨界點的到來當DeepSeek的技術效率革命與國產晶片的產能釋放在同一時間窗口交匯,一條完整的產業閉環開始浮出水面。中銀國際在4月26日發佈的研報中判斷:“DeepSeek V4的發佈標誌著國產大模型已基本跑通全端國產化,理論上已形成從底層硬體、基礎軟體、平台服務到上層應用、安全體系的完整技術鏈條,國產算力類股或迎來自己的質變臨界點。”反過來看,DeepSeek與國產算力實現合力,在大幅降低token成本後,又會反向利多AI應用市場,催生更大的市場空間。據華泰證券表述,“市場容易將V4理解為‘降本壓低算力、儲存需求’,但更重要的邊際變化在於長上下文成本下降後,複雜Agent、多文件分析、長周期任務、線上學習等場景可用性提升,推理呼叫量與儲存訪問頻次有望擴張。”換句話說,降價不會縮減蛋糕,還會做大蛋糕——越便宜用得越凶,總呼叫量反而會暴增。同樣在4月24日,新版本OpenClaw 發佈,直接接入了最新的DeepSeek V4雙版本,並將V4 Flash設定為了默認大模型。據OpenRouter平台資料,DeepSeek V4 flash今日呼叫量較前一天上漲了62%。值得一提的是,DeepSeek已明確將華為昇騰950超節點量產納入其商業路徑,並預告下半年實現大規模供貨後API定價將迎來顯著下降。這意味著當前的降價可能只是一個預告,真正的主菜還在後面。資本市場已作出熱烈反應。4月27日早盤,A股算力晶片概念延續強勢,CPU方向領漲,海光資訊、摩爾線程等跟漲;港股半導體類股領漲,瀾起科技漲超6%,中芯國際漲近5%。產業鏈上下游——從晶片設計到伺服器整機,從算力租賃到AI應用——都在重新定價這一歷史性的產業變局。這個4月,DeepSeek以一組硬核效率資料為矛、以兩次精準降價為鼓,打出明牌——AI的長上下文時代已經到來,而它的“高速公路”將由國產算力鋪就。對那些剛剛登陸科創板的國產晶片企業而言,這個春天確實比往年都暖。 (鳳凰網科技)
科技
#DeepSeek
#中國算力
#Token
192人
讚
留言
分享
官方認證
北風窗
2026/04/30
•
DeepSeek過了算力的河,美團LongCat正在彎腰造船
中國算力迎來“DeepSeek+LongCat”節點。Token,是未來數字世界最核心、最值錢的大宗商品。2026年GTC大會上,黃仁勳這樣定義AI時代的底層通貨,而資料中心就是生產智能的工廠。過去幾年,全球絕大多數這樣的“工廠”都依賴同一套裝置:輝達的GPU與CUDA生態。當荷姆茲海峽的開放與關閉,影響地緣政治與能源安全格局,全球AI市場的Token供給也需要回答:算力供應鏈出現單點依賴,如何保障Token的穩定產出?4月24日上午,DeepSeek V4正式發佈,其官方技術報告明確將華為昇騰950PR寫入硬體驗證清單,實現了從輝達CUDA到國產算力的全端遷移。下午,美團LongCat-2.0-Preview開放測試,這是目前唯一公開確認由國產算力完成兆參數預訓練的大模型,訓練全程動用了5萬至6萬張國產算力卡,其訓練規模是迄今為止最大的。兩款模型在同一天跨入“兆參數俱樂部”,更關鍵的是,這意味著一條自主的“國產Token”供應鏈,正在輝達體系之外加速接通。理解這一天意味著什麼,需要拆開來看。兆參數俱樂部的新玩家過去一段時間裡,兆參數如同大模型的“珠峰”。玩家們想登頂,需要刷美國技術堆疊的“裝備”,尤其離不開輝達。Open AI、Anthropic等矽谷獨角獸,無不是輝達H100/A100叢集上的“付費玩家”。憑藉軟硬一體的CUDA生態系統,輝達在全球AI訓練負載市場中佔據了90%以上的絕對壟斷地位。對中國AI企業而言,這有諸多不確定性。近年來,美國對華高端AI晶片的出口管制持續收緊,從最初的A100、H100禁售,延伸至特供版H20的許可限制,到今年4月,美國高端晶片實質對華禁售。即便通過其他管道拿到晶片,也隨時面臨升級路徑被切斷的風險。至此,算力不再只是支出成本,也是生存成本。2026年4月24日,備受關注的DeepSeek V4發佈,同日美團LongCat-2.0-Preview啟動開放測試,雙雙加入了“兆參數模型”的行列。這兩個大模型用不同方式,實現了國產算力替代的進展。DeepSeek V4的早期訓練基於輝達CUDA架構和GPU硬體,之後全端遷移至華為晶片。V4適配的華為昇騰950PR推理晶片,甚至在低精度推理中展現出超越通用GPU的效率。同期進行測試的LongCat-2.0-Preview選擇了另一種方式,這是目前唯一由國產算力訓練的兆參數大模型。其訓練與推理全程依託國產算力叢集獨立完成,動用的國產算力卡數量在5萬至6萬張之間,是國產算力上完成的規模最大的訓練任務。從技術層面來看,DeepSeek V4和LongCat-2.0-Preview均採用MoE架構,支援1M(100萬token)超長上下文窗口,單次推理可處理數百萬字輸入,處理量級與GPT-5.5處於同一水平。兩款模型在知識容量、長文字理解及複雜邏輯推理的上限上,已正式跨入全球第一梯隊。沒有採取行業通行的“堆算力”路線,DeepSeek V4和LongCat-2.0-Preview都是通過架構最佳化,對每一張國產卡算力進行極致搾取,同時它們也用實踐證明,極致最佳化算力效率,可以抵消硬體的帳面差距。V4通過混合注意力架構(CSA + HCA)、Muon最佳化器等底層架構創新,在上下文長度放大8倍的前提下,算力消耗比V3.2降低七成以上。LongCat-2.0-Preview每token啟動參數約48B,從一些測試反饋來看,在保持較高性能的同時,實現了不錯的推理效率。效率革命最終轉化為顛覆性的商業定價。DeepSeek V4最新的API定價,V4 Flash每百萬tokens輸入(快取命中)價格為0.02元,V4 Pro為0.025元。海外社交媒體上,有網友表示,這是從Claude或者GPT遷移到DeepSeek的最佳窗口期。兩款模型的發佈,引發了國產算力適配的連鎖反應,國產算力替代逐漸成為趨勢。從華為昇騰、百度崑崙芯、寒武紀思元、海光資訊DCU到阿里平頭哥,國產AI晶片在性能與生態上持續迭代;摩爾線程、壁仞科技、沐曦股份等創業企業也在加速追趕。TrendForce預測,2026年國產晶片在高端市場的份額將增長到70%,行業對國產算力的期待,不再停留在“可用”層面。算力突圍前後中國AI廠商們加速佈局國產替代,除了此前說到的美國高端晶片出口管制等政策壓力,還有一個重要的考量:算力荒傳導至價格端,導致算力變得越來越貴。中信證券指出,Token呼叫量井噴帶來的是算力需求極大爆發,與此同時供給側受到各類硬約束短期邊際增量有限,目前國內外均出現了嚴重的算力荒。而中國AI使用者的算力消耗極其巨大,根據OpenRouter的資料, 2026年3月30日-4月5日,中國AI模型的周呼叫量突破12.96兆Token,是同期美國的4.3倍。如此龐大的需求,如果長期高度依賴單一的“輝達+台積電”供應鏈,將面臨供應受限與價格持續上漲的雙重風險。這種結構性矛盾,使得國產算力替代不再只是“備選題”,而是“必答題”。然而,替代之路向來艱難。其難點在於拋棄現成的程式碼庫、編譯和偵錯工具,從“零”開始。輝達CUDA經過20年積累,擁有超400萬開發者和成熟的cuBLAS、cuDNN、NCCL庫。國產算力平台的算子庫覆蓋度、最佳化深度以及測試工具都不完整,需要工程團隊進行大量底層開發與偵錯工作。另一個難點在於硬體的平行計算。由於單卡性能存在差距,國產晶片想要實現同樣的計算性能,勢必要平行更多硬體,而算力硬體平行容易帶來故障。在大模型訓練中,叢集規模一旦擴大至萬卡等級,故障機率呈指數級上升,任何微小的計算錯誤、通訊延遲或數值精度偏差,都會在平行運算中指數級放大,導致整個訓練任務中斷或模型收斂失敗。LongCat-2.0-Preview在5、6萬張國產叢集上完成兆參數MoE模型的穩定訓練,意味著團隊必須在平行策略、通訊拓撲、混合精度訓練及容錯機制上進行深度自研與調優。這是對國產算力系統工程能力的一次高強度的壓力測試。工程能力還只是冰山一角,晶片設計製造、軟體棧乃至應用,需要更多產業力量的長期投入。來自網際網路巨頭、產業資本與風險投資的資金,成為這些長期進化背後的重要支撐。以美團為例,近幾年在算力、科技硬體和大模型等領域進行了廣泛的早期投資。晶片方面,美團投資了摩爾線程、沐曦股份、紫光展銳、愛芯元智、榮芯半導體等眾多企業,覆蓋了多家國產GPU頭部和“國家隊”等級的半導體公司。這些企業的技術方向各有側重:摩爾線程與沐曦股份聚焦通用GPU設計;紫光展銳在移動通訊與物聯網晶片領域根基深厚,為端側AI提供底層連接能力;愛芯元智專注邊緣算力、AI視覺晶片;榮芯半導體則涉足晶圓代工,立足於晶片的產能提升。美團還同時投資了包括宇樹科技、銀河通用、星海圖在內的多家具身智能公司和科技硬體公司。從大模型上游的晶片設計製造、到大模型研發,再到AI在各個領域的應用,用王興的話來說,美團將AI視為戰略機遇。美團的密集投資並非孤例,它所折射的,是中國科技資本對國產算力賽道乃至未來科技發展的系統性佈局。模型在國產算力上跑通了,然後呢?當國產晶片鋪開、兆參數模型跑通,本土AI能否走向“更好用”階段,面臨著資料層面的挑戰。一方面,是工程反饋資料。當超大規模AI模型在國產晶片叢集上訓練時,會暴露出各種問題,比如某些計算環節精度有誤差、晶片之間資料傳輸太慢、軟體編譯最佳化不到位、多卡平行時通訊通道擁堵、低精度計算時數值丟失等。技術團隊逐一攻克這些問題的過程,本身就是一場對國產晶片軟硬體的大規模測試。每一個被修復的bug、每一段被調優的通訊協議,都會反饋給國產晶片廠商,推動下一代硬體的改進和軟體棧的成熟。對LongCat-2.0-Preview這樣的“原生國產模型”來說,從訓練階段起便全程依託國產算力叢集完成,產生的工程反饋較為完整和真實。這種“模型反哺晶片”的閉環,有利於國產算力生態向下紮根。另一方面,大模型需要物理底座,和具體任務、真實世界產生高品質的資料互動。特斯拉憑藉全球最大的真實駕駛資料庫,建構了其自動駕駛的核心基石,從真實世界採集、到模擬訓練、再到演算法迭代的“Real-to-Sim-to-Real”飛輪,同時驅動了自動駕駛汽車與人形機器人的進化。同樣的邏輯,正在一個更複雜高頻,貼近日常生活的場景展開,那不是加州的高速公路,而是中國城市的街頭巷尾。美團擁有全國2800多個市縣的即時配送網路,覆蓋中國最複雜的物理環境。美團無人機已累計完成商業訂單超78萬筆,國內外開通70條航線。美團無人車已至少已完成550萬單配送任務,自動駕駛總里程突破1900萬公里。無人機在樓宇間穿行時的視覺避障資料、無人車在複雜路況下的即時決策軌跡、騎手與機器協同調度中的動態最佳化樣本,都是高價值、高密度的真實世界資料。這些是LongCat大模型持續進化的養料,也是國產算力晶片在嚴苛環境中驗證可靠性、能效比的真實環境。同一天裡先後發佈和開放測試的DeepSeek V4與LongCat-2.0-Preview,構成了國產算力進化的一體兩面。前者以開源、低價與通用能力,證明了國產算力可支撐全球頂尖的基礎模型;後者以原生國產訓練、兆參數規模與物理世界閉環,證明了國產算力叢集可獨立完成極限的工程任務。這不僅僅是算力焦慮下的替代敘事,更是一場“主動定義”的轉身,獨立生長、正向循環的中國AI產業鏈,還需要長期努力,但正在加速成型。 (豹變)
科技
#中國算力
#DeepSeek
#美團
216人
讚
留言
分享
官方認證
北風窗
2025/12/23
•
在MDC 2025,讀懂中國全功能GPU
當人工智慧(AI)的浪潮從單點的演算法突破轉向全面的產業滲透,中國算力產業正站在一個關鍵的十字路口:我們需要的究竟僅僅是一塊能跑通模型的晶片,還是一座能支撐起兆參數、多模態應用與複雜多應用場景的“數字底座”?12月20日-21日,在北京中關村國際創新中心召開的摩爾線程首屆MUSA開發者大會(MDC 2025)上,這家成立僅五年的國產GPU領軍企業,用一套完整的技術閉環給出了答案。沒有晦澀難懂的參數堆砌,摩爾線程創始人、董事長兼CEO張建中在打會上向外界展示了一幅清晰的戰略圖景:從全新的“花港”架構到能穩定支撐兆參數模型訓練的誇娥(KUAE)萬卡叢集,再到打通雲邊端的全端生態。這標誌著國產全功能GPU已經走出了“能用”的初級階段,正式邁進了建構堅實算力底座的“深水區”。全功能GPU:拒絕“偏科”,做AI時代的通才在很長一段時間裡,大眾對GPU的認知往往被割裂:要麼是用來打遊戲的顯示卡,要麼是資料中心裡專門訓練大模型的加速卡。但在MDC 2025上,摩爾線程再次強調了一個被行業逐漸驗證的真理:未來的AI世界,是多模態融合的世界,算力不能“偏科”。這就是摩爾線程始終堅持“全功能GPU”路線的底層邏輯。所謂的“全功能”,意味著在一顆晶片的架構設計上,同時賦予了它AI計算、圖形渲染、物理模擬、超高畫質視訊編解碼等多種能力。這種設計看似增加了研發難度,實則是對未來應用場景的最優解。以當下最火的人形機器人為例,它不僅需要大腦進行邏輯推理(AI計算),還需要眼睛去感知三維世界(3D渲染),更需要理解物體如何運動(物理模擬)。如果依靠單一功能的晶片堆疊,不僅成本高昂,協同也是難題。而摩爾線程基於自主研發的MUSA統一系統架構,率先實現了這些功能的單晶片融合。在本次大會上,摩爾線程通過“花港”架構進一步印證了這一路線的前瞻性。新架構不僅在能效上實現了躍升,更創新性地將AI與圖形深度融合,推出了全自研的AI生成式渲染技術(AGR)。這意味著,未來的圖形畫面不再完全依賴傳統的暴力計算,而是可以通過AI“預測”和“生成”,以極低的算力代價換取畫質與影格率的倍增。這種技術範式的變革,正是全功能GPU獨有的優勢。決勝萬卡叢集:一場摩爾線程的“淮海戰役”如果說晶片設計是單兵作戰,那麼“萬卡叢集”就是一場協同作戰的集團軍戰役。在AGI(通用人工智慧)時代,大模型的參數量已邁向兆等級,這要求成千上萬張GPU必須像一個整體一樣協同工作。對於國產算力而言,真正的挑戰往往不在單卡性能,而在於大規模叢集的穩定性、互聯頻寬和容錯能力。在MDC 2025上重磅發佈的誇娥(KUAE)萬卡智算叢集(KUAE 2.0),是摩爾線程交出的一份“硬核”答卷。這並非簡單的硬體堆疊,而是系統級工程能力的體現。針對萬卡級規模,摩爾線程攻克了高速互聯、供電散熱以及複雜的系統級容錯難題。資料顯示,在訓練側,KUAE 2.0的有效訓練時間佔比超過90%,訓練算力利用率(MFU)突破60%,原生FP8能力完整復現頂尖大模型訓練流程,並在多項關鍵精度指標上達到國際主流水平。這一資料的披露,對於資本市場和行業客戶而言具有極高的含金量。它意味著國產算力不再是實驗室裡的“備胎”,而是已經具備了在生產環境中通過長時間、高負載考驗的“工業級”大規模應用能力。摩爾線程用事實證明,國產全功能GPU完全有能力成為大模型訓練的堅實底座。普惠未來:從“AIBOOK”到“AI for Science”技術必須落地,算力必須普惠。在展現硬實力的同時,摩爾線程也在思考如何讓算力觸手可及。大會上發佈的個人AI算力本——MTT AIBOOK,是一個極具象徵意義的產品 。它將原本運行在雲端的強大算力濃縮排了一台筆記本中,通過“一本三用”的虛擬化技術,讓開發者、學生和創作者擁有了一個開箱即用的移動智算工作站。這是摩爾線程將AI從雲端推向邊緣、推向個人的一次重要實踐,旨在為中國培養更多的AI原生應用開發者 。與此同時,摩爾線程的目光已投向更遙遠的未來。在科學計算(AI for Science)領域,摩爾線程的全功能GPU正在幫助科學家進行分子動力學模擬、氣象預測和生物醫藥研發 ;在具身智能領域,通過提供從模擬平台到端側晶片及雲端算力融合的全端方案,摩爾線程正在加速機器人從虛擬走向現實;甚至在AI For 6G和量子計算等前沿交叉領域,MUSA生態也已開始佈局。這些看似跨度極大的佈局,實則都貫穿著同一條主線:以全功能GPU為通用底座,賦能物理世界與數字世界的深度融合。打造國產堅實算力底座做難而正確的事回顧摩爾線程的發展歷程,從最初定義“全功能GPU”,到如今建構起涵蓋晶片、萬卡叢集、MUSA架構及開發者生態的全端版圖,這家企業始終在走一條“難而正確”的道路。在過去五年的創新曆程中,摩爾線程交出這樣一份成績單:公司累計研發投入超過43億元,研發人員佔比高達77%,已成功量產五顆GPU晶片,建構起覆蓋“雲‑邊‑端”的全端產品佈局;截至2025年6月,公司已獲得468項發明專利,並建構起註冊規模超20萬的活躍開發者生態。這些數字共同印證了其在全功能GPU領域的技術厚度、產品完整度與生態影響力,不僅凸顯了公司在國內該賽道中的稀缺地位,也為其持續引領自主算力進化奠定了紮實的體系化基礎。MDC 2025不僅是一場技術發佈會,更是一個訊號:中國算力產業正式進入比拚內功、生態和系統化能力的新時代。正如摩爾線程在願景中所示——“為美好世界加速”。在通往數智未來的道路上,摩爾線程正以紮實的技術功底和開放的生態胸懷,將國產全功能GPU打造成為中國數字經濟不可或缺的算力底座。 (網易科技)
科技
#MDC
#2025年
#中國算力
240人
讚
留言
分享
官方認證
北風窗
2025/12/21
•
中國光計算晶片研製獲重大突破
在人工智慧技術高速發展的今天大語言模型的算力需求與能源消耗之間正形成日益尖銳的矛盾模型越大、解析度越高生成內容越豐富對算力與能耗的需求就越驚人如何破題?一群中國上海交通大學科研團隊把目光投向了“光”↓ ↓ ↓日前,上海交通大學傳來好消息,交大積體電路學院陳一彤課題組在新一代算力晶片方向取得重大突破,首次實現了支援大規模語義視覺生成模型的全光計算晶片LightGen。相關研究以《大規模智能語義視覺生成全光晶片》(All-optical synthesis chip for large-scale intelligent semantic vision generation)發表於國際頂級學術期刊《科學》(Science)上。當前,光電晶片仍主要擅長加速判別類的任務,距離支撐前沿大規模生成模型還有不小距離。因此,“如何讓下一代算力光晶片能夠運行複雜生成模型”,成為全球智能計算領域公認的難題。所謂“光計算”,可以通俗理解為:不是讓電子在電晶體中運行,而是讓光在晶片中傳播,用光場的變化完成計算。由於光天然具備高速和平行的優勢,長期被視為突破算力與能耗瓶頸的重要方向。不過,要把光計算真正用到生成式AI上,並非這麼簡單——生成模型往往規模更大,還需要在不同維度之間不斷變換;而如果晶片規模較小,則不得不頻繁在光與電之間級聯或復用,速度優勢就會被延遲與能耗迅速抵消。因此,全光計算,就顯得更為重要,同時也更為困難。LightGen晶片之所以能夠實現驚人的性能飛躍,在於它在單枚晶片上同時突破了三項領域公認的關鍵瓶頸——單片上百萬級光學神經元整合、全光維度轉換,不依賴真值的光學生成模型訓練演算法。這三項中的任意一項單獨突破都足以構成重要進展,而LightGen同時做到,使得面向大規模生成任務的全光端到端實現成為可能。更重要的是,LightGen晶片展現的並不是“電輔助光”的生成,而是讓全光晶片完整實現“輸入—理解—語義操控—生成”的閉環:輸入圖像進入晶片後,系統能夠提取與表徵語義資訊,並在語義操控下生成全新的媒體資料,實現讓光“理解”和“認知”語義。在性能評估上,LightGen晶片採用了極嚴格的算力評價標準:在與電晶片上運行的多個前沿電子神經網路相仿生成質量的前提下,直接對端到端耗時與耗能進行測量。實測表明,即便採用較滯後性能的輸入裝置,LightGen晶片仍可取得相比頂尖數字晶片2個數量級的算力和能效提升。而如果採用前沿裝置使得訊號輸入頻率不作為瓶頸的情況下,LightGen晶片理論可實現算力提升7個數量級、能效提升8個數量級的性能躍升。這項重要成果同步被Science官方選為高光論文重點報導。文中提到,生成式AI正加速融入生產生活,要讓“下一代算力晶片”在現代人工智慧社會中真正實用,勢在必行的是研發能夠直接執行真實世界所需前沿任務的晶片——尤其是大規模生成模型這類端到端時延與能耗極高的任務。面向這一目標,LightGen為新一代算力晶片真正助力前沿人工智慧開闢了新路徑,也為探索更高速、更高能效的生成式智能計算提供了新的研究方向。 (芯榜)
科技
#中國
#算力晶片
#全光計算晶片
269人
讚
留言
分享