7月17日-20日,2026世界人工智慧大會(WAIC)正式在上海拉開帷幕,壁仞科技正式推出下一代NPO光互連、分佈式解耦架構超節點方案,支援單個超節點1024卡Scale-up擴展。壁仞科技聯合創始人、首席技術官洪洲與AI框架架構副總裁丁雲帆分別發佈重磅演講,系統展示了壁仞科技從晶片、協議、系統到應用的完整1024卡超節點方案。
△壁仞科技聯合創始人、首席技術官 洪洲
7月18日上午,洪洲在《最佳化GPU超節點——GPU晶片互聯技術創新與工程實踐》主題演講中,系統性地闡述了壁仞科技自研的BLink™2.0超節點互連協議的核心技術能力。洪洲表示,隨著大模型參數規模突破兆,AI超節點正面臨規模擴展、頻寬提升和通訊延遲等多維挑戰。BLink™2.0以"超節點、在網計算、擁塞控制、鏈路修復"四大核心能力建構了開放、自主可控的算力底座,其目標是將GPU的峰值算力轉化為大規模叢集可交付、可擴展、可長穩運行的有效算力,實現"時延—頻寬—可靠"端到端系統級協同,這是單點技術無法達到的系統級躍遷。
△壁仞科技AI框架架構副總裁 丁雲帆
7月18日下午,丁雲帆在《光互連GPU超節點,引領智算"芯"未來》《以光互連GPU超節點,重塑Agentic AI算力底座》兩場分論壇演講中,重點介紹壁仞科技基於自主原創Chiplet架構的BR2xx系列GPU以及基於BLink™2.0打造的多樣化超節點產品矩陣,並闡述了壁仞科技在NPO光互連超節點方面的技術前瞻性佈局,以及如何在光互連GPU超節點的硬體基礎之上,建構面向Agentic AI時代的Token工廠整體解決方案。
主流電互連超節點
面臨規模擴展的物理天花板
當前AI發展面臨三大核心挑戰:模型參數從千億邁向數兆(超大參數)、Agent等應用場景要求百萬級上下文長度(超長文字)、推理和訓練都需要成千上萬張GPU協同工作(超大叢集)。僅憑單張GPU的算力性能,已難以獨立承載上述複雜任務。在此背景下,如何實現海量GPU高效協同運行,使之如同一台一體化超級電腦開展工作,正是超節點架構著力破解的核心難題。
然而,當前主流的電互連超節點方案正面臨規模擴展的物理極限。隨著GPU算力持續增長,互連頻寬需求將超過1TB/s,而銅纜電訊號在3米內就會嚴重衰減。現有電互連的cable tray和正交背板架構超節點的擴展性面臨挑戰,較難滿足下一代數兆參數大模型對數百卡-千卡級超節點的需求。
光互連,成為突破這一瓶頸的必然選擇。光訊號傳輸距離可達數百米,衰減極小,天然適合大規模GPU互連。這也是為什麼行業主流廠商都在加速佈局光互連超節點。
壁仞科技首次推出NPO光互連、分佈式解耦架構、最大1024卡超節點方案
面對這一行業性挑戰,壁仞科技給出的不是單點技術突破,而是一套覆蓋晶片、協議、系統、應用的超節點端到端解決方案。
晶片——壁仞科技業界首創Chiplet(芯粒)架構大算力晶片,新一代BR2xx系列GPU沿用這一技術路線。BR2xx支援FP8/FP4低精度高算力計算,擁有更大視訊記憶體頻寬,並原生整合了超節點互連能力,是整套方案的算力基石。
協議——壁仞科技自研的BLink™2.0超節點互連協議,是連接所有GPU的"神經系統"。BLink™2.0核心能力概括為四個方面:一是記憶體語義互連,讓最多1024張GPU共享同一個記憶體空間,多卡如同一台"超級GPU";二是在網計算,將通訊中的數學運算下沉到交換機完成,減輕GPU負擔;三是智能擁塞控制,避免網路堵塞;四是多層鏈路自癒,從物理層到框架層逐級防護,保障訓練推理不中斷。
產品矩陣——基於BR2xx和BLink™2.0,壁仞科技建構了三級超節點產品矩陣:16卡標準伺服器超節點(電互連)、128卡高密整機櫃超節點(電互連)、以及1024卡分佈式解耦架構超節點(NPO光互連)。16卡/128卡超節點適用於中小客戶/千億-兆參數落地需求,NPO光互連、大規模擴展超節點尤其適用於大客戶/數兆參數場景,客戶可以按需選擇,靈活擴展。
應用方案——壁仞科技"Token工廠"解決方案。在Agentic AI場景中,每次AI對話都會產生大量中間計算結果(KV Cache),如果每次都重新計算,算力浪費巨大。壁仞科技通過五級分層快取架構,實現了95%以上的快取命中率,大幅降低重複計算開銷。同時,壁仞科技聯合中國電信首創跨廠商異構混推方案,充分發揮異構算力優勢,有效吞吐提升20%。在容錯保障方面,即使單個GPU發生故障,框架層也能自動隔離故障節點、感知超節點拓撲重新組網,確保業務不中斷,為大規模超節點叢集的工程落地和長期穩定運行提供了最終根本保障。
NPO光互連路線的優越性:
標準機型、靈活部署、可大規模擴展
在眾多光互連技術路線中,壁仞科技選擇了NPO(Near-Packaged Optics,近封裝光學)作為下一代超節點的核心方案。這一選擇體現了明確的技術前瞻性。
當前光互連有四種主要技術路線——傳統可插拔(FRO)、線性直驅(LPO)、近封裝光學(NPO)和共封裝光學(CPO)。NPO將光引擎直接與GPU模組融合,去掉了高功耗的DSP晶片,同時傳輸距離可達數百米,兼具低時延和高頻寬密度,是在性能、功耗、成本和工程可落地性之間取得最佳平衡的方案。
更重要的是,壁仞科技首次提出"NPO光互連、分佈式解耦架構"——GPU節點和交換機節點物理分離部署、光纖靈活互連,GPU節點也可以採用標準機形態,徹底告別了傳統定製高密整機櫃方案的"大鐵盒子"形態。這意味著超節點的規模不再受限於單個機櫃的物理空間,可以像搭樂高一樣靈活擴展到1024卡,維運和散熱也變得更加簡單。這一演進可以形象地理解為"從大型機變成小型機"。
放眼全球,國際晶片巨頭和中國網際網路大廠也不約而同選擇了NPO路線。壁仞科技在中國率先完成從電互連到NPO的技術演進,並已形成完整產品方案。
數兆參數大模型時代,
光互連超節點成為算力破局的最優路徑
超節點不僅是一個技術概念,更是AI算力產業化的關鍵環節。
從需求側看,當前在部署大模型時面臨三大痛點:單次訓練動輒需要萬卡GPU協同數月、推理場景對延遲要求越來越苛刻(尤其是兆級參數MoE模型的專家平行)、以及大規模叢集的故障恢復效率直接影響業務連續性。這些需求都指向同一個方向——更大規模、更低延遲、更高可靠性的超節點。
壁仞科技的方案精準解決了行業痛點:BLink™2.0的記憶體語義互連和在網計算解決了通訊效率問題;NPO光互連突破了規模擴展瓶頸;Token工廠和異構混推降低了推理成本;全端容錯體系保障了長期穩定運行。
從產業生態角度看,壁仞科技堅持開放路線——BLink™2.0不依賴封閉生態,超節點交換機支援多種晶片適配,異構混推方案已牽頭制定國家標準。這種"開放+自主可控"的策略,為中國國產算力基礎設施的多元供給提供了可行路徑。
壁仞科技已將上一代dOCS光互連超節點部署在國家級算力平台。隨著BR2xx系列GPU和NPO光互連、分佈式解耦架構超節點的發佈,千卡級Scale-up互連即將成為現實。
結語
從2025年榮獲WAIC最高獎SAIL獎(基於dOCS的光互連光交換超節點)到2026年全面升級的NPO光互連超節點和Token工廠方案,壁仞科技認為,真正的算力競爭力不僅在於單顆晶片的算力參數,更在於從晶片到系統、從硬體到軟體、從單機到叢集的全端整合能力。圍繞晶片持續打造的工程閉環和軟體生態也更為重要,壁仞科技自研SUPACODE™程式設計智能體覆蓋模型適配到萬卡維運的端到端閉環,以Agent模式提供軟體生態解決方案,大幅降低客戶應用落地成本。
當AI從實驗室走向千行百業,算力基礎設施正在經歷一場從"電"到"光"、從"堆疊"到"解耦"的深刻變革。壁仞科技以NPO光互連、分佈式解耦架構GPU超節點為支點,期待與產業夥伴攜手建構全新底座,共同迎接Agentic AI算力新時代。 (芯智訊)
