Agent時代的AI計算架構挑戰與創新!2026

北風窗
AI速讀
在 AICC 2026 大會上,浪潮資訊指出 AI Agent 正在重構算力需求,將其從單純的技術資源提升為國家戰略基礎設施。面對 Agent 帶來的高頻互動與長上下文挑戰,計算架構必須從「靜態計算」轉向「動態編排」,並透過 PD 分離與 KV Cache 最佳化降低成本。硬件端則需依賴存算一體、Chiplet 封裝及液冷技術來突破記憶體牆與功耗牆。未來競爭核心將在於系統效率而非單點性能,開放架構與國產算力底座的協同將成為生產智能的關鍵。
從AICC2026看智能體如何重構算力底座

當智能體(Agent)從“回答問題”走向“解決問題”,當單次推理變成持續互動,支撐AI運行的算力正在從“技術資源”升級為“國家戰略基礎設施”。     9月21日,AICC2026人工智慧計算大會在北京中關村國際創新中心舉行,浪潮資訊首席AI戰略官劉軍在主論壇發表《Agent時代的AI計算架構挑戰和創新》演講,核心判斷只有一個:     Agent不是模型能力的簡單疊加,而是對AI計算架構的系統性挑戰。     它要求基礎設施同時支撐更高水平的智能能力突破,以及更大規模、更低成本的智能供給。

資料錨點:IDC與浪潮資訊聯合發佈的《2026中國人工智慧計算力發展評估報告》顯示,2026年中國智能算力規模預計達2576.5 EFLOPS,同比+87.9%;全球活躍智能體數量將從2026年的7940萬增長至2030年的22.16億,年複合增長率129.8%,而同期全球Token消耗量複合增長率高達4822.6%——約為智能體數量增速的37倍。

一、開篇:Agent正在重構AI計算的需求範式

1.1 從“單次推理”到“持續互動”

傳統大模型推理的負載畫像非常簡單:一個使用者輸入一段prompt,模型輸出一段文字,過程結束。其性能最佳化目標也單一:在固定Batch Size下最大化token吞吐、最小化首token延遲(TTFT)與每個token間延遲(TBT/TBT)。

Agent的工作方式完全不同:它需要在多輪對話中保持上下文,根據環境反饋反覆呼叫工具,在執行過程中動態生成新的執行圖,並可能與其他Agent協作完成長程任務。每一次“響應”都不再是終點,而是下一輪推理的起點。這意味著:

  • KV Cache不再是一次性消耗品
    而是需要在多輪之間被持續保留、共享、分支復用的狀態資產;
  • 執行圖不再是靜態的
    工具呼叫的結果會反向改變下一步要生成的token結構;
  • 延遲與吞吐的權衡被重塑
    使用者等待的是“任務完成時間”,而非“首token時間”。

1.2 三類典型Agent場景的算力特徵

場景
算力特徵
核心敏感指標
對架構的隱含要求
程式碼生成Agent
高頻工具呼叫(編譯器、測試框架、檢索),結構化JSON輸出佔比高
p95延遲、結構化解碼吞吐
低延遲前綴復用 + FSM-native生成
資料分析Agent
長上下文(10萬級token)、多步推理、反覆讀寫中間結果
視訊記憶體容量、KV Cache頻寬
Paged/Offload + 近存計算
客服Agent
高並行、短互動、強即時、成本敏感
TTFT、單token成本
Continuous Batching + 動態調度

這三個場景把負載從“單一模型、單次生成”拉伸為“多模型協同、長上下文保持、動態執行圖展開”。傳統面向靜態批處理的計算架構開始系統性失配。

核心論點

Agent時代的競爭,不再是“誰的模型參數量更大”,而是“誰能在可控成本內,持續、穩定、低延遲地生產出有效任務結果”。這要求從晶片、記憶體、網路、散熱到調度層的全端重構。

二、挑戰一:從“靜態計算”到“動態編排”——推理引擎的範式遷移

2.1 傳統推理框架的設計假設

vLLM與TGI等主流推理框架的最佳化基點是:固定prompt、單次生成、KV Cache隨請求結束而釋放。vLLM的PagedAttention將KV Cache切分為固定大小的塊(block),像作業系統管理虛擬記憶體一樣按需分配,顯著降低了視訊記憶體碎片,提升了並行度。

這套假設在批處理、短互動場景下表現優異。但當Agent成為主要負載,三個失效點逐一暴露。

2.2 失效點之一:多輪對話與前綴共享

在Agent會話中,80%–95%的輸入token是重複上下文——系統提示(system prompt)、工具模式、前幾輪對話。傳統框架每輪重新計算這些前綴的KV Cache,造成大量冗餘算力。

SGLang提出的RadixAttention將KV Cache組織成基數樹(Radix Tree),自動識別不同請求之間的最長共享前綴,實現任意深度的跨請求復用。相比vLLM的塊級前綴快取,RadixAttention在分支化、多輪對話場景下命中率更高。RadixAttention論文(arXiv 2312.07104)報告,在重前綴負載下吞吐最高可提升6.4倍

2.3 失效點之二:工具呼叫與執行圖動態展開

Agent的工具呼叫輸出通常是結構化JSON。傳統框架依賴正規表示式或FSM進行語法約束,逐token校驗,導致大量時間消耗在“可預測token”的生成上。SGLang的壓縮FSM + Jump-Forward解碼可以一次性跳過結構符號,直接生成下一個語義token。在結構化JSON抽取任務中,SGLang可較vLLM標準FSM快約180%

2.4 失效點之三:長上下文與記憶體牆

PagedAttention解決了視訊記憶體碎片化問題,但沒有改變KV Cache隨上下文長度線性增長的根本事實。當分析Agent需要處理10萬甚至百萬token上下文時,HBM容量與頻寬成為硬性瓶頸。這推動了KV Cache offload、PD(Prefill-Decode)分離、MLA/NSA等注意力壓縮等方向的發展。

圖1 · vLLM vs SGLang 在Agent推理典型負載下的性能對比(資料來源:公開基準、2026)
維度
vLLM(PagedAttention)
SGLang(RadixAttention)
Agent場景下的差異
前綴復用粒度
塊級(block-level),需邊界對齊
任意深度的基數樹匹配
多輪分支會話中SGLang快取命中率更高
吞吐(8B ShareGPT)
~12,500 tok/s
~16,200 tok/s(+29%)
重前綴負載下優勢顯著
p95延遲(70B FP8)
~85 ms
~48 ms(-44%)
互動式Agent對抖動更敏感
結構化輸出
正則/FSM語法約束
壓縮FSM + Jump-Forward
工具呼叫吞吐可提升1.5–2倍

判斷:未來的推理基礎設施不會是“vLLM或SGLang二選一”,而是根據負載特徵動態路由:前綴密集、低延遲、工具呼叫繁重的Agent路徑走SGLang;大Batch、獨立請求、吞吐優先的批次任務走vLLM。架構師需要設計的是一個能感知負載形態的智能閘道器,而非單一引擎。

三、挑戰二:從“單一模型”到“多模型協同”——異構計算的調度難題

3.1 Agent工作流中的模型組合

一個典型Agent工作流往往由多個模型組成:   大模型負責決策與意圖理解,   小模型負責分類、抽取、路由等感知任務,   專用模型(程式碼、視覺、多模態)負責具體技能,   外部API與工具負責執行現實世界的動作。

這種組合對異構算力池提出了前所未有的要求:不同模型精度(FP8/FP16/INT8)、不同視訊記憶體佔用、不同批處理特徵、不同延遲要求被混合部署在同一叢集中,而Agent的端到端延遲由最慢的一環決定。

3.2 異構算力池化的三大挑戰

挑戰
具體表現
架構應對
精度混合
決策模型用FP16/FP8保精度,分類/抽取可用INT8/W8A8降成本
統一量化策略 + 模型路由閘道器
視訊記憶體動態
70B模型常駐佔視訊記憶體,小模型可動態載入,峰值波動大
動態批處理 + 模型熱載入 / Serverless推理
通訊開銷
跨節點模型呼叫產生序列化、網路往返、狀態同步
統一推理調度層 + 節點內聚合

3.3 架構創新方向

  • 統一推理調度層:遮蔽底層引擎差異,根據請求特徵(前綴長度、結構化需求、延遲SLO)自動路由到vLLM/SGLang/專用推理節點。
  • 動態批處理策略:不同模型採用不同Batch窗口:小模型激進合併,大模型按優先順序搶佔,避免“大模型等 Batch 空轉,小模型排隊餓死”。
  • 模型路由與快取協同:小模型結果、工具返回、知識庫片段應被快取並復用,減少重複推理。推理叢集正在成為“智能快取系統”。

四、挑戰三:從“離線訓練”到“線上進化”——計算架構的反饋閉環

4.1 Agent的自我迭代特性

Agent的價值閉環是:執行結果 → 反饋 → 策略更新 → 重新推理。一旦Agent進入生產環境,它會產生大量“推理—行動—結果”三元組。這些資料的密度和即時性遠高於傳統訓練資料。

4.2 傳統架構的斷點

當前多數企業的訓練與推理是兩套基礎設施:訓練叢集負責週期性訓練,推理叢集負責線上服務。Agent反饋資料要先離線落盤、再經過ETL、再啟動訓練任務,週期以“天”或“周”計。這與Agent需要的“分鐘級”甚至“秒級”迭代節奏嚴重脫節。

4.3 創新架構要素

  • 線上微調/增量學習的算力預留:推理叢集需預留一部分彈性算力用於LoRA/DORA等低秩增量更新,使模型能在不中斷服務的前提下吸收新反饋。
  • 推理資料回流到訓練的高效通道:從推理日誌、工具返回值、使用者反饋到訓練樣本的轉化應自動化,避免人工資料標註成為瓶頸。
  • “推理—反饋—最佳化”的分鐘級閉環:未來 Agent Infra 的關鍵指標不是單純吞吐,而是“從一次失敗執行到策略修復”的平均時間(MTTR for Agent policy)。

4.4 案例參考

智譜 Infra Agent:智譜披露的GLM-5.3驅動的Infra Agent案例極具代表性。在超過10萬卡國產AI加速器組成的叢集上,該Agent參與搭建GLM-5.3-Flash的生產級推理服務。核心發現是:   “真正卡住Agent的不是寫程式碼,而是改完之後拿到的反饋太粗。”   團隊因此建立了“稠密反饋”機制:把正確性測試、運行日誌、執行Trace、微基準、執行階段事件和端到端指標全部納入迭代流程,使Agent能在算子精度漂移、KV Transfer並行瓶頸、重複計算等局部問題上快速定位。最終,該系統在不到兩週內從首次運行到生產就緒,端到端吞吐提升至初始基線的約3倍

Astra多Agent系統:NeurIPS 2025的Astra系統為GPU Kernel最佳化設計了四個專門Agent:Testing Agent負責正確性驗證,Profiling Agent負責性能測量,Planning Agent提出最佳化建議,Coding Agent生成新Kernel。它們形成一個“計畫—編碼—測試—分析”的自我最佳化循環,在SGLang的三個核心Kernel上取得平均1.32倍加速,最高達1.46倍。這個案例說明:Agent不只是上層應用,它正在反作用於底層計算架構本身。

五、創新方向一:存算一體與近存計算——打破記憶體牆

5.1 HBM頻寬瓶頸的量化分析

Agent場景下,KV Cache讀寫成為視訊記憶體頻寬的主要消耗者。以長上下文分析Agent為例,每生成一個token都需要訪問全部歷史KV Cache,訪存量隨上下文長度線性增長,而HBM頻寬增長卻遠慢於算力。

圖2 · AI晶片代際演進:視訊記憶體頻寬與功耗同步攀升(資料來源:NVIDIA產品規格、公開資料整理)

從A100到B300,單卡功耗從400W升至1400W,而視訊記憶體頻寬僅從2.0 TB/s增至8.0 TB/s——   功耗翻了3.5倍,頻寬僅翻了4倍。   在推理負載中,算力往往受限於“資料搬運速度”而非“FLOPS”。這就是記憶體牆。

5.2 技術路線對比

路線
核心思想
Agent場景價值
模擬域存算一體
利用憶阻器、相變儲存器等器件直接在儲存陣列完成向量矩陣乘法
KV Cache查詢、注意力計算能效極高,適合長上下文Agent
數字域近存計算
在HBM或3D堆疊儲存旁整合計算邏輯,減少資料搬移距離
相容現有數字生態,易與GPU/NPU協同,工程落地更快

5.3 產業化進展

AICC2026主論壇上,清華大學副校長吳華強將圍繞憶阻器存算一體技術發表演講,探討其如何突破傳統AI計算體系結構瓶頸。國內企業也在加速:   後摩智能、知存科技、蘋芯科技等公司已推出面向邊側和雲端推理的存算一體晶片;曦智科技的光子計算互連方案則從網路層面緩解記憶體牆。

對Agent架構而言,存算一體的最大價值不是峰值算力,而是“在儲存之處完成KV Cache讀寫和注意力計算”,從根本上降低多輪狀態保持的能耗和延遲。

六、創新方向二:Chiplet與3D封裝——算力密度的物理突破

6.1 單體晶片的物理極限

當單顆AI晶片的電晶體數量逼近光刻與良率極限,功耗牆、散熱牆、良率牆同時顯現。單晶片面積越大,製造成本呈指數級上升;片上HBM控製器和IO單元擠佔計算面積;長距離互連導致延遲和能耗增加。

6.2 Chiplet的解題思路

Chiplet將“計算芯粒、儲存芯粒、IO芯粒”按各自最優工藝節點分別製造,再通過先進封裝組合。這樣既能用成熟製程生產IO/儲存,又能用先進製程生產計算核心,在成本與性能之間取得新平衡。

國內北極雄芯由清華大學姚期智院士孵化,其基於3DIC+Chiplet的Polar Stack系列已回片點亮;其QM935系列Chiplet異構整合的AI Box可支撐端側大模型應用。

6.3 3D堆疊的頻寬紅利

硅通孔(TSV)和混合鍵合技術使多個裸片在垂直方向堆疊,互連長度從毫米級降至微米級。據行業估算,採用3D堆疊封裝的AI晶片,片間互聯頻寬可達傳統2.5D封裝的6倍,延遲下降約70%,整叢集訓練效率可提升2倍以上。

6.4 對Agent架構的意義

多模型協同的Agent系統對“計算—儲存—互連”的整合密度要求極高。Chiplet+3D封裝讓“儲存芯粒緊貼計算芯粒”成為可能,使KV Cache與啟動值的搬運距離最短化,為多模型異構整合提供了物理基礎。

七、創新方向三:液冷與全端散熱——算力可持續的基礎設施

7.1 AI算力功耗的指數級增長

輝達GPU單卡功耗從A100的400W,到H100的700W,再到B200的1000–1200W,B300約1400W;而下一代Rubin/R300功耗預計突破1800W甚至4000W。   五年間,單晶片功耗漲幅超過四倍。

機櫃功率密度隨之水漲船高:傳統風冷機櫃20–30kW已難以為繼,GB200 NVL72機櫃可達130–250kW,華為昇騰384超節點總功耗達559kW。風冷在物理層面已觸及天花板。

7.2 液冷的技術要點

技術路線
原理
PUE水平
適用功率密度
風冷
空氣對流散熱
1.5–2.0
<30 kW/櫃
冷板式液冷
冷卻液流經晶片上方冷板帶走熱量
1.10–1.25
30–250 kW/櫃
單相浸沒式
整機浸泡在非導電冷卻液中
1.04–1.08
80–120+ kW/櫃
相變浸沒式
低沸點介質沸騰汽化帶走熱量
最低1.02–1.05
>200 kW/櫃

7.3 經濟賬:PUE下降與TCO最佳化

2026年被行業視為液冷放量元年,機構預測全球智算中心液冷市場規模將達1147億元,同比增長273%。國內液冷滲透率從2021年的不足3%升至2025年的20%,2026年預計達37%,2027年有望突破50%。

從TCO角度看,液冷帶來的電費節省與空間節省可在1.5–2年內收回額外投資。京東雲算力中心通過冷板式液冷將PUE從1.3降至1.1;常州移動資料中心每年節電約600萬度。對高密度AI叢集,   液冷已從“可選項”變為“必選項”

八、創新方向四:開放超節點與國產算力底座

8.1 千卡/萬卡叢集的通訊瓶頸

在千卡、萬卡規模下,網路通訊時間佔總訓練時間的比例急劇上升。分佈式訓練中的All-Reduce、All-to-All等集合通訊對頻寬、延遲、無損傳輸提出了極高要求。RDMA已成剛需,但實現方式分兩大陣營:

維度
InfiniBand
RoCEv2乙太網路
端到端延遲
~2 μs
~5 μs
無損機制
原生credit-based
PFC/ECN軟體組態
最優規模
萬卡級性能基本不降
千卡級性價比較高
成本與生態
成本高,NVIDIA主導
成本低,多供應商可選

輝達官方基準顯示,大規模訓練中RoCE吞吐可比InfiniBand低10%–15%。但對多數企業級智算中心而言,RoCEv2在成本和通用性上仍是更務實的選擇;當規模邁向萬卡、且對延遲極度敏感時,InfiniBand仍是首選。

8.2 開放超節點標準的意義

“超節點”通過Scale-up高速互聯將多塊GPU/NPU組成統一記憶體域。浪潮資訊在AICC2026期間發佈新一代超節點AI伺服器與多元算力機組,強調通過開放多元架構與軟體演算法協同,支撐智能體時代的規模化推理。

開放超節點標準的意義在於:   解耦硬體與軟體,避免單一廠商鎖定;   統一互聯協議,使不同廠商的晶片、網路卡、交換機可以互操作;   降低生態遷移成本,讓國產晶片更快融入主流AI框架。

8.3 國產AI晶片的生態突圍

國產AI晶片正從“單卡性能追趕”走向“叢集效率最佳化”。華為昇騰910B在FP16算力(約376 TFLOPS)、視訊記憶體頻寬(1.6 TB/s)、互聯頻寬(HCCS 392 GB/s)等硬指標上與H100存在差距,但其通過   CloudMatrix 384超節點等系統級方案,將384顆910C晶片整合為大規模計算單元,實現叢集級性能補償。

圖3 · 全球AI算力需求滿足率缺口:算力供需失衡將長期存在(資料來源:IDC 2026)

智譜Infra Agent在超過10萬卡國產加速器上的成功部署也表明:   軟體最佳化可以在一定程度上彌補硬體差距。   當算力供給受限時,工程效率——而非單純FLOPS——成為決定可用算力的關鍵變數。

九、結語:架構師的思維轉變

Agent時代的計算競爭,已經從“單點性能”升級為“系統效率”。浪潮資訊首席AI戰略官劉軍在AICC2026上提出的“從提供算力走向生產智能”,本質上是對架構師提出的新要求:   不再只關注GPU峰值FLOPS,而要關注Token產出效率、任務完成時間、系統可用性與TCO。

  • 三個關鍵判斷

推理成本將繼續下降,但下降速度取決於架構效率,而非單純硬體降價。

PD分離、KV Cache最佳化、動態批處理、量化壓縮的組合將持續壓低單Token成本。

  • Agent將吞噬傳統API呼叫。

當Agent可以自主規劃、呼叫工具、迭代執行時,大量硬編碼的業務邏輯API將被“自然語言意圖 + 模型編排”替代,呼叫形態發生根本變化。

  • 開放架構將勝出。

單一廠商的全端鎖定在智算中心層面越來越不可持續。開放超節點、統一調度層、多引擎推理閘道器、國產算力相容,將成為基礎設施選型的核心標準。

給架構師的行動建議

檢查項
具體動作
負載畫像
統計Agent任務的平均輪數、上下文長度、工具呼叫頻率、結構化輸出比例,判斷是否需要引入RadixAttention引擎。
視訊記憶體/KV規劃
評估長上下文場景下的KV Cache峰值,規劃HBM容量、PD分離、KV offload或存算一體路徑。
散熱與能效
按單機櫃功率密度選型:<30kW風冷/冷板可選;30–250kW冷板式為主;>250kW需評估浸沒式。確保PUE滿足當地政策紅線。
異構相容
建構統一的推理調度抽象,使NVIDIA、昇騰、寒武紀等算力可在同一Token工廠內按需調度,降低單供應商依賴。
反饋閉環
在Agent部署中設計“執行—反饋—最佳化”的資料通道,使推理日誌能低成本地回流到訓練/微調流程。

最終判斷

Agent不是大模型的“應用層裝飾”,而是對AI基礎設施的一次“壓力測試”。
它正在倒逼晶片、儲存、網路、散熱、調度、反饋閉環全面重構。
能夠用開放系統架構高效“生產智能”的玩家,將成為下一階段計算產業的主角。 (AI雲原生智能算力架構)