CPU需求升溫的同時,供應端壓力也開始成為英特爾需要回應的問題。
2026英特爾技術創新與產業生態大會上,英特爾資料中心集團副總裁、中國區總經理陳葆立對第一財經記者表示,智能體執行的任務越來越複雜,CPU側的執行量也會隨之增加。
談及供應問題時,英特爾方面表示,18A已經進入量產,希望新增產能幫助應對供應需求。
過去的大模型主要承擔訓練、推理和內容生成,GPU是核心算力。進入Agentic AI階段後,一個智能體可能同時呼叫多個Sub Agent、Skill和沙箱,涉及任務拆解、調度、程式碼執行、外部工具呼叫等環節。“過去大模型只是輸出一些文字,現在整體開始做執行了。”陳葆立對記者表示,隨著智能體能夠執行的任務越來越多,CPU側的執行量也會增長。
這一變化已經開始影響CPU的設計思路。
英特爾此次披露,至強6+最高擁有288個能效核,單顆處理器最高可支援超過1000個智能體;在滿足200毫秒SLA的條件下,最多支援350個沙箱並行。
相比傳統虛擬機器、資料庫等負載,Agent任務更加碎片化,也更具突發性。“有客戶提出過在10分鐘內啟動1萬個沙箱的需求。這意味著,CPU競爭不再只是核心數量和峰值性能,前端資源、快取、記憶體容量、頻寬以及調度效率,都可能成為影響實際性能的因素。”一位現場的英特爾技術專家對記者說。
這意味著,CPU競爭不再只是核心數量和峰值性能,前端資源、快取、記憶體容量、頻寬以及調度效率,都可能成為影響實際性能的因素。
記憶體同樣成為新的瓶頸。
隨著Agent和程式碼生成場景的上下文不斷拉長,KV Cache規模快速增長。KV Cache可以理解為大模型處理上下文時暫存的“中間記憶”,對話越長、同時處理的任務越多,需要佔用的視訊記憶體就越大。
英特爾正在推進KV Cache智能加速方案,其中KV Shrink可以將部分KV Cache從視訊記憶體解除安裝至系統記憶體甚至遠端伺服器,並利用DSA進行資料搬運,通過壓縮和流水線調度降低視訊記憶體壓力。英特爾方面稱,相關項目已經在GitHub開源。
從英特爾的判斷看,Agentic AI帶來的並不是簡單的“CPU替代GPU”,而是AI基礎設施內部工作分工的變化。
陳葆立將未來資料中心概括為三類叢集:CPU伺服器或CPU叢集負責智能體執行和工作編排,GPU伺服器承擔模型推理,即傳統意義上的“Token工廠”,記憶體叢集則承載長對話、文件、合同等不斷增加的資料。三者之間的資料調度,仍然需要CPU參與。
真正的挑戰也由此出現,當智能體數量快速增加,如何讓CPU、GPU、記憶體、記憶體和網路保持平衡,而不是某一環節的算力提升後,其他資源反而成為瓶頸。
對於英特爾而言,這意味著CPU面對的不再只是傳統伺服器市場的性能競爭,而是AI基礎設施擴張帶來的新一輪需求變化。與此同時,如何擴大供應、匹配不斷變化的AI工作負載,也成為晶片廠商需要面對的問題。 (第一財經)
