太炸裂了。
就在剛剛,輝達史上首次公佈了下一代旗艦級機櫃 Vera Rubin NVL72 的首次片上實測資料。
而且,這次實測直接拉來了DeepSeek-V4-Pro,跑最真實的「智能體編碼」任務!
結果令人吃驚:對比當前的主力機皇GB300 NVL72,Vera Rubin的每兆瓦吞吐量最高飆升了30倍、Token成本最高暴降了35倍!
有人驚呼:「我連騙投資人的 PPT 都不敢這麼寫!」
還有網友神評:「以前嫌 H200 三萬美元一張貴,現在回頭一看,H200 居然連丐版都算不上了。」
讓我們來仔細盤一盤。
從H200到GB300,真實Agent工作負載的吞吐量提升了最高30倍,成本大致翻倍。
從GB300到Vera Rubin,吞吐量再次飆升最高30倍,整機架價格大致再翻倍。
按照老黃的摩爾定律,合著這兩年輝達最大的技術突破不是GPU本身,而是讓價格貴了4倍,卻換來了整整900倍的速度飛躍!
這次,輝達向所有人宣佈了一個反常識的真相:LLM時代結束,Agent時代降臨,以前的AI跑分基準,全部作廢!
與此同時,專為智能體打造的Vera CPU,已被馬斯克的SpaceXAI連夜裝機,甚至準備直接打上太空.
同在今天,輝達Groq 3 LPX也全面量產。
Gemma 4 31B在上面跑,速度簡直絕了,直接幹到每秒3400個Token。兆參數模型吞吐,狂飆35倍。
這些新紀錄,直接讓Agent生態的商業格局,從今夜開始重寫!
為什麼輝達必須推出Vera Rubin?
OpenRouter的最新資料給出了答案:在真實世界裡,一個Agent AI任務消耗的Token數量,是普通聊天對話的15倍!
比如,如果讓一個Agent為投資決策去研究一家公司,在這個過程中,智能體和子智能體會不斷推理,累積的Token成為下一步的輸入,長上下文處理,就成為限制智能體AI的最關鍵要素。
智能體互動次數越多,吞吐量越大——智能體數量多了10倍,工具呼叫多了2倍,算力和演算法的矛盾催生了新的需求。
別拿聊天當智能體,舊基準全廢了!
這時候,傳統的AI基準測試(如固定長度的8K/1K序列測試)就徹底無效了。
輝達官方挑明:性能測量必須進化!不能再測單一的推理請求,必須捕捉完整的Agent工作流。
為此,他們使用了SemiAnalysis 旗下的 AgentX 基準測試。
這個測試不再是死板的問答,而是回放真實的、具有上下文增長、工具呼叫和子智能體生成的「程式碼編寫會話」。
這就是為什麼H200在新的Agent戰場上顯得力不從心,Vera Rubin註定要稱王。
Vera Rubin NVL72 × DeepSeek-V4-Pro:算力怪物來了
為了證明Vera Rubin NVL72的實力,輝達直接使用開源王者——DeepSeek-V4-Pro (1.6T) 進行片上實測。
資料一出,結果驚人——
在AgentX工作負載下,Vera Rubin NVL72的每兆瓦吞吐量,比GB300 NVL72最高提升了整整30倍!
請注意,這裡對比的不是老舊的H200,而是炙手可熱的主力GB300。
GB300在同樣的DeepSeek-V4-Pro測試中,每兆瓦吞吐量已經比H200提升了15倍。
然而Vera Rubin卻在GB300的肩膀上,又拔高了30倍,在整個帕累托曲線上又提高了!
這意味著什麼?
對於受制於電力供應的「AI工廠」來說,這直接拓展了物理法則邊界。
在同樣的電力預算下,Vera Rubin能幹30倍的智能體活兒。
對於兆瓦級甚至吉瓦級的資料中心來說,這相當於憑空變出了30倍的算力資產。
而且,NVIDIA DSX MaxLPS 技術可以在 GPU、機架和工作負載層面進行電源管理,能在相同的兆瓦預算內多配置高達 40% 的 GPU,讓AI工廠進一步提升了每兆瓦吞吐量!
Token成本暴降35倍!Agent行業的「帳本」徹底重寫
每兆瓦吞吐量,直接影響的就是每個生成 token 的成本。性能的飆升,帶來的最直接後果就是商業模式的核爆。
輝達宣佈,Vera Rubin NVL72 生產每百萬Token的成本,比 GB300 NVL72 最高降低了 35 倍!
當推理成本呈斷崖式下跌35倍時,24小時無休的數字員工將成為現實,ToC端超級應用將迎來大爆發。
老黃這一刀,直接切開了Agent應用的時代大門。
極致協同設計:老黃是怎麼做到的?
你可能會問:憑什麼能提速30倍?靠的是單顆晶片的工藝嗎?
顯然不是。
Vera Rubin NVL72驚人的性能提升,靠的是「極致協同設計」。
比如分離式服務,分佈式KV快取,KV感知路由,MegaMoE等等。
另外,NVFP4 量化直接將模型權重壓縮到 4 位精度,在不犧牲輸出質量的情況下,大幅縮減記憶體佔用,讓吞吐量原地起飛。
而第六代 NVLink 與大模型MoE,提供了比現成乙太網路快10倍、延遲低3倍的網際網路絡,讓像DeepSeek這種基於MoE架構的大模型,可以在72個GPU之間行雲流水地呼叫不同的「專家」子網路。
這早已不是在賣顯示卡,老黃賣的是一整套「AI發電廠」。
輝達Groq 3 LPX 全面量產:3400 Token/秒,程式碼Agent變天!
這次Hot Chips 2026 大會上,輝達還拋出一個震撼消息:Groq 3 LPX 開始全面量產!
Groq 3 LPX,是Vera Rubin NVL72 資料中心平台的專屬擴展。
它是專為這個系統「量身定製」,主打就是一個低延遲推理加速。
這項黑科技,是去年12月輝達豪擲200億美元從初創公司 Groq 手中買來的。
AI智能體會遇到解碼延遲的問題,為了終結這一痛點,Groq 3 LPX 巧妙地將龐大的上下文處理與 Token 生成徹底分離。
輝達的解法是,讓Rubin GPU處理大規模上下文,把極速生成Token的任務交給Groq 3 LPX。
一個管「讀」,一個管「寫」,各幹各最擅長的。
在一個完整的機架級部署中,多達 256 個 LP30 加速器可以通過超高頻寬互連與 GPU 協同作戰,構造出企業級規模的推理引擎。
由此,Groq 3 LPX直接達到了破紀錄的輸出速度。
在 Artificial Analysis 的基準測試中,Groq 3 LPX 在 10 萬 Token 超長上下文窗口下運行Gemma 4 31B,輸出速度達到驚人的3,400 Token/秒!
這使得它在延遲極度敏感的工作負載中,響應速度比競品快了4倍。
過去幾個小時才能完成的多步智能體任務,現在幾分鐘內就能完成!
Groq 3 LPX在生成5000 Token,所用時間從50秒將至1.5秒,34倍差距。
而且在編碼任務中,Groq 3 LPX最大輸出速度6981 token/s。
黃仁勳直言,通過 LPX 推進超高速 Token 生成,在 AI 吞吐量和響應能力上實現了「又一次巨大飛躍」。
Nebius已經在Nebius Token Factory 中部署該晶片,讓智能體循環的每一步都能獲得即時響應的極致體驗。
緊隨其後的,還有Groq自己。
首款Agent專屬CPU發佈,馬斯克連夜「打上太空」!
這次官宣中,最具野心的一步棋,就是 Vera CPU了。
為了Agent,輝達專門造了一顆CPU。
Vera這顆CPU,就是專門喂飽智能體的,
它配備了88個自研的Olympus核心,高頻寬的LPDDR5X記憶體,頻寬直接幹到1.2TB/s。
為什麼大模型時代需要全新的CPU?
Hot Chips現場,輝達Vera CPU高管直言,「Agentic AI是史上最複雜的計算任務」。
一次任務,Agent背後要跑上百步:呼叫工具、執行Python程式碼、翻上下文、處理海量資料....
這些跑腿調度的活兒,全都壓在CPU身上硬扛。因此,輝達必須給Agent單獨造顆CPU。
正是看中了這一點,馬斯克的 SpaceXAI 連夜宣佈,正式規模化部署輝達 Vera CPU!
早在今年5月,輝達就把第一批Vera樣片,悄悄送到了A社、OpenAI、SpaceXAI先「試水」。
僅僅3個月後,SpaceXAI 就迫不及待地將其轉入全面部署。
更瘋狂的是,SpaceXAI 正在基於Vera Rubin 平台建設吉瓦級算力工廠,用來驅動Grok。
不僅如此,這套算力,還要被直接送上太空。
馬斯克表示,「兩家強強聯手,設計了一款最佳化版的Vera Rubin NVL72,將在2028年大規模部署」。
SpaceXAI的第一代「Starmind」AI衛星,就計畫採用Vera Rubin NVL72 機架級系統。
從一塊GPU,到整座Agent工廠
同一天,兩大晶片Vera CPU和Groq 3 LPX,全面量產。
這對輝達來說,意義重大。
大模型時代,輝達靠GPU拿下訓練和推理。
Agent時代,它的版圖已經延伸到CPU、推理加速器、NVLink等等。
老黃賣的,早已不只是一塊GPU。
他要賣的,是一座可以不斷生產Token的AI工廠。
老黃這一次,是要給整個「Agent時代」重新鋪一遍地基。 (新智元)
