#Vera
輝達宣佈Groq 3 LPX全面投產,Vera Rubin推理效率數倍提升,SpaceXAI加碼智能體與太空AI
輝達稱,基於SemiAnalysis的AgentX工作負載、採用DeepSeek V4 Pro模型,Vera Rubin每兆瓦吞吐量最高達到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。SpaceXAI將採用Vera CPU加速下一代智能體AI應用,並擴大基於Vera Rubin的平台建設,SpaceXAI計劃將優化版Vera Rubin NVL72延伸至太空,用於首代Starmind AI衛星。 輝達正在加速把AI基礎設施的競爭,從傳統的模型訓練和推理性能,推進到圍繞智能體AI(Agentic AI)的Token生成速度、能耗和成本展開的新階段。 美東時間24日周一,輝達宣佈面向互動式AI推理的Groq 3 LPX正式全面投產。作為Vera Rubin平台的重要組成部分,Groq 3 LPX主打超低延遲Token生成,輝達稱,在Artificial Analysis測試中,搭載Gemma 4 31B模型、100,000 Token上下文時,Groq 3 LPX實現每秒3400個輸出Token,為該模型創下最高紀錄;針對智能體編程等低延遲工作負載,其響應速度最高達到最近競爭平台的4倍。 同時,輝達公佈Vera Rubin NVL72在真實智能體工作負載下的新測試結果:基於SemiAnalysis的AgentX工作負載、採用DeepSeek V4 Pro模型,Vera Rubin每兆瓦(MW)吞吐量最高達到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。輝達強調,智能體任務不同於傳統聊天或摘要,任務上下文會隨著數百個步驟不斷累積,甚至達到數十萬Token。
傳輝達擬削減Vera Rubin機架記憶體配置,以應對成本飆升
7月27日消息,據外媒Wccftech援引廣發證券(GF Securities)的分析報導稱,輝達公司正在大幅減少其Vera Rubin NV72機架級AI系統的記憶體使用量,以應對持續的記憶體短缺和價格上漲問題。 輝達的Vera Rubin NVL72機架系統是全球性能最頂尖的AI計算平台之一。該系統於今年1月發佈,其首批性能資料在本月初由CoreWeave共享不同AI系統的吞吐量資料後首次浮出水面。結果顯示,在處理混合專家(MoE)模型工作負載時,搭載輝達Blackwell AI GPU的系統在150兆瓦功耗下可實現每秒8萬token的吞吐量;而全新的VR200 NVL72 Vera Rubin平台則將這一數值提升了10倍,達到每秒80萬token。 這一結果出爐之前,伯恩斯坦(Bernstein)早前的一份報告曾指出,單台NVL72 Rubin機架的成本可能高達910萬美元,主要原因在於記憶體價格走高。伯恩斯坦表示,此前有關該機架成本為780萬美元的估算,是基於過時的記憶體價格預測得出的。該金融機構進一步指出,HBM4記憶體的價格在2027年可能上漲至53美元/GB。 近日,廣發證券的一份報告顯示,輝達正在進行調整,以應對記憶體市場的供應和價格壓力。該報告認為,從Vera Rubin NVL72機架開始,輝達將把該機架的SOCAMM(小型壓縮附加記憶體模組)容量減半,從原先的192GB模組降至96GB。這些調整是為了應對LPDDR5X市場的供應緊張局面。