據報導,輝達正全力研發至少達1兆參數的開源模型Nemotron 4,旨在降低對OpenAI等頭部客戶及雲巨頭的依賴。公司不僅通過回租服務器將雲服務算力承諾大幅增至280億美元,還組建了包括Mistral、Cursor等在內的「Nemotron聯盟」共建生態。輝達周二發佈300億參數、30億活躍參數的模型Nemotron 3.5 Lightning及開源模型路由庫NeMo Switchyard,分別主打高效智能體執行與多模型智能調度。戴爾宣佈擴大與輝達合作,將輝達官宣的這兩項技術納入Deskside Agentic AI,推動智能體向企業本地部署延伸。
輝達正在加速向開源AI模型的前沿競爭發起衝擊,試圖以此擴大GPU需求——儘管這一策略同時將其推入與自身客戶和投資對象正面競爭的微妙處境。
The Information本月11日周二報導稱,輝達目標是將Nemotron 4最大版本的性能打造至與全球頂尖開源模型比肩的水準。多名員工透露,該模型參數量預計至少達到一兆——約為其現有最大模型Nemotron 3 Ultra的兩倍。輝達生成式AI副總裁Kari Briski在一封郵件中表示,"輝達投資Nemotron,是因為我們相信每家企業、每個國家都需要可及的前沿開源模型。"
輝達當前的晶片需求高度集中於OpenAI、微軟、SpaceX等少數前沿實驗室和雲服務商,而上述機構正日益佈局自研AI晶片。Nemotron 4的推進旨在將需求基礎拓展至更廣泛的企業用戶群體,從而降低輝達對頭部客戶的依賴。AI模型評測機構Arena的首席執行長Anastasios Angelopoulos表示,"無論那家公司做出優秀的開源模型,輝達都是贏家。"
消息傳出後,輝達股價在美股盤前漲近2%,但開盤後高開低走,盤初曾漲超2%,午盤轉跌。
傳出消息當天,輝達官宣面向長期運行AI智能體(Agent)的Nemotron 3.5 Lightning,並推出開源模型路由庫NeMo Switchyard,顯示該司在加快Nemotron模型生態佈局。戴爾同日宣佈擴大與輝達的合作,將這兩項技術納入Dell Deskside Agentic AI平台,推動智能體在企業本地及桌面端部署。
從兆參數級前沿模型,到30億活躍參數的高效智能體模型,再到模型路由和企業本地基礎設施,輝達正在形成一條從模型、軟件到部署平台的完整AI生態鏈。此次Nemotron 4的研發消息,也意味著輝達不再滿足於做全球最大的AI晶片供應商,而是在向開源模型領域的頂級玩家發起正面競爭。
千億參數目標,算力投入三倍躍升
據多名參與Nemotron項目的員工透露,輝達計劃開發的最大規模Nemotron 4模型參數量至少達到1兆,約為其今年6月發佈的現有最大模型Nemotron 3 Ultra的兩倍。該模型參數規模仍將遠低於中國頭部開源模型,但輝達同時強調其壓縮技術可使較小模型實現超越性的性能表現。
在算力投入層面,輝達的決心體現於其資金承諾的大幅擴張。據悉,該公司通過向購買其晶片的雲服務商回租AI服務器獲取算力。截至今年4月,輝達多年期雲服務承諾的總價值已增至2031年初的280億美元,約為一年前披露金額的三倍。其中針對本財年(截至2028年1月)的相關支出約為70億美元,雖遠低於OpenAI和Anthropic的投入規模,但已超過絕大多數美國和中國領先開源實驗室的歷史融資總額。
在研發人員規模上,Nemotron項目同樣持續擴張。輝達上一個重要模型的研究論文署名作者多達570人,多名員工表示Nemotron 4的參與人數將更多。"現在每個人都想參與進來,"一位前員工說。
組建"Nemotron聯盟",廣納開源生態夥伴
為加速Nemotron 4的研發,輝達構建了一個名為"Nemotron聯盟"的合作網絡,成員包括Reflection、Cursor、Thinking Machines和Mistral等開源開發商,各方在推進自身模型項目的同時,也向Nemotron 4貢獻訓練數據、評估支援和模型設計方案。
此外,據一位直接參與合作的人士透露,AI模型訓練初創公司Prime Intellect已向該項目貢獻了30萬個模擬環境,用於輔助模型訓練。AI編程工具初創公司Cognition也在聯盟成員之列,據知情人士透露,該公司已就向輝達提供代碼訓練數據展開討論,但相關合作尚未正式對外公佈。
聯盟成員的參與動機各異。部分公司希望藉助輝達對開源生態的推動擴大市場份額;另一些則期望以較低成本影響一個可供自身使用的高質量模型的研發方向,從而規避自行承擔訓練算力成本的壓力。Prime Intellect首席執行長Vincent Weisser將這一聯盟定位為對抗單一"神級"模型壟斷的集體行動,而非一場爭奪最佳開源模型名號的零和博弈。
客戶與競爭對手的邊界趨於模糊
Nemotron 4的推進令輝達陷入一種微妙的結構性張力之中。一方面,OpenAI長期以來是輝達晶片需求的重要驅動方,輝達已向其投資300億美元;另一方面,Nemotron 4的定位恰恰是為企業提供成本更低的替代方案,與OpenAI等前沿實驗室的商業模型形成競爭。與此同時,聯盟中包含的Reflection AI和Thinking Machines等公司,也是輝達已注資的開源創業企業。
不過,對輝達而言,這一競爭邏輯並不必然是零和遊戲。AI模型評估機構Arena的首席執行長Anastasios Angelopoulos表示:"無論那家公司做出優秀的開源模型,輝達都是贏家。"輝達的核心邏輯在於:開源生態越繁榮、參與主體越多元,GPU的整體需求就越旺盛。
目前,Nemotron系列模型已獲得一定市場採用,帕蘭提爾(Palantir)於今年6月宣佈與輝達合作,將Nemotron模型用於美國政府客戶。但據Arena和Artificial Analysis等機構的基準測試數據,輝達現有最大模型Nemotron 3 Ultra在美國開源模型中僅排名第二,位列Thinking Machines新發布的Inkling模型之後,在全球模型整體排名中更位於前40名之外。
發佈時間表仍不明朗
儘管項目規模宏大,Nemotron 4的發佈時間仍存在較大不確定性。多名員工表示,輝達已就預訓練數據和架構做出若干決策,但尚未最終確定具體規格和發佈日期,最終訓練階段亦尚未啓動,預計耗時數月。兩名員工認為模型最快可在今年秋末發佈,另有員工認為時間可能更晚。
與此同時,輝達本周已發佈了Nemotron系列的一個較小版本——Nemotron 3.5 Lightning,該模型主打以儘可能快的速度和效率運行AI代理任務。輝達同步發佈了免費的模型路由軟件,協助企業更便捷地構建自定義模型路由工具,將特定AI任務自動分配至最優、最經濟的模型處理。
輝達應用深度學習研究副總裁Bryan Catanzaro今年1月在一檔播客中表示,投資Nemotron"對我們公司的未來至關重要"。輝達首席執行長黃仁勳也在上月的一封郵件中公開表態支援開源,稱開源模型"促進安全、網絡安全、科學進步和國家安全"。
Nemotron 3.5先行:30億活躍參數專攻長期運行智能體
就在Nemotron 4消息曝光的同一天,輝達正式發佈Nemotron 3.5 Lightning。
與Nemotron 4追求「更大」不同,Lightning追求的是更高效。
該模型採用混合專家(MoE)架構,總參數量約300億,但每個Token實際啟動約30億參數,主要針對需要長期運行、反覆調用模型的AI智能體。輝達稱,Nemotron 3.5 Lightning最高可實現約4倍的Token生成速度提升。
其定位並不是取代最強大的前沿模型,而是成為多智能體系統中的「執行型」模型。
例如,在一個複雜的企業AI系統中,大模型可以負責任務規劃和複雜推理,而Nemotron 3.5 Lightning則可以承擔大量代碼審查、安全監控、數據處理、告警分析等專業化工作。
這也是MoE架構的價值所在:模型擁有較大的總參數規模,但每次推理只啟動其中一小部分,從而降低單次Token計算成本。
輝達希望通過這一設計解決AI智能體規模化運行後的現實問題——一個智能體可能不是調用模型一次,而是連續調用幾十次甚至數百次。
因此,對於智能體而言,模型「足夠聰明」固然重要,但「足夠便宜、足夠快」同樣重要。
不過,4倍Token生成速度並不意味著完整智能體任務可以提速4倍。
第三方測試顯示,Nemotron 3.5 Lightning在純模型生成環節的速度優勢非常明顯,但放入完整的智能體工作流後,整體任務速度提升約30%。原因在於,模型推理只是Agent系統的一部分,工具調用、API響應以及多個Agent之間的任務編排都可能形成新的瓶頸。
這也為輝達同時推出NeMo Switchyard埋下伏筆。
從「模型」到「路由」:輝達開始解決智能體系統瓶頸
NeMo Switchyard是一套開源模型路由庫。
它的核心思路是:開發者不需要重寫原有應用,就可以根據不同任務的特點,把請求自動分配給最合適的模型。
例如,複雜推理任務可以交給大型模型;代碼審查、分類、數據提取等高頻任務則可以交給Nemotron 3.5 Lightning這樣的高效模型。
這樣做的意義在於,企業不必讓每一個智能體任務都使用最昂貴的模型。
對於未來的多智能體系統而言,真正重要的可能並不是「那個模型最好」,而是那個任務應該由那個模型完成。
輝達此次把Nemotron 3.5 Lightning與Switchyard同時發佈,實際上體現了其對智能體基礎設施的判斷:隨著模型數量越來越多,模型之間的調度和協同將成為新的軟件層。
而這一層恰恰可以幫助輝達擴大自身的生態影響力。
即便企業最終同時使用其他廠商的模型,只要這些模型進入輝達的路由、推理和部署體系,輝達依然可以從整個AI工作流中獲得價值。
戴爾擴大合作:把Nemotron和Switchyard帶到企業桌面
輝達的模型戰略正在進一步向企業端落地。
8月11日,戴爾宣佈擴大與輝達的合作,將Nemotron 3.5 Lightning和NeMo Switchyard納入Dell Deskside Agentic AI平台。戴爾稱,這一平檯面向企業級智能體應用,強調本地運行、低延遲、成本控制和數據安全。
這意味著,輝達當天的動作並非孤立的模型發佈。
一端是Nemotron 4這樣瞄準兆參數級別的前沿開源模型;另一端則是Nemotron 3.5 Lightning這樣面向本地和企業Agent工作負載的小型高效模型。
戴爾則進一步把後者與本地硬體和企業IT環境結合起來。
對於企業客戶而言,本地運行Agent的吸引力在於,敏感數據無需頻繁離開企業內部,同時可以降低對雲端API的依賴,並獲得更加可控的延遲和推理成本。
戴爾此前就將Deskside Agentic AI定位為連接企業桌面端與數據中心的入口。其方案基於Dell AI Factory with NVIDIA,並支援從本地Agent開發逐步擴展到數據中心規模部署。
因此,戴爾此次把Nemotron 3.5 Lightning和Switchyard納入平台,實際上強化了輝達的另一條路線:
讓Agent不僅在雲端運行,也能直接進入企業員工的工作環境。
如果未來越來越多企業採用「本地小模型+雲端大模型」的混合模式,那麼輝達可以同時從GPU、模型、路由軟件以及企業基礎設施多個環節獲得收益。 (華爾街見聞)
