Google反擊!Gemini 4 Argon性能比肩Astra,成本僅60%

RexAA
•
AI速讀
Google 推出 Gemini 4 Argon 旗艦模型,主攻企業級複雜任務,將輸出上限擴展至 100 萬 Token。數據顯示,該模型在程式設計、金融研究及漏洞修復等測試中領先 GPT-6 Astra 與 Claude 系列,且每任務成本較競爭對手降低約 40%。Google 內部已將其應用於量子演算法最佳化及大規模程式碼遷移。然而,部分員工與開發者反映其現實表現未達測試水準,且生成美感略遜於 Claude Opus 5。目前模型正透過「Fairwind 計畫」分階段開放給安全團隊與付費用戶。
輸出上限達100萬Token。

智東西10月1日消息,今天凌晨,Google發佈新一代旗艦模型Gemini 4 Argon,重點面向軟體工程、法律與金融等企業知識工作,以及網路安全防禦等複雜、長週期任務。

在衡量長程軟體工程能力的DeepSWE v1.1測試、評估金融、程式設計、法律和稅務等企業知識工作的Vals Index、測試企業端到端自動化執行能力的AutomationBench,以及考察長視訊理解能力的LVBench中,Gemini 4 Argon均領先GPT-6 Astra、Claude Fable 5.1和Claude Opus 5.5等模型;在評估漏洞修復能力的CWE-bench v1中,Argon以68%的成績與GPT-6 Astra並列第一。

在Text Arena的模型成本與得分對比中,Gemini 4 Argon High以1525分和每百萬Token 8美元的混合價格,進入成本-性能前沿。

目前,在Artificial Analysis Intelligence Index中,Gemini 4 Argon得分53分,僅落後於Claude Opus 5.5和Claude Sonnet 5.5,得分與Claude Fable 5.1、GPT-6 Astra並列。

▲Gemini 4 Argon在Artificial Analysis上測評情況(圖源:Artificial Analysis)

不過,彭博社援引知情人士稱,部分Google員工認為,Gemini 4雖然在行業基準測試中表現亮眼,但在實際工作中並不總能達到同等水平,尤其是在部分程式設計任務上仍較為吃力,這與Google當天發佈的測試成績形成反差。

Gemini 4 Argon現已通過“Fairwind計畫”向一批經過篩選的網路安全防禦團隊開放。Google計畫先收集早期測試反饋、繼續完善安全護欄,隨後逐步向開發者、企業和消費者開放,首批使用者將包括付費API客戶和Google AI Ultra訂閱者。

Argon API初始價格為每百萬輸入Token 2美元(約合人民幣13.4元)、每百萬輸出Token 10美元(約合人民幣67元),快取輸入Token價格在輸入Token基礎上降低95%,即每百萬Token約0.1美元(約合人民幣0.67元)。

根據Artificial Analysis,按折扣定價,Gemini 4 Argon的每任務成本為1.99美元,較GPT-6 Astra(max)降低40%。

▲Gemini 4 Argon每任務成本與其他模型對比(圖源:Artificial Analysis)

Google首席執行官桑達爾·皮查伊(Sundar Pichai)稱,外界對下一代模型的討論很多,因此希望儘早展示Gemini 4 Argon。Google內部團隊已廣泛將其用於程式設計、量子計算等工作,反饋良好。

▲皮查伊發文官宣Gemini 4 Argon(圖源:X)

一位X使用者認為,Gemini 4對提示詞格外敏感,輸出內容和風格受提示詞影響的程度超過其他模型,默認風格不佳,但增加一句提示詞就容易改善。他還展示了用不同提示詞復刻《樂高星球大戰》關卡的效果。

▲開發者對於Gemini 4 Argon的評價(圖源:X)

另一位開發者認為,在一次生成細節豐富、美感出色的3D場景方面,Gemini 4 Argon尚未達到Opus 5的水平。Gemini 4 Argon在畫面細節上,效果略顯粗糙。

▲開發者對比Gemini 4 Argon(上)和Claude Opus 5(下)的生成效果(圖源:X)

01. 輸出上限提升至100萬Token,程式設計能力與企業任務測試突出

Gemini 4 Argon將模型輸出Token上限從此前的6.4萬Tokens提升至100萬Tokens,成為目前業內輸出容量最高的模型之一。更大的輸出空間允許模型在單次任務中深度思考,並生成數十萬甚至上百萬Token,用於處理大型程式碼庫、複雜研究和多步驟企業流程。

程式設計方面,Gemini 4 Argon在衡量真實世界長期軟體工程能力的DeepSWE v1.1測試中取得77.9%的成績,刷新該測試的最好紀錄。

在覆蓋金融、程式設計、法律和稅務等工作的Vals Index中,Argon排名第一。Argon還在Vals Finance Agent v2測試(多步驟金融研究)、Harvey法律Agent測試(法律研究與起草)中取得領先成績。

在Zapier用於評估企業端到端自動化執行能力的AutomationBench中,Argon得分51.3%,位列第一,明顯領先GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5等模型。

Argon的多模態能力也被用於長視訊和專業圖表分析。在評估長視訊理解能力的LVBench中,該模型得分91.7%,達到現有模型最優水平。

02. 深入Google內部工作流,完成量子演算法最佳化與大規模程式碼遷移

在Google內部,數千名員工已將Gemini 4 Argon用於日常偵錯、演算法設計、研究和大規模程式碼遷移等工作。

Google舉例稱,Argon曾幫助量子計算研究人員最佳化量子演算法的時空資源,在數分鐘內將一項公開基線結果提升40%。另外,一組Argon Agent分析了覆蓋Google整個伺服器叢集的性能分析遙測資料,自主識別並實施資料中心記憶體最佳化方案。相關方案部署後,可釋放超過300TiB記憶體,預計總節省量將達到500TiB至1PiB。

Argon Agent還參與了Google內部C/C++程式碼向Rust的遷移,覆蓋數萬行的核心庫程式碼,以及超過80萬行的Fuchsia Zircon核心。考慮到相關系統的重要性,Google稱,所有大規模重寫都必須經過自動化和人工審計、模擬測試及程式碼審查,確認安全後才能部署到生產環境。

以開源視訊解碼器libgav1為例,Argon Agent通過多輪性能分析和實驗,重寫了約3.2萬行SIMD程式碼,使編譯器能夠自動完成向量化。遷移後的Rust版本在保持視訊輸出完全一致的情況下,運行速度達到原Rust版本的2.7倍,性能進一步接近經過最佳化的C++版本。

03. 強化網路安全能力,可自主發現和修復漏洞

Google還針對網路安全防禦能力對Gemini 4 Argon進行了專項訓練。Argon可以自主發現、驗證並修復軟體漏洞。對於經過信任認證的網路安全防禦團隊和Google內部團隊,Google將提供不帶網路安全護欄的Argon版本,以便其發揮完整的漏洞分析和防禦能力。

網路安全公司Wiz已通過“Scan for Good”項目使用Argon,為關鍵公共基礎設施免費發現和修復高風險暴露。Google稱,在一次早期測試中,Argon發現了一個影響全球醫院所使用醫療軟體的嚴重漏洞,該漏洞可能導致敏感個人資訊暴露,且此前的前沿模型沒有識別出這一風險。

在評估漏洞修復能力的CWE-bench v1中,Argon以68%的成績並列第一,得分與Grok 4.7和GPT-6 Astra相當。

Google內部的綜合漏洞基準測試顯示,Argon可以在覆蓋20種程式語言的複雜程式碼庫中發現多類安全暴露。在Wiz的黑盒滲透測試中,Argon在識別真實網站攻擊面、發現漏洞以及生成概念驗證方面,也超過了此前的Gemini 3.8 Flash Cyber。

04. 擴大安全測試,重點防範模型濫用與提示注入

在正式擴大開放前,Google將繼續強化四類前沿安全能力。

防範濫用方面,Argon會拒絕可能用於網路攻擊以及化學、生物、放射性和核武器攻擊的有害請求,同時保留合法的雙重用途科學研究能力。Google還在加強對模型內部啟動狀態的監測,以識別潛在的濫用行為。

Argon在防禦間接提示注入方面也取得進展。此類攻擊會通過惡意指令或外部上下文劫持模型行為。經過自動化紅隊測試和對抗訓練後,Argon在Gray Swan的間接提示注入測試中取得領先成績。

監測目標偏離方面,為防止Argon在執行任務時越過邊界、採取超出使用者意圖的行動,Google部署了目標偏離緩解機制,對Argon的思維鏈和行為進行監測,並在必要時停止執行。Google還使用類似系統監測模型訓練過程,並在發現異常時向專門的事件響應團隊發出警報。

強化系統環境方面,隨著前沿模型的能力不斷增強,安全測試也需要與模型能力相匹配的安全環境。按照Agent控制路線圖,Google將在高風險訓練或評估開始前,對沙盒環境進行隔離和封閉,以進一步強化安全性。

05. 結語:瞄準複雜Agent任務,實際效果仍待驗證

Gemini 4 Argon在長週期軟體工程、金融和法律Agent任務、長視訊理解及網路安全防禦等測試中取得多項領先成績,100萬Token輸出上限也增強了其處理大型程式碼庫和複雜工作流的能力。

不過,當前多數成績仍來自Google披露的內部案例和基準測試,模型尚未全面開放。Argon在真實使用中的穩定性、呼叫成本、漏洞修復可靠性及安全邊界,仍需等待開發者和企業使用者進一步驗證。 (智東西)