Google反擊了,Gemini 4 Argon讓人細思極恐

RexAA
•
AI速讀
Google DeepMind 發佈 Gemini 4 Argon,支援100萬Token上下文且在多項基準測試中刷新紀錄。雖然其初始定價具競爭力且在量子計算與資安漏洞檢測中表現卓越,但分析指出其答題精準率低於 GPT-6 Astra,且實際執行能力與基準分數存在差距。目前模型透過「Fairwind計畫」有限開放,後續將擴展至 API 客戶與訂閱者。

沉寂7個月,旗艦換了個名字登場。

台北時間10月1日凌晨,Google DeepMind發佈Gemini 4 Argon,距離該公司上一款非Flash級閉源旗艦發佈已逾7個月。

GoogleCEO桑達爾·皮查伊在X平台宣佈上述消息,並表示公司內部團隊已將其應用於程式設計和量子計算等領域。該模型單次輸出Token上限由此前6.4萬提升至100萬,同時支援100萬Token上下文及多模態輸入。

01.

根據Artificial Analysis智能指數,Aragon得分53分,與GPT-6 Astra、Claude Fable 5.1並列。

目前該模型僅通過“Fairwind計畫”面向部分受信任的網路安全防禦團隊開放,後續將擴展至付費API客戶及Google AI Ultra訂閱者,具體時間表尚未公佈。

發佈初期,API定價為每百萬輸入Token 2美元、每百萬輸出Token 10美元,快取命中的定價在此基礎上進一步降低95%,該優惠的截止日期尚未公佈。

Argon面向長程軟體工程、企業知識工作和網路安全防禦。

據Google發佈材料,在長程軟體工程測試DeepSWE v1.1中,Argon以77.9%刷新紀錄,高於GPT-6 Astra的74.1%;

在覆蓋金融、程式設計、法律和稅務的Vals Index中以68.9%排名第一;Zapier的AutomationBench自動化執行測試以51.3%居首;長視訊理解測試LVBench得91.7%;漏洞修複測試CWE-bench v1以68%與GPT-6 Astra並列第一。

Artificial Analysis的AA-Omniscience測試顯示,Argon幻覺率為15%,是智能指數45分以上模型中最低的。

這意味著在沒有把握時,模型更多選擇承認不知道,而非給出錯誤答案。但同一測試中,Argon的答題精準率僅50%,低於GPT-6 Astra的63%。少編錯的和多答對的,不是一回事。

然而,差距同樣存在。FrontierSWE v2中Argon得55.0%,落後Astra的65.5%;Terminal-Bench 4.0終端操作測試中得57.4%,低於Claude Opus 5.5的66.4%。

這兩項均考查持續執行能力,而此類場景在企業使用中並不少見。彭博社援引Google內部知情人士稱,部分員工認為Argon在編碼等實際任務中的表現與基準分數存在差距。

02.

Argon的初始定價低於主要競品。根據Artificial Analysis評測口徑,折扣期內單任務平均成本約1.99美元,低於GPT-6 Astra的3.26美元和Claude Opus 5.5的5.98美元。

但定價僅是帳單的一部分:Argon完成同類任務平均輸出約6.2萬Token,Astra約2.7萬Token,前者約為後者的2.3倍。

折扣期結束後,輸入價格將升至每百萬Token 4美元、輸出20美元,屆時同口徑單任務成本約3.98美元,約為Astra屆時的1.2倍。1.99美元是折扣期測試場景下的均值,不能直接套用到其他任務類型上。

Google公佈了Argon在內部工程中的若干案例。量子計算方面,Argon被用於最佳化演算法時空資源,Google稱模型在數分鐘內將一項已發表基準結果提升40%。

資料中心方面,一組Argon智能體分析了覆蓋Google全球伺服器叢集的遙測資料,自主識別並實施記憶體最佳化,已釋放超過300 TiB記憶體,預計總節省量可達500 TiB至1 PiB。

在開源視訊解碼器libgav1項目中,智能體重寫約3.2萬行SIMD程式碼,新Rust版本在視訊輸出一致的前提下,運行速度達到原Rust移植版本的2.7倍。

Argon還參與Fuchsia Zircon核心逾80萬行程式碼的Rust遷移,Google明確表示相關工作仍在進行中,大規模重寫須經自動化審計與人工評審後方能部署。

網路安全公司Wiz通過"Scan for Good"計畫呼叫Argon,在早期測試中發現了一處影響全球醫院醫療軟體的漏洞,此前其他前沿模型未能識別該風險。

目前Fairwind計畫之外無法直接呼叫Argon,外部獨立評測暫時無從進行。 (AI硅基未來)