Gemini 4終於來了!首款模型Argon發佈,18項評測領先12項,優先開放給網路安全團隊

美股艾大叔
•
AI速讀
Google 發佈旗艦模型 Gemini 4 Argon,旨在搶回 AI 前沿競爭主導權。Argon 顯著提升輸出上限至 100 萬 token,強化了長鏈條推理能力,並在 18 項評測中領先 12 項。模型優先開放給網路安全團隊,展現其在漏洞發現與修復的強大能力。定價採取競爭策略,初期價格低於 GPT-6 Astra。此次發佈顯示 Google 的戰略重心已從單純的聊天體驗轉向深耕軟體工程與受監管的專業知識工作,試圖將 AI 能力直接轉化為企業端的生產力。

Gemini 4 終於來了,但是目前大多數使用者還無法使用。

當地時間 9 月 30 日,Google 正式發佈 Gemini 4 Argon。這是 Gemini 4 系列推出的首款旗艦模型,也是 Google 經過長時間研發後,首次對外推出這一代模型。

Gemini 的上一代旗艦模型 Gemini 3 系列還要追溯到 2025 年 11 月。此後,Google 主要更新的是 Flash 系列,因此,這次 Argon 的發佈也成為 Google 幾個月來在旗艦模型上的一次明確回應。

不過,Argon 暫時沒有進入普通使用者的 Gemini 介面。Google 首先將它開放給一批受信任的網路安全防禦機構,通過受控早期訪問項目 Fairwind 進行測試和使用。按照 Google 的說法,只有在安全護欄進一步完善後,Argon 才會逐步向開發者、企業和普通消費者開放。

Google 將 Argon 定位為面向複雜、長流程工作流的旗艦模型,重點覆蓋軟體工程、法律和金融等企業知識工作,以及網路安全防禦。

相比上一代模型,Argon 的單次輸出上限從 6.4 萬 token 提升至 100 萬 token。這意味著模型可以在一次任務中持續生成更長的推理和執行軌跡,在更少依賴人工中途接管的情況下,處理跨越多個步驟的複雜問題。對於需要持續分析、反覆驗證和長鏈條執行的任務,這種更長的輸出空間也給模型留下了更大的推理余量。

目前,Google 已經在內部大規模使用 Argon。數千名員工正在利用它完成專項程式設計、深度研究和寫作等任務。

在量子計算團隊的一項測試中,研究人員此前遇到了一類時空資源開銷較高的子程序。Google 使用 qubits 與 gates 的乘積衡量相關計算成本,Argon 在數分鐘內找到了一種新的最佳化方案,相比此前公開發表的基線結果提升了 40%。

另一組 Argon 智能體則被用於分析 Google 資料中心叢集的性能遙測資料,並自動識別和執行記憶體最佳化操作。Google 表示,相關方案全部部署後,已經能夠釋放超過 300 TiB 記憶體,預計最終可節省 500 TiB 至 1 PiB。

Argon 還被用於 Google 內部的大規模 C/C++ 向 Rust 遷移工作,覆蓋了 re2、libgav1 等核心開源庫,以及 Fuchsia Zircon 核心,涉及超過 80 萬行程式碼。

其中一個較為具體的案例是 Google 的開源視訊解碼器 libgav1。Argon 智能體接手了一個已經存在的 Rust 移植版本,通過多輪性能分析、實驗以及對編譯器輸出的研究,使用安全 Rust 重寫了約 3.2 萬行 SIMD 程式碼。最終版本在保持視訊輸出完全一致的情況下,相比此前的 Rust 移植版本提速 2.7 倍,性能接近經過最佳化的 C++ 實現,同時獲得了 Rust 帶來的記憶體安全優勢。

除了編碼,Argon 在多項企業任務評測中也取得了較高成績。

在衡量真實長流程軟體工程任務的 DeepSWE v1.1 上,Argon 得分為 77.9%。在 Vals Index 上,它同樣處於領先位置。該指數覆蓋金融、程式設計、法律和稅務等知識工作,並按照各領域對美國 GDP 的貢獻進行加權。

在評估多步驟金融研究能力的 Vals Finance Agent v2 上,Argon 也保持領先。在 Harvey 的法律智能體基準中,Argon 得分為 19.6%,相比之下,GPT-6 Astra 為 5.4%,Claude Opus 5.5 為 3.8%。

在 Zapier 的 AutomationBench 上,Argon 得分為 51.3%,Claude Opus 5.5 為 42.5%,GPT-6 Astra 為 41.4%。這一基準主要衡量模型能否端到端完成核心業務流程。在長視訊理解基準 LVBench 上,Argon 得分為 91.7%。

按照 Google 公佈的對比結果,在 18 項評測中,Argon 單獨領先 12 項,另有 1 項並列第一;GPT-6 Astra 單獨領先 3 項、並列領先 1 項;Claude Opus 5.5 單獨領先 2 項。

從領先項目數量來看,Argon 的覆蓋面最廣,但它並不是在所有任務上都佔據優勢。例如,在 FrontierSWE v2 和 Terminal-Bench Science 0.1 上,Argon 分別落後 GPT-6 Astra 10.5 個百分點;在 Terminal-Bench 4.0 上,則落後 Claude Opus 5.5 9 個百分點。

這也意味著,當前前沿模型之間的競爭仍然非常接近。Argon 更明顯的特點,不是某一項能力形成絕對領先,而是在軟體工程、企業知識工作、自動化和多模態理解等多個方向上同時保持較強表現。

(來源:Google)

網路安全是 Argon 重點強化的方向之一。Google 表示,Argon 已經能夠自主完成漏洞發現、驗證和修復。對於經過稽核的網路安全防禦機構以及 Google 內部團隊,Google 還會提供不受部分網路安全護欄限制的版本,使其能夠呼叫模型更完整的安全防禦能力。

Google 旗下雲與 AI 安全平台 Wiz 已經開始將 Argon 用於 Scan for Good 項目。該項目主要面向關鍵公共基礎設施提供免費的安全掃描。在早期演示中,Argon 發現了一個此前其他前沿模型未能識別的嚴重漏洞,涉及全球多家醫院使用的一款醫療軟體。

在衡量模型漏洞修復能力的 CWE-bench v1 上,Argon 以 68% 的成績並列第一。此前,Google 的 3.8 Flash Cyber 也曾在 CWE-bench v0 上取得領先成績。

相比 3.8 Flash Cyber,Google 稱 Argon 在漏洞發現能力上有了進一步提升。在 Google 內部的一項綜合漏洞基準中,Argon 對覆蓋 20 種程式語言的複雜程式碼庫進行分析,並識別出多類安全暴露問題。

在 Wiz 內部的黑盒滲透測試基準上,Argon 的表現也超過了 3.8 Flash Cyber。所謂黑盒測試,是指模型無法直接獲得目標系統原始碼,只能像真實攻擊者一樣從外部分析正在運行的網路系統。在這項測試中,Argon 在攻擊面發現、漏洞識別以及概念驗證生成等環節均取得了更好的結果。

價格方面,Google 為 Argon 設定了早期使用價格:每百萬輸入 token 為 2 美元,每百萬輸出 token 為 10 美元,快取輸入可享受 95% 的價格折扣。

作為對比,OpenAI GPT-6 Astra 的公開價格為每百萬輸入 token 10 美元、輸出 token 50 美元;Anthropic Claude Opus 5.5 則分別為 4 美元和 20 美元。

早期優惠結束後,Argon 的價格將調整為每百萬輸入 token 4 美元、輸出 token 20 美元,與 Claude Opus 5.5 的公開價格持平,仍低於 GPT-6 Astra。

與此同時,Google 也將安全能力列為 Argon 大規模開放之前的重點工作。Google 表示,將從四個方向繼續加強模型護欄,核心目標是在限制惡意使用的同時,儘量保留網路安全、科學研究等合法雙用途場景中的模型能力。

(來源:Google)

為了避免 Argon 在執行複雜任務時超出使用者意圖,Google 還部署了一套執行階段緩解機制,對模型的思維鏈和實際動作進行監控,並在必要時中止任務執行。

Google 表示,類似的監控機制也被用於模型訓練過程。一旦系統檢測到異常行為,會向專門的事件響應團隊傳送警報。同時,Google 會儘量避免將這類監控結果直接反饋進訓練過程,以降低模型逐漸學會規避監控機制的風險。

這也是 Google 選擇分階段開放 Argon 的原因之一。目前,Google 正在參與美國政府有關前沿模型發佈前訪問的自願機制,並同步擴大 Argon 的早期使用範圍。

按照 Google 的計畫,Argon 後續將逐步向開發者、企業和消費者開放,首批更廣泛獲得存取權的使用者將包括付費 API 客戶和 Google AI Ultra 訂閱者。

從時間點來看,Argon 的發佈也頗為關鍵。

自 2025 年 11 月推出 Gemini 3 系列以來,Google 一直沒有更新旗艦模型,其間主要圍繞 Flash 系列進行迭代。與此同時,OpenAI 和 Anthropic 已經繼續推出 GPT-6 和新一代 Claude 模型。外界因此一直在關注,Google 何時會再次拿出一款面向前沿能力競爭的旗艦產品。

此前,Google DeepMind 新任負責人 Koray Kavukcuoglu 曾透露,Gemini 4 正在進行最後階段的完善,並可能在年底前推出。

這段時間,Google 的 AI 組織本身也經歷了較大調整。2026 年 8 月,Demis Hassabis 卸任 Google DeepMind CEO,轉任 Alphabet 董事長兼首席科學家;Jeff Dean 離開首席科學家崗位創業;Kavukcuoglu 則接任 DeepMind 最高負責人,並直接向 Sundar Pichai 匯報。

Google 並沒有將這些組織變化與旗艦模型發佈時間聯絡起來。不過,此前一些外部報導曾提到,Google AI 團隊同時面臨人才流動、模型發佈時間調整以及內部路線討論等問題,其中一個核心分歧,是如何在基礎科學研究、前沿模型能力與商業產品之間分配資源。

因此,Argon 的發佈至少給出了 Google 當前的一種答案。

一方面,它在多項與企業實際部署相關的基準測試中取得領先或並列領先成績;另一方面,Google 沒有選擇直接面向所有使用者全面開放,而是首先從網路安全防禦場景切入,在擴大模型使用範圍的同時,繼續推進安全評估和發佈前訪問流程。

接下來更實際的問題,將轉向商業化。

對於企業使用者而言,除了基準成績之外,真正影響採用的還包括正式定價、速率限制、資料治理政策、部署方式,以及 Argon 最終如何進入 Gemini API、Vertex AI、Google Cloud、Workspace 和各類開發者工具。

Google 擁有雲服務、辦公軟體和開發者生態等分發優勢,但這些優勢最終能否轉化為 Argon 的競爭力,仍取決於模型在真實生產環境中的穩定性、可控性和成本表現。

至少從目前披露的資訊來看,Gemini 4 Argon 展現出的方向已經比較明確:相比強調消費級聊天體驗,Google 更希望首先證明,旗艦模型能否在軟體工程、網路安全和受監管的知識工作中,持續執行複雜任務。

基準測試已經給出了第一批答案。至於這些紙面優勢能否轉化成真實工作流中的穩定表現,還要等 Argon 進入更多企業和開發者手中之後才能判斷。(DeepTech深科技)