Google又回來了!
就在剛剛,Google正式發佈了新一代前沿AI模型——Gemini 4 Argon。
沉寂了半年多,被GPT-6和Claude 5按在地上摩擦後,這次Google直接掀翻了牌桌!
Gemini 4 Argon,是Google 7 個月來首款非 Flash 級專有模型。
在文字競技場(Text Arena)中,剛剛發佈的Gemini 4 Argon排名第一,得分1533碾壓Opus 5.5。
在權威的Artificial Analysis智能指數上,Gemini 4 Argon斬獲53分,直接追平GPT-6 Astra,領先GPT-6.1 Sol。
在成本上,Google祭出了喪心病狂的「骨折價」:單任務成本僅需1.99美元,只有GPT-6 Astra的60%!直接處於帕累托前沿。
在能力上,它史無前例地將單次輸出上限拉升至100萬Token,甚至在Google內部直接用安全語言重寫了80萬行底層系統核心程式碼。
在Vals RSI指數上, Gemini超過 GPT-6 Astra,超過了30%!
目前,該模型只開放給 Google Fairwind 計畫裡的一批網路安全防禦方,之後會開放給給付費 API 使用者和 AI Ultra 訂閱者。
一位GoogleDeepMind研究員在X上疑似玩梗:RSI來了,沒什麼可教它的,是時候去追逐我的咖啡師夢想了。不過隨後又秒刪。
不過,至少有一點可以確定:Google又回來了。
畢竟,Argon只是Gemini 4的入門款。
01. Google掀起價格戰:1.99美元,直接背刺GPT-6
這次,Google的定價堪稱驚人。
百萬輸入 Token: 2美元
百萬輸出 Token: 10美元
快取輸入折扣: 喪心病狂的 95% off(0.5折!)
這是什麼概念?我們來看看 Artificial Analysis 統計的「每項智能指數任務」的綜合成本。
GPT-6.1 Sol: 0.72 美元
Gemini 4 Argon: 1.99 美元
GPT-6 Astra: 3.26 美元
Claude Opus 5.5: 5.98 美元
Claude Fable 5.1: 7.63 美元
在智力水平與 GPT-6 Astra 完全持平的情況下,Argon 的成本只有 Astra 的 60%!
雖然它不是絕對價格最便宜的,但在「前沿頂級智力」這個檔位,Argon 的性價比無敵了。
顯然,Google此舉意圖明顯:利用自身龐大的TPU算力叢集優勢,打一場不對稱的價格戰,逼迫OpenAI和Anthropic降價,放血競爭對手的利潤空間。
02. 1M 上下文輸出限制:從「讀完一本書」到「寫完一本書」
另一個大招,就是大幅擴展了模型token上線,從以前的64K token 提升到 1M token。
Argon將輸出上限直接拉升至100萬Token,這就意味著模型擁有了前所未有的「思考余量」。
用Google的話說,當模型擁有足夠的空間進行深度思考,並在單次運行中生成數十萬 token 時,它就能在推理中達到新的深度層次,一次性解決棘手問題。
現在,AI在完成複雜推理時,再也不會說到一半斷氣了。
這種深度的連續推理能力,直接讓Argon在各大基準測試中「屠榜」。
DeepSWE v1.1(真實長程軟體工程能力): 取得 77.9% 的 SOTA 成績。
Vals Index(衡量金融、程式設計、法律綜合經濟價值): 位列第一(68.9%)。
AutomationBench(Zapier評估的企業端到端執行能力): 以 51.3% 拿下頭名。
LVBench(多模態長視訊理解): 拿到 91.7% 的超高分。
Blueprint-Bench 2(3D理解):位列第一
03. 內部實戰曝光:Argon在Google干下的三件大事
說起來,Google這個模型為什麼叫「Argon」?
Argon,化學元素氬,是一種惰性氣體。古希臘語中,ἀργόν (argos) 的意思是「懶惰的」。
與「氬」同族的化學元素「氖」,此前被 OpenAI 原後訓練研究副總裁發佈了同名模型「Periodic Neon」
這次,Gemini 4打破了以往「Pro / Flash / Ultra」的傳統後綴。
據悉,在正式發佈前,「Argon」其實只是Google內部開發的一個代號,外界曾一度猜測它就是Gemini 4 Pro。
Gemini 4 Argon和當時爆料的「Gemini 4 Pro」主要區別就是輸出上限不一樣。
結果發佈時,Google直接把這個代號「轉正」了。總之目前還沒有官方解釋。
據報導,在全面發佈之前,數千名Google員工已經將Argon深度接入了日常研發,而且它干下了三件驚人的大事。
第一件,就是狂省300 TiB記憶體,幫Google省下天價電費。
由Argon組成的智能體團隊,自主分析了Google全網海量的性能分析遙測資料,敏銳地抓住了記憶體最佳化的空間,並自主提交了修改建議。
這些程式碼上線後,直接為Google釋放了超過300 TiB的寶貴記憶體!
不僅如此,預計後續總節省量可達500 TiB到1 PiB。在Google的體量下,這背後節約的是以千萬美元計的電費和伺服器採購成本。
第二件,就是重寫了80萬行系統核心程式碼。
搞開發的都知道,重構C/C++核心程式碼,稍微漏掉一個指針,或者搞錯一個記憶體分配,整個系統就會瞬間崩潰。
但Argon正在主導一項浩大的工程:將Google底層的C/C++程式碼遷移到以「記憶體安全」著稱的Rust語言。
目前,這個AI經手的核心程式碼規模已經超過了80萬行(包括Fuchsia Zircon核心)。
當然,這些重構在部署前進行了嚴格的自動化審計和人工審查。但讓AI觸碰80萬行核心,這簡直是人類向AI下放自主權的里程碑級大事。
第三件,就是手撕3.2萬行SIMD底層指令,視訊解碼飆升2.7倍。
這是最硬核的一個案例。Google的開源視訊解碼項目libgav1里,有一段3.2萬行的SIMD程式碼,人類程式設計師寫起來都極其痛苦。
Argon智能體通過多輪編譯實驗、研究編譯器輸出,直接用安全的Rust語言重寫了這3.2萬行程式碼!
結果是:新版本的運行速度比原Rust移植版本快了整整2.7倍,性能直接持平高度最佳化的C++版本,而且輸出的視訊畫面每一幀都一模一樣,完美替代!
kimmonismus評價說:「這些都是在Google已經營運的基礎設施裡、成本極高的工程活。這次發佈,可能比大家以為的要重要得多!」
04. 網安界「天網」來了:無護欄版本首度曝光
而且, Argon 在網路安全防禦上能力也很恐怖。它已經是一個能「自主發現、驗證、生成PoC、並修補高危漏洞」的全自動白帽駭客。
在 CWE-bench v1(漏洞修復能力評估)上,Argon以 68% 的得分並列行業第一。
更震撼的是實戰。雲安全巨頭 Wiz 已經在其「Scan for Good」項目中接入了 Argon。
在一次早期演示中,Argon 成功挖出了全球多家醫院正在使用的醫療軟體中的重大關鍵漏洞,這個漏洞隱藏之深,連此前的幾代前沿模型都完全漏掉了。
因為深知這把雙刃劍的威力,Google採取了極其謹慎的「分層釋放策略」。
1.無護欄特供版(No-guardrail): 僅通過 Fairwind 計畫,向部分受信任的網路防禦機構(如Wiz)和Google內部團隊開放。
2.受限API版: 積極參與美國政府的自願發佈前審查。
3.公眾版: 後續才逐步推送給付費 API 開發者和 Google AI Ultra 訂閱使用者。
在全面開放前,Google甚至部署了極端的「系統加固」——在高風險訓練前將沙箱環境徹底物理級密封隔離;並且即時監控模型的思維鏈,一旦發現模型企圖偏離使用者意圖,系統會立刻「拔網線」。
Google特意說明:這些監控資料絕對不會反饋到訓練集中,以防止模型「學精了」從而偽裝思維來逃避監管。
05. 研發內幕大揭秘:Google的「至暗時刻」
這次發佈背後,其實掩藏著GoogleAI部門長達幾個月的焦慮。
據彭博社報導,Argon的誕生可謂是「踩著屍體上位」。
首先,5月I/O大會上承諾的Gemini 3.5 Pro夭折了。
本來,Google說的是6月發佈,但直接難產了,這種等級的模型訓練,單次成本高達4億美元!
再加上頂級AI研究員的天價薪資,這波取消讓Google付出了慘痛代價。
而且,據爆料,雖然 Argon 跑分無敵,但在Google內部,其實存在強烈的懷疑情緒。
有能夠直接接觸內部評估的員工爆料:Argon 的程式設計能力「參差不齊」。它在處理前端設計時表現掙扎。
AI專家 Edwin Chen 更是直言不諱地指出了行業的通病——「Benchmaxxing」(刷榜綜合症)。
工程師們為了讓模型在基準測試中拿高分,瘋狂讓模型適應特定語言的程式碼題,卻忽略了讓模型開發出「真正好用、設計精良的應用」。
據報導,有Google員工認為內部存在「廣泛共識」——Gemini 4處於前沿水平,而且否認新模型在實際程式設計任務中表現不佳。
另外,就是人才流失與高層大洗牌。
在這幾個月的陣痛期,Google流失了大量明星研究員。前有Jeff Dean的淡出,後有諾獎得主 John Jumper 以及核心發明人 Noam Shazeer 的離去。
今年8月,Demis Hassabis 更是升任董事長,將 DeepMind 經營權交給了副手 Koray Kavukcuoglu。
面對內部質疑,Kavukcuoglu 在上周發聲穩住軍心:「我向團隊致以最高的信任。在我看來,我們永遠都會處於最前沿是一件確定的事。」
Google太需要 Argon 的成功了。
因為 Gemini 模型支撐著Google從搜尋到 Maps、Gmail 的整個帝國,一旦模型掉隊,這些擁有超10億使用者的入口級產品,隨時可能被 OpenAI 和 Anthropic 蠶食。
06. AI三強格局大洗牌:終局遠未到來
在 Argon 發佈之前,長達7個月的時間裡,Google一直處於非常被動挨打的局面。
Gemini 4 Argon 的發佈,也並沒有徹底打垮對手,但它成功地將Google重新拉回了牌桌,形成了三強格局鼎立格局。
1.Google(Gemini 4 Argon): 強勢回歸頂尖實驗室行列。在企業知識工作、超長上下文處理(1M輸出)、網路安全以及多模態上確立了護城河。
2.OpenAI(GPT-6 Astra): 依然是行業的標竿,在科學、數學終端任務和 Agentic Coding上處於領先。
3.Anthropic(Claude 系列): 還是程式設計師的心頭好。在最新的 Terminal-Bench 4.0 等硬核程式設計智能體任務上,Claude Fable 5.1 依然領先。
總而言之,當前的格局是:沒有絕對的霸主,只有一時的交替領先。
不過,Argon 1.99美元的價格屠刀,確實在競家的基本盤上撕開了一道口子。
AGI最後一站RSI開始了。
(新智元)
