Gemini 4震撼發佈,已實現RSI?Google80萬行核心已被重寫

RexAA
•
AI速讀
Google 推出 Gemini 4 Argon 模型,以極高性價比與強大推理能力回擊競爭對手。該模型在文字競技場排名第一,且單任務成本僅 1.99 美元,意圖利用算力優勢壓縮 OpenAI 與 Anthropic 的利潤空間。技術面突破顯著,包含 100 萬 Token 的輸出上限,以及在實務中協助 Google 重寫 80 萬行系統核心程式碼並節省數百 TiB 記憶體。儘管內部面臨人才流失與「刷榜」質疑,但 Argon 的發佈使 Google 重新回歸 AI 三強格局,在企業級應用與網安防禦領域建立深厚護城河。
Google又回來了!

就在剛剛,Google正式發佈了新一代前沿AI模型——Gemini 4 Argon。

沉寂了半年多,被GPT-6和Claude 5按在地上摩擦後,這次Google直接掀翻了牌桌!

Gemini 4 Argon,是Google 7 個月來首款非 Flash 級專有模型。

在文字競技場(Text  Arena)中,剛剛發佈的Gemini  4 Argon排名第一,得分1533碾壓Opus 5.5。

在權威的Artificial Analysis智能指數上,Gemini 4 Argon斬獲53分,直接追平GPT-6 Astra,領先GPT-6.1 Sol。

在成本上,Google祭出了喪心病狂的「骨折價」:單任務成本僅需1.99美元,只有GPT-6 Astra的60%!直接處於帕累托前沿。

在能力上,它史無前例地將單次輸出上限拉升至100萬Token,甚至在Google內部直接用安全語言重寫了80萬行底層系統核心程式碼。

在Vals RSI指數上, Gemini超過 GPT-6 Astra,超過了30%!

目前,該模型只開放給 Google Fairwind 計畫裡的一批網路安全防禦方,之後會開放給給付費 API 使用者和 AI Ultra 訂閱者。

一位GoogleDeepMind研究員在X上疑似玩梗:RSI來了,沒什麼可教它的,是時候去追逐我的咖啡師夢想了。不過隨後又秒刪。

不過,至少有一點可以確定:Google又回來了。

畢竟,Argon只是Gemini 4的入門款。

01. Google掀起價格戰:1.99美元,直接背刺GPT-6

這次,Google的定價堪稱驚人。

百萬輸入 Token: 2美元

百萬輸出 Token: 10美元

快取輸入折扣: 喪心病狂的 95% off(0.5折!)

這是什麼概念?我們來看看 Artificial Analysis 統計的「每項智能指數任務」的綜合成本。

GPT-6.1 Sol: 0.72 美元

Gemini 4 Argon: 1.99 美元

GPT-6 Astra: 3.26 美元

Claude Opus 5.5: 5.98 美元

Claude Fable 5.1: 7.63 美元

在智力水平與 GPT-6 Astra 完全持平的情況下,Argon 的成本只有 Astra 的 60%!

雖然它不是絕對價格最便宜的,但在「前沿頂級智力」這個檔位,Argon 的性價比無敵了。

顯然,Google此舉意圖明顯:利用自身龐大的TPU算力叢集優勢,打一場不對稱的價格戰,逼迫OpenAI和Anthropic降價,放血競爭對手的利潤空間。

02. 1M 上下文輸出限制:從「讀完一本書」到「寫完一本書」

另一個大招,就是大幅擴展了模型token上線,從以前的64K token 提升到 1M token。

Argon將輸出上限直接拉升至100萬Token,這就意味著模型擁有了前所未有的「思考余量」。

用Google的話說,當模型擁有足夠的空間進行深度思考,並在單次運行中生成數十萬 token 時,它就能在推理中達到新的深度層次,一次性解決棘手問題。

現在,AI在完成複雜推理時,再也不會說到一半斷氣了。

這種深度的連續推理能力,直接讓Argon在各大基準測試中「屠榜」。

DeepSWE v1.1(真實長程軟體工程能力): 取得 77.9% 的 SOTA 成績。

Vals Index(衡量金融、程式設計、法律綜合經濟價值): 位列第一(68.9%)。

AutomationBench(Zapier評估的企業端到端執行能力): 以 51.3% 拿下頭名。

LVBench(多模態長視訊理解): 拿到 91.7% 的超高分。

Blueprint-Bench 2(3D理解):位列第一

03. 內部實戰曝光:Argon在Google干下的三件大事

說起來,Google這個模型為什麼叫「Argon」?

Argon,化學元素氬,是一種惰性氣體。古希臘語中,ἀργόν (argos) 的意思是「懶惰的」。

與「氬」同族的化學元素「氖」,此前被 OpenAI 原後訓練研究副總裁發佈了同名模型「Periodic Neon」

這次,Gemini 4打破了以往「Pro / Flash / Ultra」的傳統後綴。

據悉,在正式發佈前,「Argon」其實只是Google內部開發的一個代號,外界曾一度猜測它就是Gemini 4 Pro。

Gemini 4 Argon和當時爆料的「Gemini 4 Pro」主要區別就是輸出上限不一樣。

結果發佈時,Google直接把這個代號「轉正」了。總之目前還沒有官方解釋。

據報導,在全面發佈之前,數千名Google員工已經將Argon深度接入了日常研發,而且它干下了三件驚人的大事。

第一件,就是狂省300 TiB記憶體,幫Google省下天價電費。

由Argon組成的智能體團隊,自主分析了Google全網海量的性能分析遙測資料,敏銳地抓住了記憶體最佳化的空間,並自主提交了修改建議。

這些程式碼上線後,直接為Google釋放了超過300 TiB的寶貴記憶體!

不僅如此,預計後續總節省量可達500 TiB到1 PiB。在Google的體量下,這背後節約的是以千萬美元計的電費和伺服器採購成本。

第二件,就是重寫了80萬行系統核心程式碼。

搞開發的都知道,重構C/C++核心程式碼,稍微漏掉一個指針,或者搞錯一個記憶體分配,整個系統就會瞬間崩潰。

但Argon正在主導一項浩大的工程:將Google底層的C/C++程式碼遷移到以「記憶體安全」著稱的Rust語言。

目前,這個AI經手的核心程式碼規模已經超過了80萬行(包括Fuchsia Zircon核心)。

當然,這些重構在部署前進行了嚴格的自動化審計和人工審查。但讓AI觸碰80萬行核心,這簡直是人類向AI下放自主權的里程碑級大事。

第三件,就是手撕3.2萬行SIMD底層指令,視訊解碼飆升2.7倍。

這是最硬核的一個案例。Google的開源視訊解碼項目libgav1里,有一段3.2萬行的SIMD程式碼,人類程式設計師寫起來都極其痛苦。

Argon智能體通過多輪編譯實驗、研究編譯器輸出,直接用安全的Rust語言重寫了這3.2萬行程式碼!

結果是:新版本的運行速度比原Rust移植版本快了整整2.7倍,性能直接持平高度最佳化的C++版本,而且輸出的視訊畫面每一幀都一模一樣,完美替代!

kimmonismus評價說:「這些都是在Google已經營運的基礎設施裡、成本極高的工程活。這次發佈,可能比大家以為的要重要得多!」

04. 網安界「天網」來了:無護欄版本首度曝光

而且, Argon 在網路安全防禦上能力也很恐怖。它已經是一個能「自主發現、驗證、生成PoC、並修補高危漏洞」的全自動白帽駭客。

在 CWE-bench v1(漏洞修復能力評估)上,Argon以 68% 的得分並列行業第一。

更震撼的是實戰。雲安全巨頭 Wiz 已經在其「Scan for Good」項目中接入了 Argon。

在一次早期演示中,Argon 成功挖出了全球多家醫院正在使用的醫療軟體中的重大關鍵漏洞,這個漏洞隱藏之深,連此前的幾代前沿模型都完全漏掉了。

因為深知這把雙刃劍的威力,Google採取了極其謹慎的「分層釋放策略」。

1.無護欄特供版(No-guardrail): 僅通過 Fairwind 計畫,向部分受信任的網路防禦機構(如Wiz)和Google內部團隊開放。

2.受限API版: 積極參與美國政府的自願發佈前審查。

3.公眾版: 後續才逐步推送給付費 API 開發者和 Google AI Ultra 訂閱使用者。

在全面開放前,Google甚至部署了極端的「系統加固」——在高風險訓練前將沙箱環境徹底物理級密封隔離;並且即時監控模型的思維鏈,一旦發現模型企圖偏離使用者意圖,系統會立刻「拔網線」。

Google特意說明:這些監控資料絕對不會反饋到訓練集中,以防止模型「學精了」從而偽裝思維來逃避監管。

05. 研發內幕大揭秘:Google的「至暗時刻」

這次發佈背後,其實掩藏著GoogleAI部門長達幾個月的焦慮。

據彭博社報導,Argon的誕生可謂是「踩著屍體上位」。

首先,5月I/O大會上承諾的Gemini 3.5 Pro夭折了。

本來,Google說的是6月發佈,但直接難產了,這種等級的模型訓練,單次成本高達4億美元!

再加上頂級AI研究員的天價薪資,這波取消讓Google付出了慘痛代價。

而且,據爆料,雖然 Argon 跑分無敵,但在Google內部,其實存在強烈的懷疑情緒。

有能夠直接接觸內部評估的員工爆料:Argon 的程式設計能力「參差不齊」。它在處理前端設計時表現掙扎。

AI專家 Edwin Chen 更是直言不諱地指出了行業的通病——「Benchmaxxing」(刷榜綜合症)。

工程師們為了讓模型在基準測試中拿高分,瘋狂讓模型適應特定語言的程式碼題,卻忽略了讓模型開發出「真正好用、設計精良的應用」。

據報導,有Google員工認為內部存在「廣泛共識」——Gemini 4處於前沿水平,而且否認新模型在實際程式設計任務中表現不佳。

另外,就是人才流失與高層大洗牌。

在這幾個月的陣痛期,Google流失了大量明星研究員。前有Jeff Dean的淡出,後有諾獎得主 John Jumper 以及核心發明人 Noam Shazeer 的離去。

今年8月,Demis Hassabis 更是升任董事長,將 DeepMind 經營權交給了副手 Koray Kavukcuoglu。

面對內部質疑,Kavukcuoglu 在上周發聲穩住軍心:「我向團隊致以最高的信任。在我看來,我們永遠都會處於最前沿是一件確定的事。」

Google太需要 Argon 的成功了。

因為 Gemini 模型支撐著Google從搜尋到 Maps、Gmail 的整個帝國,一旦模型掉隊,這些擁有超10億使用者的入口級產品,隨時可能被 OpenAI 和 Anthropic 蠶食。

06. AI三強格局大洗牌:終局遠未到來

在 Argon 發佈之前,長達7個月的時間裡,Google一直處於非常被動挨打的局面。

Gemini 4 Argon 的發佈,也並沒有徹底打垮對手,但它成功地將Google重新拉回了牌桌,形成了三強格局鼎立格局。

1.Google(Gemini 4 Argon): 強勢回歸頂尖實驗室行列。在企業知識工作、超長上下文處理(1M輸出)、網路安全以及多模態上確立了護城河。

2.OpenAI(GPT-6 Astra): 依然是行業的標竿,在科學、數學終端任務和 Agentic Coding上處於領先。

3.Anthropic(Claude 系列): 還是程式設計師的心頭好。在最新的 Terminal-Bench 4.0 等硬核程式設計智能體任務上,Claude Fable 5.1 依然領先。

總而言之,當前的格局是:沒有絕對的霸主,只有一時的交替領先。

不過,Argon 1.99美元的價格屠刀,確實在競家的基本盤上撕開了一道口子。

AGI最後一站RSI開始了。

(新智元)