現在的 AI 圈,捲得讓人窒息。
以前 OpenAI 和 Anthropic 神仙打架,大約是每隔 10 個星期發一個新模型。如今這個迭代周期,已經被強行壓縮到了每隔 11 天。
身在局中,半點不由人,Google DeepMind 也不得不加入這場戰局,就在剛剛連夜端出了承載全村希望的 Gemini 4 Argon(氬)。
不過看似發了,但又好像沒發:
Argon 不走全面開放路線,而是通過「Fairwind 計畫」先向一小批可信的網路安全防禦者推出,同時正參與美國政府的自願性發佈前模型准入流程。
後續才會逐步向開發者、企業和消費者開放,首批對像是付費 API 客戶和 Google AI Ultra 訂閱使用者。
Gemini 4 發佈後,鋪天蓋地的宣傳那叫一個意氣風發,大有一舉蕩平 OpenAI 和 Anthropic 的架勢。但與此同時,彭博社爆料稱,Google自家員工對這新模型瘋狂倒苦水,直言其實戰寫程式碼極其拉胯,主打一個「高分低能」。
按官方描述,Argon 是一款在真實軟體工程、金融法律等企業知識工作和網路安全防禦領域擁有前沿性能的殺器。
最核心的升級,在於輸出窗口限制從 6.4 萬 Token 一口氣飆升到行業領先的 100 萬 Token,約等於一口氣吐出 75 萬個單詞,長篇程式碼和深度分析報告中間絕不斷片。
有了這種深層推理的空間,AI 就能一次性搞定極為複雜的長線任務。
首發定價也極具攻擊性:輸入每百萬 Token 2 美元,輸出 10 美元。如果命中快取,輸入端直接打 0.5 折(95% off),堪稱骨折價。
官方聲稱,內部數千名員工已經用它搞定了不少硬核工程,戰報相當華麗:
量子演算法最佳化:幫量子計算研究員最佳化瓶頸子程序的時空資源(量子位元×門),其中一個案例幾分鐘內就比已發表的基線高出 40%;
資料中心省記憶體:一支 Argon 智能體團隊分析了全叢集的遙測資料,自動識別並應用記憶體最佳化,落地後已釋放超 300 TiB 記憶體,預計總節省量在 500 TiB 到 1 PiB 之間;
大規模程式碼遷移:正在把Google的 C/C++程式碼庫遷往更安全的 Rust,規模從 re2、libgav1 等核心庫的數萬行,一直幹到 Fuchsia 作業系統 Zircon 核心的 80 多萬行。
在視訊解碼庫 libgav1 的案例中,Argon 通過多輪性能分析實驗替換了 3.2 萬行 SIMD 程式碼,最終得到一個記憶體安全的解碼器,比現有 Rust 移植版快 2.7 倍,性能逼近手工最佳化的 C++。
基準測試方面,DeepSWE v1.1 真實長線軟體工程基準拿下 77.9% 的新紀錄;
在按美國 GDP 權重衡量經濟價值的 Vals Index 上全面領跑金融、程式設計、法律和稅務;Zapier 的 AutomationBench 端到端業務執行基準以 51.3% 排名第一;長視訊理解基準 LVBench 更是刷到 91.7%。
在網路防禦賽道,新模型更是疊滿了 Buff。
通過與安全公司 Wiz 的「Scan for Good」公益計畫合作,Argon 在全球醫院都在使用的醫療軟體中挖出了一個洩露敏感個人資訊的高危漏洞,這是以往所有前沿模型都沒察覺的。
在漏洞修復評估 CWE-bench v1 上,它以 68% 的得分並列第一。同時,它在 Gray Swan 的間接提示詞注入(IPI)基準上也拿下了行業最高分。
聽起來是不是遙遙領先,Google要一戰封神了?
然而彭博社的報導潑了一盆冷水。多位能直接接觸該項目的知情人士透露,Argon 在各類基準測試上確實大殺四方,可一旦扔進真實的業務程式碼裡就頻頻卡殼,特別是在決定 App 外觀和互動的前端設計上極其拉胯。
有意思的是,這種「分數碾壓、實戰拉胯」的現像在業內早已氾濫成災,甚至有了專屬名詞,Benchmaxxing,簡單點理解就是,客戶愛看分數,工程師就投其所好瘋狂刷榜。
不僅如此,一部分悲觀派員工甚至私下認定,Anthropic 的 Fable 和 OpenAI 的 Astra 進步速度更快,Argon 那怕榨乾潛能也難逃被動局面。當然,也有另一派員工認為,新版本已經追上了頭部實驗室。
熟悉模型開發的核心員工也站出來闢謠,稱內部其實存在廣泛共識,認定 Argon 絕對處於行業最前沿,所謂搞不定複雜程式碼的說法純屬無稽之談。
DeepMind 負責人 Koray Kavukcuoglu 上周的表態也被當成了定心丸:「我對團隊有絕對的信任。在我看來,我們將永遠站在最前沿,這是確定無疑的。」
與此同時,Google發言人硬氣回懟彭博社的報導,稱「Gemini 4 在程式設計等領域表現不佳」的說法完全不精準。
而回頭看Google這一年的操作,其實掉隊的焦慮早就寫在了臉上。
去年 11 月發佈的 Gemini 3 曾被視為Google的翻身之作;結果今年 5 月 I/O 大會上官宣的 Gemini 3.5 Pro 反手就是一個跳票,緊接著便是沉迷 Flash 模型不知天地為何物了。
伴隨戰略搖擺,還有嚴重的人才地震:
傳奇工程師 Jeff Dean、諾獎得主 John Jumper、Transformer 核心作者 Noam Shazeer 相繼離開;長期執掌 AI 研究的 Demis Hassabis 也在 8 月轉任董事長,把 DeepMind 的日常營運交給了老部下 Kavukcuoglu。
歷史反覆證明,帝國的崩塌很少始於城破,更多始於內耗。羅馬不是被蠻族一天攻陷的,諾基亞也不是被 iPhone 一夜擊垮的,它們都是先在無休止的爭論、搖擺和自我安慰中,把先機一吋一吋讓了出去。
平心而論,劈柴哥手裡依然握著讓所有對手眼紅的底牌:
搜尋、地圖、Gmail、Chrome 個個都有超 10 億使用者的基本盤,消費者聊天機器人和搜尋 AI Mode 也雙雙跨過了十億使用者大關。只要生態護城河還在,靠龐大的分發優勢也能強行把技術推向市場。
但問題在於,現在的對手根本不按套路出牌。
無論是 Meta 本月初扔出的智能體 Muse,還是馬斯克 Gork Bot 以及 OpenAI Dots,這些押注 Personal Agent 的 AI 工具也能幫使用者網購、預約日程。
使用者一旦習慣了「吩咐一句就辦完事」,就不會再去搜尋框裡找答案——Google 引以為傲的分發優勢,也就失去了用武之地。
有意思的是, Gemini 4 Argon(氬)中 Argon 這個單詞來自希臘語,本意是「不工作的、懶惰的」。氬氣本身無毒無味,唯一的問題是,它不參與任何反應。
當對手已經開始用逐漸成熟的消費級應用貼身肉搏時,如果巨頭依然陷在內耗與應試的泥潭裡,曾經牢不可破的流量帝國,恐怕真要在不知不覺中被慢慢蠶食。 (APPSO)
