Google又發新模型,Meta AI負責人“挑釁”:Gemini是誰啊?

AI速讀
Google 近日快速迭代推出 Gemini 3.8 Flash,旨在強化複雜工程推理能力並維持低價 API 策略,但其實際執行成本因 Token 增加而上升。與此同時,Meta 推出 Muse Spark 1.3 模型,在 DeepSWE 基準測試中超越 Google,其 AI 負責人 Alexandr Wang 更在網路上公開調侃 Google,引發業界關注。目前 AI 產業競爭已進入極速迭代階段,模型勝負已從單純的基準數據轉向真實世界的應用實測。

Google的Pro模型遲遲未來,但是Flash模型又更新了,這已經是Google在六周內發佈的第三個Flash模型。

當地時間9月2日,Google宣佈推出Gemini 3.8 Flash,定位是“最智能的主力模型”,在軟體工程、智能體任務以及特定領域的關鍵多步驟推理方面,相比3.7 Flash有了提升。與此同時,Google還同步推出了一個安全模型Gemini 3.8 Flash Cyber,在漏洞檢測和自動修補方面具有前沿性能。

一位創業者感慨,Flash從3.7更新到3.8隻用了14天,“模型升級周期現在比你的評估周期還短。這才是對任何建構智能體的人來說的真正故事。”

GoogleDeepMind核心成員姚順宇也下場推薦新模型,他表示,對模型而言,這只是邁出了一小步;但對於RSI(遞迴自我改進)來說,是一次巨大的飛躍。RSI通常指的是讓AI自己參與設計、訓練和改進下一代AI‌‌,但在部落格中Google並未展開講這一點。

根據Google的測評,在DeepSWE v1.1(衡量模型自主解決複雜工程問題能力的評測)中,3.8 Flash得分73.7%,僅比Claude Opus 5的74%低0.3個百分點,超過了GPT-5.6 Sol的72.7%以及上代3.7 Flash的65.3%。

根據基準測試機構Artificial Analysis的測評,Gemini 3.8 Flash在智能上得分59,比 Gemini 3.7 Flash高3分,目前排在模型榜單第十位。

在價格方面,Gemini 3.8 Flash延續了此前的優惠促銷定價,API價格維持在每百萬Token輸入0.75美元、輸出3.75美元,延續Google用低價推動中端模型在複雜工程和自動化任務中普及的策略。

不過,根據業界的反饋,3.8 Flash在智能上的得分並沒有提升太多,其模型能力提升源於底層設計上的調整。與前代相比,新模型在處理複雜任務時會執行更多步驟的推理,並以循環迭代的方式呼叫內部工具。

這可能會導致實際成本的上升。Artificial Analysis測評顯示,Gemini 3.8 Flash每項智能指數任務的成本為0.58 美元,儘管定價未變,但較 Gemini 3.7 Flash 價格上漲約 40%,這主要是由於每任務輸出token增加30%,以及智能體評估中回合數增多所致。

Google表示,在部分高難度任務中,模型可能會消耗額外的Token,但這種機制旨在提高任務的首次成功率,並減少死循環重試和人工干預。對於強調極簡Token消耗的場景,開發者可以通過調整思考配置降低消耗,或繼續使用Gemini 3.7 Flash。

這背後是Google當下的產品邏輯,旗艦沒有更新,Flash系列既要把守成本和速度的基本盤,也要頂上原本屬於旗艦的複雜任務。

值得一提的是,Google發佈新模型的同一天,沉寂許久的Meta也回來了。

Meta推出了新模型Muse Spark 1.3,號稱是一款對標Opus 5的模型,在榜單中超過了Gemini 3.8 Flash。

Meta將這款模型的升級重點放在Agent長任務、程式設計以及推理效率上,並強調它能夠在較長的工作流中持續呼叫工具、修正自己的計畫,並處理多個平行任務。按照Meta公佈的資料,Muse Spark 1.3在DeepSWE v1.1上的成績達到75.4%,超過了Gemini 3.8 Flash。

但此次引發關注的是Meta AI負責人Alexandr Wang,他在社交媒體上轉發了榜單資料並調侃Google稱,“我真不想這麼說,但是……Gemini 是誰?”

這條略帶挑釁意味的評論引起不少爭議,有網友認為,這樣明確的比較“給人小家子氣的感覺”。此外,Meta僅僅發佈了模型基準資料,還未經開發者實際任務檢測,Benchmark上的勝負並不能直接等同於模型在真實世界中的勝負。

AI競賽的時間單位,已經從季度壓縮到了周,對於真正用模型做事的開發者來說,這些發佈宣傳和榜單排名並不重要,兩款新模型具體性能如何,還需要等待一段時間後社區的應用反饋,到那時或許才能評判一款模型的更新是否成功。 (第一財經)