真是深藏不漏!
這一次,Google終於把底牌扔出來了。
就在這兩天,大模型競技場Arena悄然殺入一款新模型,名字竟掛著「gemini-3.8-flash」。
上手實測的AI大佬和開發者交手幾輪後,幾乎倒吸一口氣——
這極有可能是GoogleDeepMind,悟了整整半年的下一代旗艦Gemini 4 Pro!
一張瘋傳全網的基準圖,簡直堪稱「恐怖」。
Gemini 4 Pro完全殺瘋,編碼、智能體、推理等領域實力,全面碾壓GPT-6 Astra、Claude Fable 5.1。
開發者Vidhi體驗過後,被Gemini 4 Pro完全震驚到了。
一張貓咪的SVG圖,就證明了一切。GPT-6 Astra直接扔出了一隻「大貓咪」(似貓非貓,更像laofu)。
正如傳言所說,Google內部實現了RSI,Gemini 4 Pro才能和Astra/Fable正面對打。
沉寂許久的巨獸,真的強勢回歸了!
Gemini 4 Pro匿名偷跑,擊敗Astra和Fable
AI圈許久未有這麼興奮了。
要知道,Google上一個大版本更新Gemini 3.1 Pro,已經是7個月前(2月19日)的事兒了。
GoogleI/O大會上,劈柴曾預告:Gemini 3.5 Pro將在6月上線。
未曾想,這一重大發佈鴿了又鴿,最終「胎死腹中」!
就在這個月初,WSJ獨家爆料,Gemini 3.5 Pro取消了,原因很簡單——
3.5 Pro的進化程度,連Flash都比不上。
好在,Gemini 4在預訓練中評估優秀,後訓練還在順利進行中。
如今,Gemini 4 Pro竟穿上了gemini-3.8-flash的「馬甲」,在Arena上首個檢查點現身了。
畢竟Gemini 3.8 Flash這款模型,早在9月初發佈,同名再出現極不尋常。
一大波上手體驗後的開發者們,對4 Pro印象深刻,甚至體感超越了Astra和Fable。
從洩露的基準測試圖中,可以發現,4 Pro實現了全面壓制,成績單非常亮眼——
- DeepSWE v1.1:AI智能體編碼任務上,4 Pro拿下了最高88.%分,比Astra還要多近2%;
- GDPval-AA v2:在真實知識工作任務中,4 Pro唯一獲得了2064 Elo;
- Terminal-bench 2.1:4 Pro終端編碼能力也是最強的95.3%;
- OSWorld-2.0:電腦使用能力方面,4 Pro斬獲86.8%,擊敗了Astra和Fable。
若這張表分數屬實,Gemini 4 Pro真是「地表最強」的AI了。
在價格方面,相較於Astra和Fable,也是「御三家」中最具性價比的那個。每百萬Token輸入價格2.25美元,每百萬Token輸出價格11.25美元。
AI研究員Qwinah進入Gemini 4 Pro後端後發現,它有1000萬輸入上限,25.6萬輸出上限,永久跨會話記憶,不用API即可連網。
全網首測4 Pro,登上熱搜
真正比跑分更有看點的,是全網一大的波驚豔實測。
UI網頁設計,品味大提升
這不,開發者Bee測完之後,直呼「Gemini 4 Pro太不真實了......」
短短14分鐘,4 Pro打造了一個以素描、鉛筆與石墨質感為主題的「創意展示網頁」。
它竟可以將網頁的「滾動即筆觸」概念化,向下滑動線條逐漸加深,互動感非常絲滑。
下面這個是一個兼具賽博朋克和復古未來主義的工作網站。
4 Pro在設計過程中,首屏結合了3D網格、資料儀表盤,還有可互動的3D模型。
3D+SVG,夯爆了
全網瘋傳的一個經典「鵜鶘騎自行車」的測試,Gemini 4 Pro輸出的效果非常震撼。
配色、日夜切換、車燈、解剖標註、踏頻控制,整個完成度完全不輸頂尖大模型。
Pankaj Kumar在體驗後,直接總結了幾個變化:
速度很快,SVG和3D生成明顯進步;一次提示就能把複雜要求吃得比較準。
甚至,它已經能直接生成帶完整互動邏輯、視覺效果不錯的小遊戲。
再來看一個像素風3D寶塔測試,有種身臨其境的味道了。
下面這個是4 Pro用時10分鐘,製作出的空巴H145直升機3D模型。
另外,在一個3D飛行模擬的測試中,4 Pro的畫面效果大幅超越了Gemini 3.8 Flash。
從這一點,就可以證明,Gemini 3.8 Flash和競技場上的gemini-3.8-flash不是同一款。
一鍵直出可玩的遊戲
在遊戲生成方面,Gemini 4 Pro也沒有落下。
「我的世界」從頁面搭建,大遊戲中每個模組的設計,完全不輸此前放出的Astra的測試。
還有下面這個3D卡丁車競速遊戲,看起來比跑跑卡丁車這些曾風靡一時賽車遊戲更現代;而這,是Gemini 4 Pro花了很短時間做出來的。
谷歌真正押注的,叫 RSI
一旦RSI這個循環真能持續轉起來,模型升級的節奏可能徹底變掉。
上個月,Google DeepMind首席戰略官Jasjeet Sekhon在伯克利的活動上,直接把話挑明了——
RSI(遞迴自我改進),已成為AI巨額投資邏輯裡的關鍵一環。
整個行業押注的,是能力曲線繼續向上。
而如果真正撞上遞迴自我改進,這條曲線甚至可能從「指數增長」進一步加速。
就在最近,全網流傳著更激進的說法:
Gemini 4之所以提前完成預訓練,正是因為GoogleDeepMind在訓練中實現「RSI閉環了」。
有意思的是,就在14日,Google一項名為Dream-RSI的研究也公開了。
它研究的正是,如何讓Agent在探索過程中不斷改進自己的搜尋策略,從經驗中繼續升級下一輪探索。
可以確認的是,GoogleDeepMind已經公開把RSI擺到了非常重要的位置。
而且,AI參與改進AI的跡象越來越多。
「御三家」要回來了?
所以,Gemini 4 Pro面對的是一個已經徹底變樣的牌桌。
OpenAI有Astra;Anthropic有Fable 5.1。
兩大巨頭已經把競爭從單純聊天,捲到長任務、Agent、程式碼、推理乃至自主科研。
Google如果只是做出一個「比Gemini 3.8更強」的模型,已經不夠了。
Gemini 4 Pro必須重新證明一件事:Gemini還在最前沿!
Google要想撐住目前4.23兆美元的市值,保持AI實力在第一梯隊至關重要。 (新智元)
