全球基模決戰!AI圈休不了十一長假了

RexAA
•
AI速讀
全球 AI 圈迎來「基模決戰周」。OpenAI 的 GPT-6 Astra 引發矽谷連鎖反應,Anthropic 與 Google 分別透過灰測與 Arena 隱身模型預告新一代旗艦 Claude 5.2 與 Gemini 4 Pro。與此同時,中國 AI 廠商亦密集佈局,階躍星辰發布 Step 5 Preview,Kimi、DeepSeek 及阿里 Qwen 均釋出新版本(K3.1, V4.1 Pro, Qwen4)的強烈信號。這場跨太平洋的技術競速,預示著 AI 模型將在推理能力、多模態生成與成本優化上迎來新突破。

現在就預告了——中秋和國慶的13天假期,可能會是今年AI圈最忙最炸的兩周。

盆友,別休了,別睡了,找好椅子癱坐吧。

「基模決戰周」,真要來了!!

矽谷那邊已經暗流湧動。

Anthropic的新Claude,灰測動靜早就傳得沸沸揚揚。

Google更是直接,Gemini 4 Pro疑似已經披著馬甲,偷偷混進Arena參加摸底考試了。

國內這邊,全卡在假期前瘋狂憋大招。

Kimi開始拿「K3.1」瘋狂打啞謎,DeepSeek下一張Pro牌已經提前寫進官方文件,Qwen4也直接亮出了新架構。

而擂台正中央,OpenAI月初才剛剛放出GPT-6 Astra——一款讓OpenAI提前給AGI開香檳的基模。

好傢伙,這架勢整得像大家提前約好了一樣:

該來的、可能來的、偷偷摸摸已經在考場裡的,全趕到了一塊兒。

節前最後一舞,Are you ready?

矽谷集體圍攻OpenAI GPT-6 Astra

矽谷這邊,A社、Google、馬斯克的Grok幾乎都有新動作傳出。

A社Claude 5.2箭在弦上

最先坐不住的自然還是A社。

路透社最新爆料已經確認,Anthropic正在考慮推出一款新模型,只是最終什麼時候發、叫什麼,還沒公開。

社區裡呼聲最高的是Claude Opus 5.2和Fable 5.2。

這兩款模型之所以被社區盯上,主要還是因為最近冒出來的一系列灰測訊號。

最早的線索來自Claude Code。

有開發者發現,自己明明選擇的還是Opus 5,但部分複雜任務裡的表現卻和此前版本明顯不同。

於是社區開始猜測:

Anthropic是不是已經在後台悄悄切換模型,把一部分請求路由到了新的內部checkpoint?

這個猜測很快被更多線索印證。

多位開發者反饋,原本呼叫Fable 5.1的請求,在後台被靜默重新導向到了新版本。

有人在高推理模式下實測,發現新模型的輸出質量明顯優於GPT-6 Astra,代價是速度更慢、成本更高。

最戲劇性的當屬Opus 5.2的「午夜驚魂」。

9月17日晚間,Anthropic突然切斷了Opus-Next(據傳是Opus 5.2的內部代號)的灰度測試通道,活躍測試帳號一度歸零,開發者社區一片哀嚎。

但僅僅一天之後,灰測就重新上線,範圍還從Claude Code擴大到了Chat和Cowork。

而這一系列動作的大背景是:

OpenAI月初發佈的GPT-6 Astra,已經拿下了約13%的企業AI支出,Anthropic的Claude Fable則約為8%。

Anthropic選擇在IPO前夕放出新模型的風聲,很難說不是在搶回敘事主動權。

GoogleGemini 4 Pro內測效果刷屏

更有節目效果的是Google。

最近Arena裡出現了一個名叫gemini-3.8-flash的模型。

名字看著平平無奇,但不少測試者很快發現不對勁:

這玩意兒根本不像Flash。

眾人一致推斷,它很可能是Google下一代旗艦Gemini 4 Pro的隱身checkpoint,社區還流傳其內部代號為Argon。

隨後冒出來的一堆demo,更是直接把討論度拉起來了。

AI圈祖傳考題「鵜鶘騎自行車」,這次疑似Gemini 4 Pro的版本,不只是把鳥和自行車畫出來,還進一步做成了帶踩踏動作、光照變化和控制元件的完整互動頁面。

相比普通3.8 Flash,複雜度肉眼可見地高了一截。

再比如畫PS5 SVG,模型花了大約10分鐘,直接用程式碼畫出一套細節非常密的PS5向量圖,包含複雜曲線、陰影和機身結構。

測試者直接評價,這是自己從AI模型裡拿到過最誇張的輸出之一。

還有Voxel Pagoda(體素寶塔),這次模型直接搭了一個完整3D場景:

多層寶塔、地形、樹木和周邊環境一起生成,同時還保留了查看和燈光控制。

相比之前checkpoint,幾何結構和整個場景的完整度明顯提高。

以及一個傳播很廣的demo側視家貓SVG,提示詞非常簡單:

畫一隻側視的家貓。

測試者把疑似Gemini 4 Pro的結果和GPT-6 Astra Max、正式版Gemini 3.8 Flash擺在一起,主要看輪廓、四肢比例和空間關係(下圖按此順序)。

結果也因此在Reddit拿到了數百贊,成了這一波最火的對比圖之一。

再往後,測試已經從SVG一路捲到了網頁和3D場景。

有網友甚至用它做了一個「奧特曼騎哥斯拉打怪獸」小遊戲:

SVG+HTML,滑鼠點那裡就往那裡發射雷射,還能加速。

當然,這些demo只能說明Arena裡這個神秘checkpoint確實很能打。

它到底是不是Gemini 4 Pro,Google沒官宣之前還得打個問號,但至少從測試密度來看——

下一代Gemini,已經離得很近了。

馬斯克Grok 4.7正在烹製中

馬斯克也沒閒著。

此前有網友詢問Grok 4.7進展,老馬直接回覆:

Grok 4.7 needs a few more days to cook.

掐指一算,也差不多這幾天了。

不過按老馬以前的風格,他一般是等其他人都發了再出現,主打一個「黃雀在後」(doge)。

買定離手,我先壓一個。

國內熱鬧程度也不遑多讓

國內這邊,有人已經提前搶跑了——

就在剛剛,階躍星辰突然發佈新一代旗艦模型Step 5 Preview。

模型採用稀疏MoE架構,總參數600B、啟動參數27B,支援百萬Token上下文,並針對程式設計、Agent、專業知識工作等真實任務進行了最佳化。

在全球權威的Artificial Analysis Intelligence Index中,Step 5 Preview取得44分,位居全球開源模型前三,而且單任務成本僅為Claude Opus 5的1/8。

而階躍剛把牌拍上桌,Kimi那邊的謎底也已經快寫臉上了。

最近其官方帳號最近突然放出一串數字:415926535897932384626433832795……

乍一看像亂碼,但把圓周率π拿出來對照一下就懂了。

π開頭是:

3.1415926535897932384626433832795……

去掉最前面的3.1,剩下的剛好就是這串數字。

K3.1??好好好,是誰又悟了~(不過也有網友反手買,說這意味著沒有3.1)

除了Kimi,DeepSeek這邊也早就埋好了彩蛋。

9月10日發佈DeepSeek V4.1 Flash時,官方文件裡已經明確提到:

在V4.1 Pro上線之前,部分V4 Pro請求會被路由到V4.1 Flash。

換句話說,V4.1 Pro基本確定存在,只差什麼時候翻牌。

而按以前發佈節奏推測,V4.1 Pro最快可能會落在9月底到10月初這個窗口期。

Flash和Pro之間通常不會拖太久,此前V4系列發佈時,Flash和Pro基本同步亮相。

更早的版本迭代中,輕量版本先行後,旗艦版本也往往會在數周內跟進。

再加上放假這個因素,「一放假就發模型」的戲碼想必大家也不陌生了。

再往後是阿里Qwen。

阿里8月底開源Qwen3.8-Flash-Next時也把話挑明了:

這就是Qwen4底層架構的early preview。

而且官方強調,這次之所以提前把架構開出來,就是想讓社區在完整Qwen4系列建構完成之前先行測試。

換句話說,Qwen4同樣已經在路上。

現在,太平洋兩岸的選手已經嚴陣以待,就看誰先出牌了。

當然,有新模型要發的要加班,沒有新模型發的可能更要加班。

還討論什麼AI代替工作、AI自我進化RSI……咱這行一直都是一部分人鉚足了勁,要麼讓另一部分人失業,要麼讓另一部分人加班。

十一假期,Are you ready? (量子位)