現在就預告了——中秋和國慶的13天假期,可能會是今年AI圈最忙最炸的兩周。
盆友,別休了,別睡了,找好椅子癱坐吧。
「基模決戰周」,真要來了!!
矽谷那邊已經暗流湧動。
Anthropic的新Claude,灰測動靜早就傳得沸沸揚揚。
Google更是直接,Gemini 4 Pro疑似已經披著馬甲,偷偷混進Arena參加摸底考試了。
國內這邊,全卡在假期前瘋狂憋大招。
Kimi開始拿「K3.1」瘋狂打啞謎,DeepSeek下一張Pro牌已經提前寫進官方文件,Qwen4也直接亮出了新架構。
而擂台正中央,OpenAI月初才剛剛放出GPT-6 Astra——一款讓OpenAI提前給AGI開香檳的基模。
好傢伙,這架勢整得像大家提前約好了一樣:
該來的、可能來的、偷偷摸摸已經在考場裡的,全趕到了一塊兒。
節前最後一舞,Are you ready?
矽谷集體圍攻OpenAI GPT-6 Astra
矽谷這邊,A社、Google、馬斯克的Grok幾乎都有新動作傳出。
A社Claude 5.2箭在弦上
最先坐不住的自然還是A社。
路透社最新爆料已經確認,Anthropic正在考慮推出一款新模型,只是最終什麼時候發、叫什麼,還沒公開。
社區裡呼聲最高的是Claude Opus 5.2和Fable 5.2。
這兩款模型之所以被社區盯上,主要還是因為最近冒出來的一系列灰測訊號。
最早的線索來自Claude Code。
有開發者發現,自己明明選擇的還是Opus 5,但部分複雜任務裡的表現卻和此前版本明顯不同。
於是社區開始猜測:
Anthropic是不是已經在後台悄悄切換模型,把一部分請求路由到了新的內部checkpoint?
這個猜測很快被更多線索印證。
多位開發者反饋,原本呼叫Fable 5.1的請求,在後台被靜默重新導向到了新版本。
有人在高推理模式下實測,發現新模型的輸出質量明顯優於GPT-6 Astra,代價是速度更慢、成本更高。
最戲劇性的當屬Opus 5.2的「午夜驚魂」。
9月17日晚間,Anthropic突然切斷了Opus-Next(據傳是Opus 5.2的內部代號)的灰度測試通道,活躍測試帳號一度歸零,開發者社區一片哀嚎。
但僅僅一天之後,灰測就重新上線,範圍還從Claude Code擴大到了Chat和Cowork。
而這一系列動作的大背景是:
OpenAI月初發佈的GPT-6 Astra,已經拿下了約13%的企業AI支出,Anthropic的Claude Fable則約為8%。
Anthropic選擇在IPO前夕放出新模型的風聲,很難說不是在搶回敘事主動權。
GoogleGemini 4 Pro內測效果刷屏
更有節目效果的是Google。
最近Arena裡出現了一個名叫gemini-3.8-flash的模型。
名字看著平平無奇,但不少測試者很快發現不對勁:
這玩意兒根本不像Flash。
眾人一致推斷,它很可能是Google下一代旗艦Gemini 4 Pro的隱身checkpoint,社區還流傳其內部代號為Argon。
隨後冒出來的一堆demo,更是直接把討論度拉起來了。
AI圈祖傳考題「鵜鶘騎自行車」,這次疑似Gemini 4 Pro的版本,不只是把鳥和自行車畫出來,還進一步做成了帶踩踏動作、光照變化和控制元件的完整互動頁面。
相比普通3.8 Flash,複雜度肉眼可見地高了一截。
再比如畫PS5 SVG,模型花了大約10分鐘,直接用程式碼畫出一套細節非常密的PS5向量圖,包含複雜曲線、陰影和機身結構。
測試者直接評價,這是自己從AI模型裡拿到過最誇張的輸出之一。
還有Voxel Pagoda(體素寶塔),這次模型直接搭了一個完整3D場景:
多層寶塔、地形、樹木和周邊環境一起生成,同時還保留了查看和燈光控制。
相比之前checkpoint,幾何結構和整個場景的完整度明顯提高。
以及一個傳播很廣的demo側視家貓SVG,提示詞非常簡單:
畫一隻側視的家貓。
測試者把疑似Gemini 4 Pro的結果和GPT-6 Astra Max、正式版Gemini 3.8 Flash擺在一起,主要看輪廓、四肢比例和空間關係(下圖按此順序)。
結果也因此在Reddit拿到了數百贊,成了這一波最火的對比圖之一。
再往後,測試已經從SVG一路捲到了網頁和3D場景。
有網友甚至用它做了一個「奧特曼騎哥斯拉打怪獸」小遊戲:
SVG+HTML,滑鼠點那裡就往那裡發射雷射,還能加速。
當然,這些demo只能說明Arena裡這個神秘checkpoint確實很能打。
它到底是不是Gemini 4 Pro,Google沒官宣之前還得打個問號,但至少從測試密度來看——
下一代Gemini,已經離得很近了。
馬斯克Grok 4.7正在烹製中
馬斯克也沒閒著。
此前有網友詢問Grok 4.7進展,老馬直接回覆:
Grok 4.7 needs a few more days to cook.
掐指一算,也差不多這幾天了。
不過按老馬以前的風格,他一般是等其他人都發了再出現,主打一個「黃雀在後」(doge)。
買定離手,我先壓一個。
國內熱鬧程度也不遑多讓
國內這邊,有人已經提前搶跑了——
就在剛剛,階躍星辰突然發佈新一代旗艦模型Step 5 Preview。
模型採用稀疏MoE架構,總參數600B、啟動參數27B,支援百萬Token上下文,並針對程式設計、Agent、專業知識工作等真實任務進行了最佳化。
在全球權威的Artificial Analysis Intelligence Index中,Step 5 Preview取得44分,位居全球開源模型前三,而且單任務成本僅為Claude Opus 5的1/8。
而階躍剛把牌拍上桌,Kimi那邊的謎底也已經快寫臉上了。
最近其官方帳號最近突然放出一串數字:415926535897932384626433832795……
乍一看像亂碼,但把圓周率π拿出來對照一下就懂了。
π開頭是:
3.1415926535897932384626433832795……
去掉最前面的3.1,剩下的剛好就是這串數字。
K3.1??好好好,是誰又悟了~(不過也有網友反手買,說這意味著沒有3.1)
除了Kimi,DeepSeek這邊也早就埋好了彩蛋。
9月10日發佈DeepSeek V4.1 Flash時,官方文件裡已經明確提到:
在V4.1 Pro上線之前,部分V4 Pro請求會被路由到V4.1 Flash。
換句話說,V4.1 Pro基本確定存在,只差什麼時候翻牌。
而按以前發佈節奏推測,V4.1 Pro最快可能會落在9月底到10月初這個窗口期。
Flash和Pro之間通常不會拖太久,此前V4系列發佈時,Flash和Pro基本同步亮相。
更早的版本迭代中,輕量版本先行後,旗艦版本也往往會在數周內跟進。
再加上放假這個因素,「一放假就發模型」的戲碼想必大家也不陌生了。
再往後是阿里Qwen。
阿里8月底開源Qwen3.8-Flash-Next時也把話挑明了:
這就是Qwen4底層架構的early preview。
而且官方強調,這次之所以提前把架構開出來,就是想讓社區在完整Qwen4系列建構完成之前先行測試。
換句話說,Qwen4同樣已經在路上。
現在,太平洋兩岸的選手已經嚴陣以待,就看誰先出牌了。
當然,有新模型要發的要加班,沒有新模型發的可能更要加班。
還討論什麼AI代替工作、AI自我進化RSI……咱這行一直都是一部分人鉚足了勁,要麼讓另一部分人失業,要麼讓另一部分人加班。
十一假期,Are you ready? (量子位)
