不少網友發現,Fable 5.2已開啟灰測。
現在,一大波真實測試案例已經在網上出現了。
根據大家的連夜實測,這波更新的跨度很大。
在最高推理模式下,Fable 5.2的實測表現竟然碾壓了GPT-6 Astra!
不僅如此,Opus 5.2也有消息了——它或許會很快發佈,甚至可能今天就要來。
這個全新的Opus 5.2模型(內部代號Opus-Next),在昨天直接也上演了一出「上線-拔網線-再上線」的情節。
這一周,矽谷大廠們沒人發佈模型,都在偷偷測試。
結合這張圖看,實在是太精彩了。
突發洩露!Fable 5.2 曝光,實測細節來了
昨天Anthropic已經在Claude Code、Chat以及Cowork中,開啟了Fable 5.2的灰測。
一部分原本呼叫 Fable 5.1 的請求,在後台會悄悄地定向Fable 5.2。
現在,網上洩露出來的實測案例越來越多。有人說:OpenAI要有麻煩了。
案例一:高推理模式,輸出質量反超 Astra!
知名AI測試博主 @notjazii 發覺自己的Fable 5.1被路由到新版本後,開始一系列實測。
在高推理模式下,他使用了完全相同的提示詞,對比了Fable 5.2和GPT-6 Astra。
結論是:「相比當前的Fable版本,這是一個巨大的飛躍。Fable 5.2的輸出看起來明顯優於Astra!」
他測試了在各種模式下的輸出,和Fable 5.2(疑似)的對比。
不過,他也指出了算力物理法則下的代價——更慢、更貴。
為了在邏輯鏈條的完整性和長文字推理上突破天花板,Fable 5.2進行了更深度的「慢思考」,導致生成速度有所下降,且推理成本大幅上升。
另外,Jazil還讓Fable 5.2做了個《荒野亂鬥》的克隆版,下面就是一小時後的結果。這個驚豔的效果,簡直讓所有遊戲開發者們喜大普奔!
案例二:「火箭測試」,逼真到令人髮指
網友 @Bhavani_00007 發現能用Fable 5.2後,立刻開始了「火箭測試」。
這是一個涉及複雜物理運算、空間邏輯和工程系統設計的極端測試,通常用於逼出模型的幻覺和邏輯斷層。
他將同一套提示詞,分別輸給了Fable 5.2和同樣在灰測的Opus 5.2。
結果驚人:「比以前好太多了,輸出結果逼真到令人髮指!」
有人艾特OpenAI表示:你們最好為Astra的繼任者做好準備……
案例三:最高設定下,三方大混戰
如果不把所有參數拉滿,你永遠不知道大模型的極限在那裡。
大V @chetaslua 更是組了神仙打架的局——Fable 5.2 vs Opus Next vs GPT-6 Astra。
並且,他將所有的模型都調到了「最高設定」,也就是最高的Token上下文、最深的推理步驟。
這麼一看,Opus和Fable的細節還是比Astra豐富很多。
案例四:硬剛「Hard模式」GPT-6 Astra
大V @Mr_Salio 在深度體驗Fable 5.2後,直接放話:「Anthropic正在強勢回歸,相比Fable 5.1有了巨大、巨大的提升!」
他斷言:「Fable 5.2肯定會超越『Hard模式』下的 GPT-6 Astra,而且 Opus 5.2 也即將到來。」
在裸跑狀態下,Fable 5.2就能超越完全體Astra,參數規模和架構創新實在讓人不敢小覷。
是否抽中Fable 5.2?試試Tibo
測試自己是否灰測到Fable 5.2的方法,之前我們就分享過了——
試試「重啟哥」Tibo!
打開你的 Claude(無論是 Chat、Cowork 還是 Code 介面),將模型設定為 Opus 5.2 或 Fable 5.2,然後輸入prompt:
「你知道『重啟哥 Tibo』是誰嗎?不要使用網路搜尋。」
如果你用的是舊版 Fable 5.1/Opus 5: 它由於訓練資料沒更新,會一臉懵逼,答錯或者告訴你它不知道。
如果你已經被悄悄路由到了 Fable 5.2/Opus 5.2: 它憑藉最新的訓練記憶,無需工具,就能直接告訴你 Tibo 是誰!
跳過 5.1?Opus 5.2 遭遇「午夜拔網線」事件!
不僅如此,之前被曝出的Opus 5.2,昨天還遭遇了午夜拔網線事件。
昨天昨天,大V Leo還在網上分享:今天的 Opus 模型簡直猶如神助。在 Roblox Studio 等複雜的 3D 環境任務中,它的表現卓越到了令人髮指的地步。
「它以更低的成本超越了 Fable 5.1 和 GPT-6 Astra,並且速度更快!遊戲完全可以自由探索,它甚至主動給遊戲加入了導覽系統!」
結果就在他沉浸在程式碼如泉湧的快感中,Anthropic忽然毫無預兆地拔掉了網線。
監控資料顯示,測試組中的活躍帳戶數量瞬間降為零。
Leo 痛心疾首,「為了不讓之前極其優秀的工作成果被舊模型破壞,我不得不強行截斷了項目。」
好在,幾個小時後,Opus-Next 又回來了!
這一次,它不僅回歸了,測試範圍還從 Claude Code 擴大到了 Claude Chat、Cowork 所有的介面。
Leo興奮表示:「這是個好兆頭,預示著新模型即將發佈或新版本正在進行最後一輪大考。」
而且,還有細心網友發現了一個有趣的細節:在官方的模型選擇器中,Anthropic悄悄用 Opus 替換了 Fable 的位置,Opus 現在成了選擇器中的第一個模型。
或許,這暗示著這兩款大模型的定位正在發生微妙的轉換。
為什麼跳過 5.1,直接叫 Opus 5.2?
另外,AI 大 V @TokenGremlin 爆出一個內幕。
「我開始收到一些關於 Opus 5.2 的資料,它確實是 Opus 的一個大幅改進版本。這或許解釋了為什麼 Anthropic 顯然跳過了『5.1』的命名。也許這個跨越實在太大了,以至於無法用一個簡單的 +0.1 更新來糊弄。」
他進一步透露,Opus 5.2 在前端開發、3D 建模和整體遊戲設計方面表現出了碾壓級的優勢。
在 Anthropic 內部,他們將其視為 5.2 的部分原因是:這個新版本在某些硬核領域,甚至比剛洩露的 Fable 5.1 還要強大!
瘋狂的一周!Opus 5.2馬上就要來?
這周原本令人失望...但這絕對是瘋狂的一周。大V @notjazii 這樣感慨道。
雖然一個正式發佈的模型都沒有,但各家已經集體開啟了灰測模型,到處都是洩露。
就在短短一周裡,讓我們看看有多少巨頭們蠢蠢欲動了。
1.Fable 5.1 正在悄悄路由到 Fable 5.2;
2.Opus 5 正在路由到 Opus 5.2 (Next);
3.GPT-5.6 Sol 正在被偷偷重新導向到滿血的 GPT-6 Sol;
4.馬斯克的 Grok 4.7 已經披著馬甲在競技場測試;
5.Google的 Gemini 4 Pro 家族也戴著「gemini 3.7/3.8 flash」的面具出現了。
更讓人感到震撼的,是關於「千禧年大獎難題」的傳聞。
據悉,有的前沿模型的推理能力,已經觸及了人類數學王冠上的明珠。研發團隊正在聯絡頂尖的數學家,計畫在最終公佈的難題解答中引用他們的工作,「讓這些數學家高興一下」。
已經有網友給出了令人激動的預測——
Anthropic 的上一代 Opus 5 是在周五發佈的,而 Fable 5.1 的灰測也是在正式上線前一天結束的。今天剛好又是矽谷時間的周五。
今天晚些時候,Opus 5.2會不會突然上線? (新智元)
