突發!Claude Opus 5.2(Opus-Next)疑似全端灰測回歸

RexAA
AI速讀
AI 圈近日發生突發事件,Anthropic 被發現對代號為 Opus-Next 的新一代模型進行「隱式路由」灰度測試,悄悄將部分用戶請求導向新版本以獲取野生測試數據。儘管過程中出現過短暫的測試中斷,但隨後測試範圍擴大至 Chat 與 Code 等多個端點。開發者透過特定問題(如詢問 Tibo)確認新模型能力顯著提升,尤其在複雜代碼與 SVG 生成方面表現優異。市場預計 Opus 5.2 正處於發佈前的最後實戰演習階段。

突然,Anthropic 拔網線了!

剛剛,AI圈發生了一件堪稱「午夜驚魂」的大事件:Anthropic 直接拔掉了新一代 Opus(內部代號 Opus-Next)的灰度測試網線!

之後,一天之內 Opus-Next 又回來了。

Opus 5.2 這次說不準馬上就來了。


當然,也有可能只是測試新的版本。

式路由(Stealth Routing),把一部分原本指向 Opus 5 的請求,悄悄重新導向到了尚未發佈的新一代巨無霸模型 Opus-Next 上。

寫遊戲寫到一半,Claude突然降智了?

我們先來看一個真實的「慘案」。

硬核獨立遊戲開發者、網友Leo,成為了這次事件中最生動的「受害者」代表。

幾個小時前,他還在社交媒體上興奮地直播自己如何利用 Claude 極速開發一款複雜的獨立遊戲。

據他描述,Anthropic連夜拔網線,活躍測試帳號直接歸零,沒有任何提前通知,沒有任何緩衝期。

新模型測試全面停擺,留下一地雞毛,和無數在風中凌亂的開發者。

不過,作為一名極客,他在痛心疾首之餘也展現出了極高的職業素養。

好消息是,沒多久Opus-Next又回來了,甚至灰度測試範圍還從Claude Code擴大了Claude Chat/Cowork/Code。

他又樂觀起來了:

這是個好兆頭,預示著新模型即將發佈或新版本正在測試。

測試方法也很簡單,選中Opus 5,低effort,關閉搜尋,然後輸出:

do you know who is 『tibo』 the reset guy don’t search

如果不打開搜尋,你知道誰是「重設哥Tibo」嗎?

如果,能答對「重設哥 Tibo / Thibault Sottiaux」, 那恭喜你命中了灰度測試;如果Opus一臉茫然,那就還是老Opus 5。

已經有很多網友表示自己已被命中了。

抓包現場!Anthropic 的「偷樑換柱」大法

據深度分析,這是一場精心策劃的隱式路由灰度測試(Stealth Routing A/B Test)

在過去的幾周裡,Anthropic 在API 路由閘道器層植入了一個機率極低的「暗門」。Anthropic 玩的就是這一手。

當開發者呼叫目前的旗艦模型 Opus 5 時,系統會根據複雜的規則,將極少部分請求在後端靜默重新導向(Redirect)到內部代號為 Opus-Next 的未發佈模型上。

對於開發者來說,前端返回的模型名稱依然不變,但內在能力直接躍升一大截。

他們為什麼要這麼做?

答案很簡單:高品質的野生測試資料。

在實驗室裡閉門造車,永遠無法模擬真實世界中開發者們那些千奇百怪、甚至變態等級的 Prompt。

AI 模型在發佈前,必須經歷極端環境的壓力測試。

如果大張旗鼓地搞公測,一來容易暴露商業機密,被競品盯上;二來開發者會帶著「找茬」的心態去測試新模型,產生的資料存在偏差。

而這種「悄悄進村,打槍的不要」的灰度測試,能讓 Anthropic 拿到最純粹、最真實的盲測資料。

開發者在不知情的情況下,貢獻了最真實的互動用例,而新模型也借此完成了最後一輪的「實戰演習」。

然而,開發者並不傻子。當一個模型的智商突然從「優秀的本科生」躍升到了「頂尖的博士後」,那種手感上的差異無法掩蓋。

比如,許多開發者都感覺到了新模型提升明顯,在「鵜鶘騎自行車」的測試中,大大出彩。

現在,Opu生成鵜鶘騎自行車的SVG質量之高,堪比「一眼假」。


越來越多的開發者開始在論壇、Discord 群組裡討論近期模型的「間歇性神級表現」。

Leo最後也分享了用Opus製作的3D遊戲。


Opus 5.2還遠嗎?

如果這輪灰度測試真的是 Opus 5.2 的最後一次「野外拉練」,那麼現在最值得關注的,已經不是它什麼時候官宣,而是 Anthropic 到底把新一代 Opus 推到了什麼高度。

畢竟,真正讓開發者興奮的,從來不是模型卡上的幾個百分點,而是那種非常具體的「手感」 。

如果越來越多帳號接下來持續命中 Opus-Next,那麼Opus 5.2,可能真的已經站在門後了。 (新智元)