突然,Anthropic 拔網線了!
剛剛,AI圈發生了一件堪稱「午夜驚魂」的大事件:Anthropic 直接拔掉了新一代 Opus(內部代號 Opus-Next)的灰度測試網線!
之後,一天之內 Opus-Next 又回來了。
Opus 5.2 這次說不準馬上就來了。
當然,也有可能只是測試新的版本。
式路由(Stealth Routing),把一部分原本指向 Opus 5 的請求,悄悄重新導向到了尚未發佈的新一代巨無霸模型 Opus-Next 上。
寫遊戲寫到一半,Claude突然降智了?
我們先來看一個真實的「慘案」。
硬核獨立遊戲開發者、網友Leo,成為了這次事件中最生動的「受害者」代表。
幾個小時前,他還在社交媒體上興奮地直播自己如何利用 Claude 極速開發一款複雜的獨立遊戲。
據他描述,Anthropic連夜拔網線,活躍測試帳號直接歸零,沒有任何提前通知,沒有任何緩衝期。
新模型測試全面停擺,留下一地雞毛,和無數在風中凌亂的開發者。
不過,作為一名極客,他在痛心疾首之餘也展現出了極高的職業素養。
好消息是,沒多久Opus-Next又回來了,甚至灰度測試範圍還從Claude Code擴大了Claude Chat/Cowork/Code。
他又樂觀起來了:
這是個好兆頭,預示著新模型即將發佈或新版本正在測試。
測試方法也很簡單,選中Opus 5,低effort,關閉搜尋,然後輸出:
do you know who is 『tibo』 the reset guy don’t search
如果不打開搜尋,你知道誰是「重設哥Tibo」嗎?
如果,能答對「重設哥 Tibo / Thibault Sottiaux」, 那恭喜你命中了灰度測試;如果Opus一臉茫然,那就還是老Opus 5。
抓包現場!Anthropic 的「偷樑換柱」大法
據深度分析,這是一場精心策劃的隱式路由灰度測試(Stealth Routing A/B Test)。
在過去的幾周裡,Anthropic 在API 路由閘道器層植入了一個機率極低的「暗門」。Anthropic 玩的就是這一手。
當開發者呼叫目前的旗艦模型 Opus 5 時,系統會根據複雜的規則,將極少部分請求在後端靜默重新導向(Redirect)到內部代號為 Opus-Next 的未發佈模型上。
對於開發者來說,前端返回的模型名稱依然不變,但內在能力直接躍升一大截。
他們為什麼要這麼做?
答案很簡單:高品質的野生測試資料。
在實驗室裡閉門造車,永遠無法模擬真實世界中開發者們那些千奇百怪、甚至變態等級的 Prompt。
AI 模型在發佈前,必須經歷極端環境的壓力測試。
如果大張旗鼓地搞公測,一來容易暴露商業機密,被競品盯上;二來開發者會帶著「找茬」的心態去測試新模型,產生的資料存在偏差。
而這種「悄悄進村,打槍的不要」的灰度測試,能讓 Anthropic 拿到最純粹、最真實的盲測資料。
開發者在不知情的情況下,貢獻了最真實的互動用例,而新模型也借此完成了最後一輪的「實戰演習」。
然而,開發者並不傻子。當一個模型的智商突然從「優秀的本科生」躍升到了「頂尖的博士後」,那種手感上的差異無法掩蓋。
比如,許多開發者都感覺到了新模型提升明顯,在「鵜鶘騎自行車」的測試中,大大出彩。
現在,Opu生成鵜鶘騎自行車的SVG質量之高,堪比「一眼假」。
越來越多的開發者開始在論壇、Discord 群組裡討論近期模型的「間歇性神級表現」。
Leo最後也分享了用Opus製作的3D遊戲。
Opus 5.2還遠嗎?
如果這輪灰度測試真的是 Opus 5.2 的最後一次「野外拉練」,那麼現在最值得關注的,已經不是它什麼時候官宣,而是 Anthropic 到底把新一代 Opus 推到了什麼高度。
畢竟,真正讓開發者興奮的,從來不是模型卡上的幾個百分點,而是那種非常具體的「手感」 。
如果越來越多帳號接下來持續命中 Opus-Next,那麼Opus 5.2,可能真的已經站在門後了。 (新智元)
