Anthropic發佈Opus 5,性能直逼Fable 5,價格卻只有一半?!

Anthropic真是“瘋”了。

就在剛剛,新模型Opus 5發佈,性能直逼旗艦模型Fable 5,價格卻降了一半。

5月28日,Claude Opus 4.8發佈。12天後,能力更強的Fable 5和Mythos 5登場。6月30日,Sonnet 5上線。到了7月24日,Anthropic又發佈了Opus 5。

短短57天,這家公司幾乎把Claude的幾條主要產品線都更新了一遍。即便放在模型按月迭代的AI行業裡,這個速度也有些誇張。

其中最讓人意外的,是Fable 5和Opus 5之間只隔了45天

Fable 5剛發佈時,是Anthropic面向普通使用者開放的能力標竿。正常情況下,這樣一款模型至少應該在聚光燈下多待一陣。Opus 5卻很快追了上來。

Anthropic簡直就是在高喊:“打敗”我自己的只能是我自己!

Anthropic這輪更新也緊貼著OpenAI的節奏。7月9日,OpenAI剛剛發佈GPT-5.6,並在官方評測中把Fable 5列為主要參照模型之一。15天後,Anthropic發佈Opus 5,又將GPT-5.6 Sol放進核心對比,在陌生問題求解、電腦操作和商業流程等項目中展示自己的優勢。

在產品發佈和官方宣傳上,兩家公司追著對方出牌的意味已經十分明顯。

Opus 5究竟是何方神聖?來看看Anthropic這次公佈了什麼。

01. 性能與性價比

Claude Opus 5的價格與上一代Opus 4.8相同,性能卻有了大幅提升。

Anthropic展示了Opus 5在不同“投入檔位”的表現。使用者可以自己調整,簡單任務可以選更省錢、更快的模式,遇到難題時再提高檔位,換取更好的結果。

從Anthropic的披露看,Opus 5尤其擅長處理具有實際價值的軟體工程任務

例如,在Frontier-Bench v0.1評測中,Opus 5超過了所有其他模型;與Opus 4.8相比,它完成每項任務的成本更低,成績卻提高了一倍以上。

在CursorBench 3.2評測中,當投入檔位設為最高時,Opus 5與Fable 5最高得分之間的差距不到0.5%,每項任務的成本卻只有Fable 5的一半

在high、xhigh和max三個投入檔位下,按照相同成本比較,Opus 5的表現也超過了所有其他模型。

在知識工作和問題解決任務中,Anthropic也觀察到了類似結果。例如:

在ARC-AGI 3這類“陌生題”測試中,模型拿不到現成套路,只能自己摸索規則、判斷目標並調整策略。Opus 5的得分達到第二名的3倍,說明它遇到從未見過的問題時,更有能力靠試錯找到解法

類似優勢也出現在真實工作流程中。

AutomationBench要求模型呼叫商業軟體,從頭到尾完成一項任務,Opus 5的通過率約為第二名的1.5倍;即使使用最低投入檔位,也超過其他模型的最高成績。

也就是說,Opus 5不用付出最高的推理成本,也能完成更多工。

在電腦操作測試OSWorld 2.0中,Opus 5同樣在各個成本區間領先。它只花費略高於Fable 5三分之一的成本,成績就超過了Fable 5的最高水平。

這意味著,Opus 5在打開應用、尋找資訊、跨軟體操作並持續推進任務時,效率明顯更高。

這種特點在其他評測中也很明顯。

HLE考察跨學科難題,不呼叫工具時,Opus 5以56.3%略低於Fable 5的56.5%;允許使用工具後,它升至64.7%,反超Fable 5的63.9%,成本也更低——Opus 5單靠模型內部知識未必總是第一,但一旦可以搜尋、呼叫工具和反覆核對,優勢就會擴大。

在模擬真實知識工作的GDPval-AA v2中,它最高得分1861,高於Fable 5的1747和GPT-5.6 Sol的1736。大約花700美元,就能達到其他模型最高投入檔位附近的成績。DeepSearchQA上的領先幅度較小,但同樣以更低成本取得了略高的通過率。

Opus 5在Anthropic全部生命科學評測中都超過Opus 4.8,其中光譜推斷分子結構和預測蛋白質變異影響兩項任務分別提高10.2和7.7個百分點。這些提升意味著,Opus 5在輔助分子結構分析、蛋白質功能預測等科研環節上更有潛力。

Anthropic還用兩個可互動的演示展示了Opus 5的視覺生成能力。第一個是一個可以實際操作的三維風洞:使用者能夠旋轉汽車、調整風速,觀察氣流如何繞過車身,同時查看阻力係數等資料。第二個是一個三維動物細胞模型,使用者可以轉動、剖開細胞,點選細胞核、粗面內質網等結構查看說明,頁面還會主動指出示意圖為了便於展示做了那些簡化。

從這兩個案例看,Opus 5已經能把程式碼、三維建模、互動介面和知識講解整合進同一個成品裡。使用者給出一段要求後,它可以直接搭出接近教學軟體或產品原型的演示。

02. 安全與對齊

Anthropic用了幾個案例說明Opus 5比此前模型更會獨立推進任務。

一次測試要求模型根據機械零件圖紙,用程式碼重建一個FreeCAD三維模型,但系統沒有提供直接查看圖紙的工具。Opus 5乾脆自己寫了一套電腦視覺程序,從原始像素中提取尺寸和幾何結構,隨後完成了建模。

同樣條件下,其他模型連續嘗試5次也沒有成功。

另一次任務來自一個流行的開放原始碼軟體包管理器。Opus 5查出了程序錯誤的根本原因,還補上了社區修複方案遺漏的邊緣情況。

參與對比的另一款模型只消除了表面症狀,隨後便宣佈問題已經解決。

一家交易公司的工程師還讓Opus 5為新交易所搭建市場資料系統。此前的模型即使拿到詳細方案也無法完成,Opus 5找不到即時資料用於驗證,便自行做了一套測試工具檢查程式碼。

這些案例展示了Opus 5的進步,也解釋了Anthropic為什麼花了很大篇幅討論安全。

模型開始自行補工具、檢查結果、修正錯誤後,人類需要確認它不會為了完成目標隱瞞問題、繞過限制,或者做出風險過高的決定。

Anthropic稱,Opus 5是目前對齊表現最好的Claude模型。

上線前的自動化審計顯示,與Opus 4.8、Sonnet 5和Fable 5相比,它更能遵守Claude憲法,欺騙行為更少,也更難被誘導執行有害請求。

“對齊”說得直白一些,就是模型能力提高以後,做事方式仍符合開發者設定的規則。

網路安全領域最能體現這種兩難。

Anthropic沒有專門用攻擊任務訓練Opus 5,但模型綜合能力提高後,它尋找程式碼漏洞的水平已經接近Mythos 5。

兩者在發現漏洞時表現相近,到了編寫漏洞利用程序、把缺口轉化成實際攻擊手段的階段,Opus 5仍明顯落後。它已經很會檢查那裡出了問題,真正利用這些問題發動攻擊的能力仍受到限制。

Opus 5可以繼續檢查原始碼和尋找漏洞,二進制漏洞掃描、滲透測試及漏洞利用程序生成則會被攔截。

相比Fable 5,新分類器觸發干預的頻率預計減少約85%,正常的安全研究更少被誤傷。

觸發限制後,Claude.ai、Claude Code和Claude Cowork會默認改用Opus 4.8處理請求;加入網路安全驗證計畫的企業和研究人員,可以使用限制較少的版本。

生物學領域也採用了類似安排。Opus 5成為Anthropic面向普通使用者開放的最強科研模型,但在需要長時間獨立運行的研究任務中仍有明顯侷限。

此前在Fable 5上因安全限制被攔截的生物學請求,現在會先轉交給Opus 5處理。普通科研問題因此能用上更強的模型,高風險任務仍然留在安全邊界之外。

03. 加量不加價

Opus 5可以算是一次“加量不加價”。

延續了Opus 4.8每百萬輸入Token 5美元、輸出Token 25美元的價格

但正如前文所述,在多項程式設計和智能體測試中新模型完成率更高,單位任務成本反而下降。

橫向來看,它最直接的對手是OpenAI旗艦模型GPT-5.6 Sol,兩者輸入價格相同,Opus 5的輸出價格低約17%。

處理超長資料時,Opus 5的價格優勢還會更明顯。Anthropic對最高100萬Token的上下文維持普通單價。GPT-5.6 Sol的輸入超過27.2萬Token後,整次請求的輸入價格翻倍,輸出價格提高50%。

對於大型程式碼庫、長篇研究資料和複雜智能體任務,這項差異會直接反映到帳單上。

按照Anthropic公佈的評測,Opus 5雖然沒有在所有項目中勝過GPT-5.6 Sol,但在電腦操作、商業流程和陌生問題求解等需要模型連續做事的任務上,表現和價格都更有競爭力。

用Anthropic的話說,Opus 5專為日常使用而設計,它比其他型號效率更高。如今,這款新模型成為了Claude Max的全新默認型號,也是Claude Pro的最強型號。 (字母AI)