Anthropic稱,Opus 5能更好地檢查自身工作、發現邏輯錯誤並反覆迭代,部分測試中達到類似表現所需的推理Token數量明顯低於上一代;網絡安全能力接近Mythos 5,安全分類器相比Fable 5「明顯更寬鬆」;預計它將成為企業日常辦公、軟件開發、科學研究和AI智能體工作流中的默認模型。
在中國新模型持續以低價和高性價比衝擊市場、企業客戶也開始重新審視AI支出的背景下,Anthropic率先將「降本增效」推向了高端模型市場。
美東時間24日周五,Anthropic發佈新一代Claude Opus模型Opus 5,稱其在多個任務上的性能已經逼近公司最先進的Fable 5,但API價格只有後者的一半。Anthropic預計,Opus 5將成為企業日常辦公、軟件開發、科學研究和AI智能體工作流中的默認模型,稱它是Claude Max的默認模型,也是Claude Pro平台的最強模型。
Anthropic此次「上新」意味著,AI模型的價格戰正在進入新階段:競爭焦點不再只是推出更強大的旗艦模型,而是如何將接近旗艦級的能力以更低成本大規模部署。因為Opus 5並不是一個單純的便宜模型,而是試圖將接近旗艦級的能力下沉到更廣泛的企業日常任務。
媒體評論稱,Anthropic的勁敵OpenAI、Meta等大舉投入AI的矽谷公司也在加快推出更具成本效率的模型,而中國AI公司則通過低價和開放權重模型進一步加劇了這一競爭。
當中國模型以低價追趕、企業客戶開始重新計算AI投入產出比,AI行業的下一場競爭可能不再是「誰能訓練出最強模型」,而是:誰能以最低成本提供足夠強的模型。
Opus 5某些測試成績接近或超過Fable 5 成本遠低於後者
Anthropic此次對Opus 5的定位並非「絕對旗艦」,而是一個面向大規模使用的高性能通用模型。
公司稱,Opus 5在軟件工程、知識工作和複雜問題解決等多個測試中達到行業領先水平,同時以與上一代Opus 4.8相同的價格提供服務。
在軟件工程方面,Anthropic稱,Opus 5在Frontier-Bench測試中超過其他模型,表現較Opus 4.8翻倍以上;在CursorBench 3.2測試中,Opus 5最高努力等級下的成績距離Fable 5峰值僅相差0.5%,但單任務成本只有後者的一半。
在知識工作和自動化任務方面,Opus 5同樣表現突出。Anthropic稱,在ARC-AGI 3測試中,其得分約為下一名模型的3倍;在Zapier AutomationBench中,以相同任務成本計算,其通過率約為下一名模型的1.5倍;在OSWorld 2.0電腦操作測試中,Opus 5以略高於Fable 5三分之一的成本,超過了Fable 5的最佳成績。
Anthropic還強調,Opus 5在科學研究任務上的能力明顯提升,尤其是在有機化學和蛋白質相關任務上。
從價格來看,Opus 5的API價格為每百萬Token輸入5美元、輸出25美元,與Opus 4.8相同。而Anthropic當前旗艦模型Fable 5的定價為每百萬Token輸入10美元、輸出50美元。
換言之,Anthropic正在嘗試提供一種新的產品組合:接近旗艦級的能力,但價格只有旗艦模型的一半。
從代碼開發到科學研究:Opus 5到底強在那裡?
Opus 5的一個重要變化,是Anthropic開始強調模型的「計算效率」,而不僅僅是最終答案的質量。
公司稱,新模型能夠更好地檢查自己的工作、發現邏輯錯誤並反覆迭代。在部分測試中,Opus 5達到類似表現所需的推理Token數量明顯低於上一代。
這意味著,模型能力提升的衡量標準正在發生變化。
過去,模型之間的競爭主要看誰能夠在Benchmark上取得更高分;如今,對於企業客戶而言,另一個問題同樣重要:完成同一個任務,模型到底需要消耗多少Token?
在軟件工程場景中,Opus 5重點提升了代碼理解、代碼修改和複雜任務執行能力。Anthropic稱,模型在相關測試中的表現大幅超過上一代,並且在接近Fable 5能力的情況下顯著降低了單項任務成本。
在知識工作和自動化領域,Opus 5則瞄準了企業日常流程。
從處理文檔、分析資訊,到調用工具、操作電腦和執行多步驟任務,模型的目標不再只是生成一段文字,而是完成一個完整的工作流程。
Anthropic稱,在ARC-AGI 3、Zapier AutomationBench和OSWorld 2.0等測試中,Opus 5均表現出較強的任務執行能力。
在科學研究方面,Anthropic稱,Opus 5在有機化學任務上的得分較Opus 4.8提高10.2個百分點,在預測蛋白質序列變化影響方面提高7.7個百分點。
這意味著,Anthropic正在將Opus 5從一個「更強的聊天模型」推向一個更廣泛的專業工作工具。
模型越強,安全邊界越重要:網絡安全能力接近Mythos 5
隨著模型能力提升,Opus 5的網絡安全能力也成為此次發佈的重要看點。
Anthropic稱,Opus 5在發現軟件漏洞方面的能力已經接近更高階的Mythos 5,但在將漏洞轉化為實際攻擊工具方面仍明顯落後。
公司同時強調,和上一代Opus 4.8一樣,Opus 5並未針對網絡安全任務進行專門訓練。
Anthropic表示,模型在網絡安全任務上的能力提升,主要源於其通用能力增強。
在安全限制方面,Anthropic稱,Opus 5的安全分類器相比Fable 5「明顯更寬鬆」,安全機制的干預次數將大幅減少,但仍會阻止二進制漏洞掃描、滲透測試和漏洞利用代碼生成等高風險任務。
這一變化反映出AI模型能力提升帶來的兩面性。
一方面,模型需要具備足夠強的能力,才能真正用於企業網絡安全、科學研究和複雜工程任務;另一方面,模型越強,如何控制其在高風險領域的使用邊界也越困難。
因此,Anthropic此次發佈Opus 5,實際上不僅是在降低模型價格,也是在探索如何讓更強大的模型以更少的安全限制進入真實工作場景。
AI行業開始重新計算「每個Token的價值」
Opus 5發佈的背後,是企業客戶對AI支出回報率越來越強烈的關注。
報導稱,一些企業客戶已經因為AI支出快速增加而收緊員工使用限制,並重新評估AI工具的投入產出比。
Anthropic負責研究產品管理的Dianne Penn表示,公司正在回應企業客戶關於「如何創造更多價值」的反饋。
這說明,AI行業正在進入一個新的階段。
在早期階段,企業客戶更關注一個模型是不是全球最強,而當AI開始進入企業日常工作流程後,企業開始關註:完成同一個任務,我為什麼要多花一倍的錢?
這也使得模型的實際成本變得越來越重要。
一個模型即使在Benchmark上領先,如果完成同樣任務需要消耗更多Token,最終的企業使用成本也可能更高。
反過來,一個性能略低但推理效率更高、價格更便宜的模型,可能更適合大規模部署。
於是,AI行業的競爭指標正在從單一的模型能力,變成:模型能力 × 推理效率 × 單位成本。
Opus 5正是Anthropic針對這一變化推出的產品。
中國模型不斷「卷」價格 美國AI巨頭被迫提高性價比
如果說企業客戶的成本壓力推動了AI模型價格重新評估,那麼中國AI模型的競爭則進一步加速了這一過程。
7月16日上周四,月之暗面正式發佈2.8兆參數的全球最大開源模型Kimi K3。已公佈的測評結果顯示,該模型的整體能力僅落後於Fable 5和OpenAI的GPT-5.6。
DeepSeek此前也已經通過低價策略和開放權重模式,推動全球AI模型價格持續下探。
中國模型的競爭意義不一定在於已經在所有前沿能力上超越美國頂級模型,而在於它們正在改變市場對AI模型價格的預期。
過去,企業可能接受「更強的模型就該更貴」這種說法,可是,隨著越來越多高性能模型以更低價格提供服務,這種價格邏輯正在發生變化。
如果一個更便宜的模型已經能夠完成企業80%甚至90%的日常任務,那麼客戶是否還願意為剩餘的性能差距支付兩倍甚至數倍的價格,就成為現實問題。
這也是Anthropic、OpenAI、Meta等公司都在加快推進更具成本效率模型的原因之一。
從這個角度看,中國模型的競爭與企業自身的降本壓力正在形成疊加效應。
一邊是中國模型不斷以低價追趕,另一邊是美國企業客戶開始要求AI投入產生更高回報。兩股力量共同推動全球AI模型市場重新計算「性能究竟值多少錢」。 (華爾街見聞)
