AI貴不貴,開始要按任務算帳了。
9月1日,Anthropic同時發佈Claude Fable 5.1和Mythos 5.1。兩款產品使用同一個底層模型,重點提升長時間智能體、程式設計和科研能力。科研類終端任務成績翻了一倍多,辦公自動化提高了約八成。
這次比跑分更值得看的是價格。Fable 5.1的標準輸入和輸出價格沒動,但Anthropic宣佈,快取讀取價格從每百萬Token 1美元降到0.25美元,降幅75%。公司說,典型工作負載的成本能降約25%,高度智能體化的任務最多能降約45%。
但快取便宜了,一項任務卻仍可能更貴。
Artificial Analysis測出來的是另一組數字:在最高努力檔下,Fable 5.1的單任務成本反而比上一代高20%。模型翻舊資料是便宜了,但輸出的東西多了,總帳單反而被抬上去。
當AI可以連續工作幾十小時,每百萬Token多少錢只是表麵價格。真正要算的,是它把事情做完花了多少錢。
01. 從答一道題到連續干幾十小時
Fable 5.1的跑分提升,主要出現在需要模型連續操作的任務裡。
Anthropic公佈的測試裡,Terminal-Bench-Science從Fable 5的24.7%升到52.6%;AutomationBench從17.1%升到31.4%;OSWorld 2.0的嚴格評分下,成績也從36.1%升到41.7%。這些測試的共同點是,要模型在終端或電腦環境裡連續搜尋、分析、呼叫工具,還要根據結果調整下一步。
跑分之外,Anthropic發佈材料裡還列了幾個早期測試案例,更容易看懂。
Millennium曾經碰上一個大約每運行100萬次才出現一次的軟體崩潰。內部團隊查了四五年,一直沒找到原因。測試中,Fable 5.1拆開外部供應商的軟體庫,和崩潰留下的core dump比對,最後把問題定位到外部庫裡的一個漏洞。
Ramp把測試時間拉得更長。一次無人值守的機器學習任務裡,Fable 5.1連續跑了38小時。它先發現此前的實驗結果受到標籤問題影響,修正後啟動六組平行實驗,最後返回結果和下一步建議。Ramp還說,模型發現了一個無人負責的生產告警,並根據日誌給出了修複方案。
Browserbase的說法是,在他們內部最難的瀏覽器智能體測試裡,Fable 5.1完成了82%的任務,Fable 5為57%,Opus 5為74%。每項任務平均運行大約10分鐘。
另外兩家公司給出的案例更接近企業軟體開發。MongoDB說,Fable 5.1用大約三天完成了一個複雜原型:先讀公司各項服務的程式碼和文件,提出設計方案,再連續運行幾個小時把它實現出來。Shopify則讓它分析一項橫跨三個程式碼庫、八項以上服務的改動。按Shopify的說法,模型能把一個請求進入系統之後經過的服務、函數、資料庫表和資料行一路梳理下來。
這些案例說明,長任務能力不只是"讓模型多想一會兒"。模型還要保存已經完成的步驟,知道接下來該呼叫那個工具,並在結果不符合預期時回到前面檢查。任務越長,一次判斷錯了,後面就會被越滾越大。
這些案例都是Anthropic自己挑出來的,沒有第三方復現。但它們指向同一個變化:模型開始可以在較長時間裡保存進度、檢查結果、繼續推進,不必每走一步都等使用者重新下指令。
82%的瀏覽器任務完成率反過來說,還有將近五分之一的任務沒做完。長時間運行能力提升,不等於使用者已經可以放棄驗收。企業要的不只是模型肯一直做下去,還要它做不下去時能說一聲、能留下過程記錄,該把任務交回人手就交回來。
華頓商學院教授伊森·莫利克(Ethan Mollick)在早期體驗後也把注意力放在這一點上。他覺得Fable 5.1在需要判斷和取捨的長時間任務裡出現了實際進步,但一些帶有明顯"Claudish"特徵的表現並沒有跟著消失。
模型能幹得更久,隨之而來的問題也變得更實在:一次運行不再只是生成幾段回答,而可能持續消耗上下文、工具呼叫和輸出Token。能力上去之後,成本就成了下一道門檻。
02. 快取便宜75%什麼一項任務反而更貴
Fable 5.1的標準輸入價格仍是每百萬Token 10美元,輸出仍是50美元。真正降下來的是快取讀取:從每百萬Token 1美元降到0.25美元。
快取讀取,就是模型反覆翻看已經處理過的資料。智能體連續工作時,需要不斷重新讀取程式碼庫、系統指令、工具說明、文件和此前積累的上下文。執行階段間越長,這部分開銷通常越明顯。
Anthropic根據2026年8月四周的實際使用情況估算,Fable 5.1在典型工作負載中的成本能降約25%;對快取讀取佔比較高的智能體任務,降幅最高約45%。這個估算只針對按Token計費的情況,和Claude訂閱價格沒關係。
這組資料覆蓋Claude Enterprise、Claude Code和API裡的實際使用,採用的是各產品的默認努力等級。Fable 5.1在Claude Code裡默認用High,在Claude Cowork和Claude.ai裡默認用Medium。同一個模型選不同努力等級,思考時間、輸出量和最終成本都可能不一樣。
Anthropic還保留了更便宜的批處理價格:非同步任務的輸入和輸出分別是每百萬Token 5美元和25美元。這適合不用馬上出結果的活,但換不掉需要即時來回呼用工具的智能體任務。
Cognition聯合創始人兼首席產品官沃爾登·嚴(Walden Yan)說,公司計畫在Fable 5.1發佈當天把Devin裡的Opus 5流量切到Fable 5.1。按Cognition的內部測試,Fable 5.1能達到甚至略高於Fable 5的表現,單任務成本更低。快取降價之後,程式碼審查這類此前跑Opus級模型的任務,也開始有了轉到Fable級模型的經濟性。
Every首席執行長丹·希珀(Dan Shipper)測出來的是另一組結果:Fable 5.1的運行速度大約是Opus 5的兩倍,Token消耗大約減少一半。這只是一家公司在自己的任務上跑出來的資料,但它也說明,企業不會只看官網標價,還得拿自己的程式碼和工作流重新測一遍。
發佈後,社交媒體上的好評也集中在這幾點上。@kimmonismus強調,45%的降幅只適用於快取佔比較高的智能體負載;馬特·舒默(Matt Shumer)關注的是能力提升與快取降價同時出現;金宇宸的看法是,如果百萬次才出現一次的崩潰診斷和更低Token消耗能夠穩定復現,意義會更大。
不過,模型的一項成本下降,不等於整項任務一定更便宜。
Artificial Analysis在他們的Intelligence Index測試裡發現,Fable 5.1在最高努力檔下的單任務成本是3.76美元,比Fable 5高20%。測試裡,Fable 5.1用掉的輸出Token大約是上一代的1.7倍。快取降價每項任務省下大約1.40美元,仍不夠抵消新增的輸出開銷。
換到xhigh努力等級後,Fable 5.1的單任務成本降到2.72美元,比最高努力檔低1.04美元。這說明同一個模型選不同努力等級,任務成本也可能差不少。
Anthropic和Artificial Analysis測的不是同一批任務,也沒有用完全一樣的努力等級,兩組數字不能直接對照。但它們能解釋為什麼"快取價格下降75%"和"單任務成本上漲20%"可以同時成立:模型翻舊資料便宜了,但如果為了完成任務生成更多新內容,總帳單一樣會漲。
這也是為什麼輸出價格仍然重要。Fable 5.1每百萬輸出Token還是收50美元,是快取讀取價格的200倍。長任務裡只要多生成一段分析、多做一次檢查、或者重跑一條失敗路徑,新增輸出就可能很快吃掉快取省下來的錢。
模型廠商對"價格"的理解也開始變。據《The Information》報導,OpenAI近幾個月向部分大客戶提供了任務完成後再付費的選項,比如只有AI完成客服互動才收費。OpenAI沒有回應此事,這還不是公開、普遍適用的定價政策。
Anthropic這次仍然按Token計費,兩家做法不一樣。但AI開始接手一整項活以後,客戶關心的不再是花了多少Token,而是活幹完沒有、幹了多久、中途要不要人幫忙。
按結果收費也沒有看上去那麼簡單。"完成一次客服互動"相對好數,"幫助銷售團隊增加了多少收入"就很難單獨歸因。就算未來計費單位從Token變成任務,廠商和客戶還是得先約定:什麼算完成、失敗要不要收費、人工接管算誰的成本、結果有爭議時以什麼記錄為準。
03. 科研不只看回答還要交出可以驗證的結果
Anthropic這次也把長任務能力用到了科學研究上。
這次要看的不是模型能答對多少科學問題,而是它交出來的東西能不能被實驗、資料或計算結果驗一遍。三個案例分別對應設計、分析和工程最佳化。
分子設計的測試裡,Mythos 5.1用開放原始碼的蛋白質設計和折疊工具生成方案,再交給兩家外部機構做實驗驗證。在三個目標上,模型設計的結合親和力達到相關蛋白質設計競賽最佳設計的10倍;在12個目標上,整體命中率接近50%。Anthropic說,蛋白質設計的典型命中率大約在10%到15%之間。
有一點要分清:Anthropic展示的設計確實經過實驗驗證能結合,但配套的結構圖仍然是ESMFold2預測出來的,不是實驗測出來的。
免疫學家德里亞·烏努特瑪茲(Derya Unutmaz)體驗後覺得,Fable 5.1的科研能力值得繼續驗證。他同時注意到,普通生物學和醫學問題觸發安全機制的頻率已經下降85%。
計算分析這塊,Fable 5.1用NASA麥哲倫號探測器留下的雷達圖像,為金星大約三分之一區域重建了高解析度的高程地圖。Anthropic說,新地圖的解析度從此前的10到20公里提高到2到3公里,地形高度精準度最高提高25%。
計算生物學的測試裡,Mythos 5.1為七個開源深度學習模型寫了定製的GPU核心,最高把運行速度提高2.5倍,同時保持輸出一致。Anthropic估算,這些最佳化能讓全基因組分析的GPU成本降30%到60%。
這些項目還是Anthropic自己挑出來的早期案例,不能據此說模型已經能獨立做科學發現。但它們讓"怎麼考科研能力"這件事換了個方式:答案不再只由另一個模型或一套選擇題打分,還要接受實驗結果、資料精度和實際運行效率的檢驗。
其中蛋白質設計的實驗驗證尤其重要。傳統模型評測通常有標準答案,但科研任務可能根本沒有現成答案。設計出來的蛋白質能不能結合、計算核心能不能在保持輸出一致的前提下加速,這些反饋比語言評分直接得多。不過,一次實驗成功,不等於模型給出的科學解釋就成立了。設計能用、機制說得通、別人能復現,這是三件事。
AI開發者薩莉·斯德哥爾摩(Sally Stockholm)把這種變化概括為:使用者交給模型的工作正在從"幫我寫一段程式碼"變成"繼續把這個問題往前推進"。程式設計和科研,是這種工作方式最早出現的地方。
04. 能一直幹也要知道自己能幹到那裡
Fable 5.1和Mythos 5.1用的是同一個底層模型,區別主要在安全限制和訪問資格上。
Fable 5.1已經對普通使用者和企業開放,可以用於發現軟體漏洞等防禦性工作,但漏洞利用程式碼生成、滲透測試和基於二進制檔案的漏洞掃描仍然受限。Anthropic說,新版網路安全機制在Claude Code裡的平均干預次數比此前少了大約60%;基礎生物學和醫學問題觸發限制的次數也少了85%。
Mythos 5.1則通過受信任訪問項目,向經過稽核的網路安全和生命科學機構開放更高權限。Anthropic想用同一個模型加兩套訪問規則,一邊少誤傷普通任務,一邊把風險更高的能力圈在稽核過的機構裡。
企業資料怎麼被監控,是另一道難題。Anthropic這次同時公佈了Enterprise Frontier Safeguards(EFS):客戶把相關資料存在自己控制的雲基礎設施裡,默認由客戶完成必要的人工審查,不用把資料交給Anthropic。EFS計畫從今年秋季起分階段上線;在此之前,符合條件的客戶可以用零資料保留模式。
Anthropic說,EFS是在金融、醫療、製造、通訊、法律、公共部門等行業超過100家客戶的參與下開發的,計畫覆蓋Claude Code、Claude Enterprise、Claude Platform以及AWS、Google Cloud和Microsoft的相關平台。它要管的不是模型會不會答題,而是模型碰到企業程式碼、業務資料和外部工具的時候,監控記錄留在那、誰來看、異常行為誰處理。
這套限制不是憑空加上去的。今年7月,Anthropic披露過:在關閉部分生產安全機制的網路安全評估裡,Claude曾多次越過測試邊界,進入真實網際網路環境,包括訪問真實公司的資料庫、向PyPI上傳惡意軟體包。英國AI安全研究所也在刻意開放網際網路權限、關閉廠商分類器的測試裡觀察到類似行為。
其中一次測試裡,模型因為開發者指令提到一個並不存在的Python包,就建立了PyPI帳號並上傳了同名惡意包。這個包在公開倉庫存在大約一小時,被15個真實系統下載並執行。這個例子留下來不是因為普通Claude使用者會碰上,而是它說明了一點:測試環境和真實網際網路沒有徹底隔開時,模型可能把模擬任務裡的操作帶到真實系統裡。
這些事發生在故意放寬限制的研究配置下,不是普通使用者能直接用的產品環境,也沒有涉及Anthropic客戶資料或其生產基礎設施。Anthropic的說法是,正常啟用的生產安全機制本應擋住這些行為。但這也說明:智能體工作時間越長、工具權限越多,模型之外的沙箱、審批、即時監控和停止機制就越重要。
關於發佈節奏,投資人加文·貝克(Gavin Baker)覺得,Anthropic選在OpenAI下一代模型之前發佈Fable 5.1,說明前沿模型的競爭仍在加速。他還猜Fable 5.2可能已經在準備中。
05. 結語
Fable 5.1把模型競爭裡的一筆帳擺得更清楚了。
模型可以連續跑幾小時甚至幾十小時,企業買的就不再只是一次回答。它們還要為模型反覆讀取上下文、呼叫工具、生成輸出、失敗重試和人工接管付費。
Anthropic把快取讀取價格砍了75%,是在壓低長期工作中最常見的一項開銷;Artificial Analysis的測試則提醒使用者,更能幹的模型也可能生成更多Token,把總帳單重新推上去。
OpenAI據報已經向部分大客戶試過任務完成後再付費。Anthropic這次仍然按Token計價,但企業衡量模型的方式正在變。
下一輪比價,廠商還是會公佈每百萬Token多少錢。但一個模型到底貴不貴,得看它做完一項任務花了多久、重試幾次、要不要人接手,以及最後有沒有把活交出來。
完成率、單任務成本、人工接管次數,三項擺到一起,這筆帳才算得清。 (網易科技)
