“價格打骨折”
距離上一代Haiku發佈快一年,Anthropic終於更新了這條最小號的產品線。
美國當地時間10月7日,Claude Haiku 5.5正式上線。最引人注意的是價格:輸入每百萬token僅0.1美元,輸出0.5美元,直接降至上一代Haiku 4.5的十分之一,也與OpenAI上個月發佈的GPT-6 Luna持平。
但Anthropic這次顯然不只是來打價格戰的。
作為一款定位更輕量、速度更快的模型,Haiku 5.5這次重點補上了Haiku 4.5在程式設計、電腦操作和知識工作上的短板。
與此同時,它還加入了可調模式,支援100萬token上下文窗口,並帶來了Sonnet快取價格下調和訂閱使用者API積分,這次發佈更像是Anthropic的一次全線調價。
小模型的戰爭,從比誰更便宜,進入了比誰又便宜又好用的階段。
01. 小模型不再“湊合用”
Haiku 4.5發佈於將近一年前。當時,它已經是Anthropic面向速度和成本最佳化的小模型,但放到今天的新一代模型競爭中,短板已經越來越明顯。GDPval-AA知識工作測試只有735分,OSWorld電腦操作15.7%,Terminal-Bench程式設計乾脆是0分。
Haiku 5.5則把這些短板幾乎全補上了。
在知識工作、電腦操作和程式設計等測試中,Haiku 5.5相比上一代都有明顯提升。其中,GDPval-AA v2.1拿到1620分,是Haiku 4.5的兩倍多,也超過了GPT-6 Luna的1437分。
AA-Briefcase知識工作測試中,Haiku 5.5達到1578分,同樣高於Luna的1336分。OSWorld 2.1離線子集得分72.4%,Luna為48.9%,Haiku 4.5則只有15.7%。
程式設計能力的提升尤其明顯。Terminal-Bench 4.0中,Haiku 4.5此前得分為0%,Haiku 5.5已經提升至39.2%。
第三方測評機構Artificial Analysis給出的智能指數為43分,比Haiku 4.5提升26分,略高於GLM-5.3 Flash的42分和Gemini 3.8 Flash的41分,與Kimi K3的44分相當,低於自家Sonnet 5.5的56分。
在智能知識工作上,Haiku 5.5(Max模式)在AA-Briefcase上達到1578 Elo,領先於Kimi K3和GLM-5.3等模型,與Muse Spark 1.3(Max模式)相當。
不過小模型畢竟是小模型,事實知識方面還有差距。AA-Omniscience精準率只有36%,而Gemini 3.8 Flash是55%,GPT-6 Luna是44%。
還有一項測試Haiku 5.5表現不太好:AutomationBench-AA只拿了35%,而Luna、Gemini 3.8 Flash和GLM-5.3 Flash都在53%到60%之間。Artificial Analysis指出,這可能是因為安全策略導致模型過度拒絕,Anthropic正在修復,修復後分數預計會上升。
另外,Haiku 5.5是首款支援可調模式設定的Haiku模型,默認採用Medium模式,共提供Low、Medium、High、xhigh和Max五檔。模式越高,模型會投入更多計算資源,通常也能獲得更好的表現,但token消耗也會隨之增加。
02. 便宜到可以隨便用
參數和跑分是一回事,實際用起來是另一回事。Haiku 5.5發佈當天,不少開發者就上手試了,留下了各種有意思的測試。
獨立開發者西蒙·威廉姆森(Simon Willison)拿它試了生成鵜鶘騎自行車的SVG圖。在Low模式下,Haiku 5.5 7秒鐘花了0.0936美分,鵜鶘的自行車車架還算完整。Max模式下,耗時5分9秒,但也只花了3.3826美分。
生成的描述裡,白鵜鶘戴著紅帽子,長橙腿踩在橙色踏板上,一隻灰翅膀伸出去握車把,大喙指向前方,身後有白色速度線,頭頂是太陽和雲彩。作為對比,一年前Haiku 4.5畫的鵜鶘“身體是圓的黃褐色,喙是粉色的”,基本不對。
AI分析師@NFT_Chen做了斑馬草原SVG的對比測試。
Haiku生成的斑馬,條紋順著身體走向,奔跑時前後腿錯開,近草有層次、遠樹壓在山脊上,斑馬踩進草裡有塵土和影子。而Luna的斑馬“亂線穿腹,肚子鼓成橢圓,腿像木棍亂戳”,背景的樹像貼上去的剪影,斑馬浮在畫面中間和草地對不齊。
@NFT_Chen總結稱: “同一張草原,一個在跑,一個在漂。競爭讓世界更美好,前提是先畫對!”
但也不是所有測試Haiku都贏。
AI基準測評帳號@bridgemindai做了熔岩燈測試,Haiku 5.5“完全無法通過”,生成的東西“沒有玻璃,沒有熔岩,只是一個黃色圓柱體”,耗時4分34秒,成本0.03美元。而GPT-6 Luna在42.8秒內做出了一個真正的熔岩燈,成本不到一美分,速度快6倍以上。
@bridgemindai的火箭發射測試也是類似的結果。Haiku花了0.05美元、6分58秒建構了一個乾淨的場景,而Luna用不到一分錢、1分5秒就完成了,速度快了6倍。
企業客戶的反饋更偏向實際場景。Asana的高級軟體工程師亞倫·文(Aaron Vinh)說,他們把Haiku 5.5用在AI Teammates產品上,處理bug分類、項目搭建、搜尋大型項目組合等任務,任務完成延遲降低了30%以上,每個代理輪次的推理速度最快提升2.5倍。
Box的AI產品副總裁亞紹達·巴夫納尼(Yashodha Bhavnani)表示,Haiku 5.5比Haiku 4.5得分高11分,延遲只有大約一半,適合大規模運行的分析工作,比如成本報告、財務摘要和每周定期回顧。
03. 90%降價背後的算盤
Haiku 5.5最引人注目的還是價格。10萬token以內的請求,輸入每百萬0.1美元,輸出0.5美元,快取讀取只要0.01美元,快取寫入0.125美元。相比Haiku 4.5的1美元輸入、5美元輸出,降價幅度達到90%。
不過這裡有個門檻:超過10萬token之後,Haiku 5.5價格漲到5倍:輸入0.5美元、輸出2.5美元、快取讀取0.05美元、快取寫入0.625美元。即便如此,也比上代模型便宜了50%。
Anthropic對此解釋稱,大約90%的Haiku 4.5請求都在10萬token以下,所以對大多數使用者來說,相當於直接打了一折。考慮到新的分詞器會多用大約25%的token,整體平均節省大約75%。
除了Haiku本身的降價,Anthropic還順帶調了Sonnet 5.5的價格。Sonnet的快取讀取從每百萬token 0.2美元砍到0.1美元,正好是原來的一半。因為快取讀取在智能體工作中佔了很大比例,Anthropic估算大多數智能體任務的成本能降約20%。
還有一項新福利是給訂閱使用者的API積分。Max 5x使用者每月100美元,Max 20x使用者每月200美元,Team訂閱使用者最多500美元(團隊共享)。積分可以用在平台上任何模型上,而且正好等於訂閱費本身,相當於訂閱費全額返還成API額度。威廉姆森評價這“真的很慷慨”,讓訂閱使用者用API的門檻低了很多。積分當月有效,不滾存。
04. 小模型大戰開打
Haiku 5.5的發佈,把小模型賽道的競爭推向了白熱化。
在此之前,OpenAI的GPT-6 Luna憑藉0.1美元的低價和不錯的性能,在小模型領域幾乎沒有對手。現在Anthropic直接把價格拉平,性能上還略佔優勢。
但如果把視野放寬到全球,情況更複雜。中國的幾個小模型價格更低。Qwen3.7 Flash在阿里國際站上,3.2萬token以內輸入只要0.03美元、輸出0.13美元;3.2萬到25.6萬token之間是0.1美元輸入、0.4美元輸出,比Haiku還便宜。智譜的GLM-5.3-Flash在GDPval-AA v2.1上拿了1647分,比Haiku 5.5的1620還略高一點。
威廉姆森提到,Haiku 4.5剛出來的時候還不算貴,但一年過去,競品已經把價格打到了它的十分之一。這次Haiku 5.5追平Luna的價格,更像是被動應戰,而不是主動引領。
從定位上看,Anthropic給Haiku 5.5安排的角色很明確——干雜活的。文件摘要、資訊分類、資料庫查詢、給大模型當子智能體、即時客服、瀏覽器操作,這些量大、對速度敏感、對極致精度要求不那麼高的任務,是Haiku的主戰場。複雜的編碼工作還是交給Sonnet和Opus。
TechCrunch記者弗雷德里克·拉迪努瓦(Frédéric Lardinois)指出,決策模型(比如Jev)現在也在這個價格帶裡攪局,而且價格更低。小模型的用途正在從傳統的摘要分類,擴展到智能體工作流裡的各種輕量任務。
對開發者來說,真正的考驗,是Haiku 5.5能不能穩定、可靠地完成那些目標明確、邊界清晰的任務,並且經得起反覆呼叫。價格降了這麼多,使用門檻確實低了不少,但跑分和實際體驗之間仍有距離,最終能不能成為開發者願意長期使用的工具,還需要更多項目和實際應用來驗證。 (騰訊科技)
