昨天剛剛曝出的Claude 兩款新模型——棉花糖和甜瓜,今天已有實測出現了!
有人實測後發現,兩款新模型在3D強化學習和建築空間佈局上,性能強到可怕。
另外,它們對算力的吞噬也十分瘋狂。
在給出答案前,它們會消耗海量的「思考token」(Thinking Tokens)進行深度邏輯推理,甚至屢次逼近系統的使用上限!
從這款模型看,Claude正在進化為具備「慢思考」、深度空間物理推理能力的下一代 AI 巨獸。
One-Shot 拿下3D強化學習與建築佈局
有人實測後給出評價:Anthropic真的在瘋狂推進3D強化學習。
建築物的空間佈局簡直好得令人髮指,而且這一切都是一步到位(One-Shot)生成的!
要知道,對於LLM,空間想像力一直是個死穴。
讓AI理解一個 3D 房間中桌椅的物理坐標關係、重力法則,或者規劃一個擁有複雜動線和承重結構的建築群佈局,簡直難如登天。
但這次,Claude 的「棉花糖」和「甜瓜」似乎跨越了這道鴻溝。
它們能夠直接理解並生成複雜的3D坐標和空間關係。
而且,實測中發現它們的建築佈局極其優秀,表示新模型在處理拓撲學、幾何學和物理約束時性能也很強大。
並且,它們是One-Shot輸出,不需要人類反覆調整prompt去修正錯誤,模型經過深度的內部思考後,一次性就能輸出完美的3D場景資料。
這背後隱藏著巨大的商業和產業價值。
想像一下,未來的遊戲開發者只需要用自然語言描述:「幫我生成一個中世紀風格的要塞,包含三個防禦塔和一個隱藏的地下通道」,Claude就能直接輸出完美的3D模型程式碼或佈局參數。
建築師可以直接讓AI根據地形和光照條件生成幾十種符合力學結構的初步佈局方案。元宇宙、工業數字孿生、自動駕駛模擬環境的建構……
這一切,都將因為這種強大的 3D 生成能力而被徹底重塑!
棉花糖與甜瓜的雙重暴擊
昨天,全網都被棉花糖和西瓜刷屏了。
這次曝光的兩款模型內部代號分別為 claude-marshmallow-eap(棉花糖) 和 claude-melon-eap(甜瓜)。
這種「食物+EAP」的命名規則,延續了他們在今年7月短暫測試過的 claude-horchata-eap(歐恰塔,一種墨西哥飲料)的傳統。
這兩款模型到底是從那裡冒出來的?
據開發者從 API 流量記錄中截獲的資料顯示,在8月21日的 00:45-00:57Z 期間,claude-marshmallow-ht-eap 的 ID 在 API 流量中被高頻呼叫了 57 次!
隨後,它在 Claude Code 的模型列表中以「Custom model」的身份赫然出現,並達到驚人的100萬 Token 超長上下文窗口。
雖然目前這兩款模型還沒有第一方 API 端點,似乎僅限於紅隊測試人員或內部核心人員使用,但早期的零星測試反饋已經足夠炸裂。
「棉花糖」 的綜合能力被認為略強於「甜瓜」。
在日常對話和邏輯互動中,「棉花糖」的體驗甚至比目前的 Opus 5 還要好,對話顯得更加自然、宜人。
儘管它們目前的表現似乎還在 Anthropic 頂級的「Fable」等級之下,但它們到底是傳說中的 Opus 5.1?Sonnet 5.1?還是全新的 Haiku 迭代?
現在還沒有定論。
算力吞噬者:瘋狂的「思考token」
不僅如此,多位測試者都發現了一個極其反常的現象:這兩個新模型在使用時,對算力的消耗達到了極其瘋狂的地步!
一位測試者在推文中驚呼:「我注意到這兩個模型的一個共同點,它們使用了海量的思考token,以至於我在測試時,多次直接觸發了 <max-tokens>(最大token數)的上限!」
什麼是「思考token」?為什麼它如此重要?
在過去的大模型互動中,AI 往往像是一個「快言快語」的應答者,根據機率分佈,逐字逐句地瞬間生成答案。
而Claude 的新一代模型,徹底改變了這一邏輯。在最終給出答案之前,模型會在後台生成大量的「隱形」Token,用來進行極其深度的自我推演、思維鏈建構和邏輯試錯。
這種「不計成本」的計算力傾注,釋放出了一個極其強烈的訊號: Anthropic 正在暗中攻克 AI 深度推理的瓶頸!
這也印證了此前行業內的猜測——大模型的競爭正在從「訓練階段的算力堆疊)」向「推理階段的算力消耗」轉移。
當 Claude 開始瘋狂「思考」到觸碰上限時,它所輸出的答案質量,將形成對傳統模型的降維打擊。
疑似緊急救火?Opus 5 的「復仇之戰」
這兩款神秘模型的突然洩露,時機也很微妙。
僅僅在不到一個月前的 2026 年 7 月 24 日,Anthropic 剛剛發佈了萬眾矚目的旗艦模型 Opus 5。
在此之前,6月30日發佈的 Sonnet 5 曾廣受好評。
然而,Opus 5卻慘遭滑鐵盧。
有開發者在X上無情嘲笑:「Opus 5 的負面評價實在太嚴重了,以至於 Anthropic 不得不立刻推出兩個新模型來試圖取代它……笑死我了。」
確實,Opus 5 似乎沒能滿足使用者對「跨代際提升」的期待。對於急於上市Anthropic 來說,這無疑是一次重大打擊。
因此,「棉花糖」和「甜瓜」在這個節骨眼上被曝出,引發了外界的無限遐想。
猜想一:Opus 5.1 的絕地反擊。
許多人認為,這兩個與 Opus 5.1 緊密關聯的模型,正是 Anthropic 針對 Opus 5 缺陷進行緊急回爐重造後的「威力加強版」。
通過引入強大的「思考token」機制,強行拔高模型的邏輯天花板。
猜想二:新一代 Sonnet / Haiku 的突襲。
也有測試者認為,考慮到其驚人的速度和性價比,它們可能是 Sonnet 或 Haiku 的更新版,畢竟它們並未被冠以頂級的「Fable」稱號。
但無論是那種情況,Anthropic 顯然已經坐不住了。
他們正在瘋狂加快迭代速度,甚至不惜將極度消耗算力的前沿模型直接下放測試。X
開發者們已經按捺不住激動:「接下來的幾周到幾個月,將會變得極其有趣!」
棉花糖和甜瓜,能否一雪Opus 5的前恥,讓Anthropic再贏一局?(新智元)
