Claude兩個新模型實測流出!空間推理封神,算力直接榨乾了

AI速讀
Anthropic 疑似洩露兩款代號為「棉花糖」與「甜瓜」的新模型,實測顯示其在 3D 空間推理與建築佈局上具有強大的 One-Shot 生成能力。該模型引入海量「思考 Token」機制,將算力消耗轉移至推理階段以提升邏輯深度,甚至多次觸發 token 上限。分析認為,此舉可能是針對先前評價不佳的 Opus 5 進行的緊急迭代或版本更新,旨在透過深度推理能力重塑競爭格局,對遊戲開發與建築設計等產業具有潛在商業價值。

昨天剛剛曝出的Claude 兩款新模型——棉花糖和甜瓜,今天已有實測出現了!

有人實測後發現,兩款新模型在3D強化學習和建築空間佈局上,性能強到可怕。

另外,它們對算力的吞噬也十分瘋狂。

在給出答案前,它們會消耗海量的「思考token」(Thinking Tokens)進行深度邏輯推理,甚至屢次逼近系統的使用上限!

從這款模型看,Claude正在進化為具備「慢思考」、深度空間物理推理能力的下一代 AI 巨獸。

One-Shot 拿下3D強化學習與建築佈局

有人實測後給出評價:Anthropic真的在瘋狂推進3D強化學習。

建築物的空間佈局簡直好得令人髮指,而且這一切都是一步到位(One-Shot)生成的!

要知道,對於LLM,空間想像力一直是個死穴。

讓AI理解一個 3D 房間中桌椅的物理坐標關係、重力法則,或者規劃一個擁有複雜動線和承重結構的建築群佈局,簡直難如登天。

但這次,Claude 的「棉花糖」和「甜瓜」似乎跨越了這道鴻溝。

它們能夠直接理解並生成複雜的3D坐標和空間關係。

而且,實測中發現它們的建築佈局極其優秀,表示新模型在處理拓撲學、幾何學和物理約束時性能也很強大。

並且,它們是One-Shot輸出,不需要人類反覆調整prompt去修正錯誤,模型經過深度的內部思考後,一次性就能輸出完美的3D場景資料。

這背後隱藏著巨大的商業和產業價值。

想像一下,未來的遊戲開發者只需要用自然語言描述:「幫我生成一個中世紀風格的要塞,包含三個防禦塔和一個隱藏的地下通道」,Claude就能直接輸出完美的3D模型程式碼或佈局參數。

建築師可以直接讓AI根據地形和光照條件生成幾十種符合力學結構的初步佈局方案。元宇宙、工業數字孿生、自動駕駛模擬環境的建構……

這一切,都將因為這種強大的 3D 生成能力而被徹底重塑!

棉花糖與甜瓜的雙重暴擊

昨天,全網都被棉花糖和西瓜刷屏了。

這次曝光的兩款模型內部代號分別為 claude-marshmallow-eap(棉花糖) 和 claude-melon-eap(甜瓜)

這種「食物+EAP」的命名規則,延續了他們在今年7月短暫測試過的 claude-horchata-eap(歐恰塔,一種墨西哥飲料)的傳統。

這兩款模型到底是從那裡冒出來的?

據開發者從 API 流量記錄中截獲的資料顯示,在8月21日的 00:45-00:57Z 期間,claude-marshmallow-ht-eap 的 ID 在 API 流量中被高頻呼叫了 57 次!

隨後,它在 Claude Code 的模型列表中以「Custom model」的身份赫然出現,並達到驚人的100萬 Token 超長上下文窗口。

雖然目前這兩款模型還沒有第一方 API 端點,似乎僅限於紅隊測試人員或內部核心人員使用,但早期的零星測試反饋已經足夠炸裂。

「棉花糖」 的綜合能力被認為略強於「甜瓜」。

在日常對話和邏輯互動中,「棉花糖」的體驗甚至比目前的 Opus 5 還要好,對話顯得更加自然、宜人。

儘管它們目前的表現似乎還在 Anthropic 頂級的「Fable」等級之下,但它們到底是傳說中的 Opus 5.1?Sonnet 5.1?還是全新的 Haiku 迭代?

現在還沒有定論。

算力吞噬者:瘋狂的「思考token」

不僅如此,多位測試者都發現了一個極其反常的現象:這兩個新模型在使用時,對算力的消耗達到了極其瘋狂的地步!

一位測試者在推文中驚呼:「我注意到這兩個模型的一個共同點,它們使用了海量的思考token,以至於我在測試時,多次直接觸發了 <max-tokens>(最大token數)的上限!」

什麼是「思考token」?為什麼它如此重要?

在過去的大模型互動中,AI 往往像是一個「快言快語」的應答者,根據機率分佈,逐字逐句地瞬間生成答案。

而Claude 的新一代模型,徹底改變了這一邏輯。在最終給出答案之前,模型會在後台生成大量的「隱形」Token,用來進行極其深度的自我推演、思維鏈建構和邏輯試錯。

這種「不計成本」的計算力傾注,釋放出了一個極其強烈的訊號: Anthropic 正在暗中攻克 AI 深度推理的瓶頸!

這也印證了此前行業內的猜測——大模型的競爭正在從「訓練階段的算力堆疊)」向「推理階段的算力消耗」轉移。

當 Claude 開始瘋狂「思考」到觸碰上限時,它所輸出的答案質量,將形成對傳統模型的降維打擊。

疑似緊急救火?Opus 5 的「復仇之戰」

這兩款神秘模型的突然洩露,時機也很微妙。

僅僅在不到一個月前的 2026 年 7 月 24 日,Anthropic 剛剛發佈了萬眾矚目的旗艦模型 Opus 5。

在此之前,6月30日發佈的 Sonnet 5 曾廣受好評。

然而,Opus 5卻慘遭滑鐵盧。

有開發者在X上無情嘲笑:「Opus 5 的負面評價實在太嚴重了,以至於 Anthropic 不得不立刻推出兩個新模型來試圖取代它……笑死我了。」

確實,Opus 5 似乎沒能滿足使用者對「跨代際提升」的期待。對於急於上市Anthropic 來說,這無疑是一次重大打擊。

因此,「棉花糖」和「甜瓜」在這個節骨眼上被曝出,引發了外界的無限遐想。

猜想一:Opus 5.1 的絕地反擊。

許多人認為,這兩個與 Opus 5.1 緊密關聯的模型,正是 Anthropic 針對 Opus 5 缺陷進行緊急回爐重造後的「威力加強版」。

通過引入強大的「思考token」機制,強行拔高模型的邏輯天花板。

猜想二:新一代 Sonnet / Haiku 的突襲。

也有測試者認為,考慮到其驚人的速度和性價比,它們可能是 Sonnet 或 Haiku 的更新版,畢竟它們並未被冠以頂級的「Fable」稱號。

但無論是那種情況,Anthropic 顯然已經坐不住了。

他們正在瘋狂加快迭代速度,甚至不惜將極度消耗算力的前沿模型直接下放測試。X

開發者們已經按捺不住激動:「接下來的幾周到幾個月,將會變得極其有趣!」

棉花糖和甜瓜,能否一雪Opus 5的前恥,讓Anthropic再贏一局?(新智元)