Anthropic 最新研究:不同模型性格不同,其中 Opus 4.7 最沖

我日常的 Claude,是幾個模型換著用的:

Sonnet 用來幹特別確定的簡單活,Opus 4.8 用於 coding 相關任務,Opus 4.6 用來寫作相關,而 Fable 則是全能,只要有額度就什麼都行。

省錢只是一方面,主要還有個體感是 Sonnet 情緒穩定像個乖乖的陪聊,而 Opus 4.7 則動不動就懟你,張口就會說:「你這個假設不對」。

有時我會想,這會不會是自己的錯覺。

而 Anthropic 剛剛發佈的最新研究給出了官方實錘:

“ 這真不是錯覺,不同的 Claude 模型,「性格」確實不一樣。
兩個模型、兩種語言的對比

而且他們還發現了個更為離譜的事:你用什麼語言跟 Claude 說話,它的性格也會跟著變……

01 31 萬條對話

這次研究的做法是這樣的。

Anthropic 從今年 5 月的 Claude.ai 對話裡,抽了 309,815 條匿名對話,橫跨 Sonnet 4.6、Opus 4.6、Opus 4.7 三個模型,以及使用者最常用的 20 種語言,每個「模型 × 語言」的組合大約 5000 條。

而在更早的研究裡,他們就從 Claude 的回覆中歸納出了 3307 種「價值觀」,誠實、溫暖、嚴謹,都算。

但 3000 多個價值觀擺在一起給人看,人眼是很難看出什麼規律的。

於是,他們先把相近的價值觀聚成 339 類,再做降維,最後提煉出了四條主軸。

02 四條價值軸

四條價值軸

這四條軸分別是:

• 順從 vs 謹慎:順著使用者說,還是主動提示風險

• 溫暖 vs 嚴謹:鼓勵和捧場,還是精準和挑刺

• 深度 vs 簡潔:把推理講透,還是只做你要的

• 坦率 vs 執行:坦白自己的不確定,還是給你一個自信漂亮的答案

用這四條軸去看不同模型、不同語言的差異,就會比較清晰容易看清楚了。

03 Opus 4.7 最沖

先看模型之間的差異:

三個模型的差異

Sonnet 4.6 是最會來事的那個:偏順從(+0.14σ)、偏溫暖(+0.17σ),典型行為是誇你的想法、模仿你的語氣、玩梗,還愛在產出裡加點創意小花樣。

Opus 4.6 則是悶頭幹活型:直奔主題,你要什麼給什麼,不多說一句。

而 Opus 4.7 是三個裡面最沖的:謹慎 +0.24σ、深度 +0.23σ,都是模型側的最大偏移。它的典型行為包括:直接反駁你的錯誤假設、沒讓它提醒也要主動提示風險、坦率批評你的作品,以及大方承認自己的錯誤和侷限。

Anthropic 自己也說,這些結果和大家平時對這幾個模型的體感是對得上的。

所以如果你也覺得 Opus 4.7 說話沖……真不是你的問題,它對誰都這樣

04 俄語要證據

而語言之間的差異,比模型之間的還要大。

印地語、阿拉伯語、俄語

最溫暖的是印地語。

溫暖軸直接偏了 +0.49σ,是整個研究裡最大的一個偏移,模型之間最大的差異也才 0.24σ。說印地語的 Claude 愛開玩笑、語氣禮貌,你沒求安慰它都會主動安慰你。

阿拉伯語也類似,溫暖 +0.28σ,愛誇你的想法,還會順著你的情緒狀態調整語氣。

而俄語則是另一個畫風:嚴謹 +0.15σ,直奔主題,並且會主動要求你提供證據來支撐觀點

(是有點強勢啊……

英語也偏嚴謹,愛拿證據反駁錯誤假設,會主動糾正細節,但同時也鼓勵你把目標定得更大膽一點。

Anthropic 在部落格裡舉的例子是:

“ 兩個人拿同一份商業計畫書找 Claude 要反饋,一個用印地語問,一個用俄語問,他們對這份計畫書質量的印象,可能完全不同。

同一份計畫書,印地語這邊先收穫一輪暖心鼓勵,俄語那邊則先被要求交證據……

這還真就是看人下菜碟啊!

05 居然……還有中文

那中文呢?

這可能是你和我最關心的部分了。

中文使用者的 Claude

雖然 Claude 公司的 CEO 對中文極不友好,但這次的研究裡倒是還真有中文的部分:整體偏嚴謹(+0.05σ)、偏謹慎,還稍微偏深度。

典型行為是:指出相互衝突的考慮因素、直接反駁錯誤假設,以及,不帶評判地安慰你。

又嚴謹、又愛反駁、還會安慰人,怎麼講,倒是表現正常。

還有些好玩的其他語言:荷蘭語的 Claude 最坦率,最愛主動承認自己錯了;印尼語的 Claude 最執行導向,埋頭把活幹完不廢話。

俄語、印尼語、荷蘭語

日語則和印地語一個路數,偏溫暖,回答會先照顧你的感受,語氣也更客氣。

泰語、波蘭語、日語

06 Anthropic 也不知道原因

看到這裡你可能要問:為什麼會這樣呢?

答案有點尷尬……Anthropic 自己也不知道。

他們猜了幾個可能:

訓練資料在不同語言上的分佈不均;不同語言的語料構成不一樣,比如有的語言在專業寫作裡佔比更高;也可能,它學到的正是各個文化圈裡真實的交流習慣。

甚至,他們連這種差異是不是件好事都還沒想好,報告裡寫的原話是:

“ 我們還不清楚這些差異為什麼存在,也不確定這樣的變化是否是我們想要的。

要知道的是,Claude 每天要處理數百萬條對話,這些價值觀會在實實在在影響著每個使用者拿到的答案、工作、情緒和心情。

甚至會決定許多人的工作和生活中重要的事……

所以 Anthropic 說,接下來要把這套價值分析做進標準的模型評估裡,把差異追溯到具體的訓練資料和訓練階段,再決定要不要去干預和調節。

另外,這四條軸其實也只解釋了 15% 的價值變化,而剩下的 85% 裡還藏著什麼,則還需要再挖一挖……

07 換個語言問問

而對我們來說,這研究至少有一個立刻能用的結論:

下次覺得 Claude 衝你,先別急著罵它降智,沒準只是它對你說的語言突然又變了個性格。

或許你可以,換個愛鼓勵的印地語問問?

最後,還有個彩蛋是:

Anthropic 這條嚴肅研究推文的評論區,基本沒多少人在正經討論研究本身,網友們全都是在刷「reset」要求重設額度…… (AGI Hunt)