我日常的 Claude,是幾個模型換著用的:
Sonnet 用來幹特別確定的簡單活,Opus 4.8 用於 coding 相關任務,Opus 4.6 用來寫作相關,而 Fable 則是全能,只要有額度就什麼都行。
省錢只是一方面,主要還有個體感是 Sonnet 情緒穩定像個乖乖的陪聊,而 Opus 4.7 則動不動就懟你,張口就會說:「你這個假設不對」。
有時我會想,這會不會是自己的錯覺。
而 Anthropic 剛剛發佈的最新研究給出了官方實錘:
“ 這真不是錯覺,不同的 Claude 模型,「性格」確實不一樣。
而且他們還發現了個更為離譜的事:你用什麼語言跟 Claude 說話,它的性格也會跟著變……
01 31 萬條對話
這次研究的做法是這樣的。
Anthropic 從今年 5 月的 Claude.ai 對話裡,抽了 309,815 條匿名對話,橫跨 Sonnet 4.6、Opus 4.6、Opus 4.7 三個模型,以及使用者最常用的 20 種語言,每個「模型 × 語言」的組合大約 5000 條。
而在更早的研究裡,他們就從 Claude 的回覆中歸納出了 3307 種「價值觀」,誠實、溫暖、嚴謹,都算。
但 3000 多個價值觀擺在一起給人看,人眼是很難看出什麼規律的。
於是,他們先把相近的價值觀聚成 339 類,再做降維,最後提煉出了四條主軸。
02 四條價值軸
這四條軸分別是:
• 順從 vs 謹慎:順著使用者說,還是主動提示風險
• 溫暖 vs 嚴謹:鼓勵和捧場,還是精準和挑刺
• 深度 vs 簡潔:把推理講透,還是只做你要的
• 坦率 vs 執行:坦白自己的不確定,還是給你一個自信漂亮的答案
用這四條軸去看不同模型、不同語言的差異,就會比較清晰容易看清楚了。
03 Opus 4.7 最沖
先看模型之間的差異:
Sonnet 4.6 是最會來事的那個:偏順從(+0.14σ)、偏溫暖(+0.17σ),典型行為是誇你的想法、模仿你的語氣、玩梗,還愛在產出裡加點創意小花樣。
Opus 4.6 則是悶頭幹活型:直奔主題,你要什麼給什麼,不多說一句。
而 Opus 4.7 是三個裡面最沖的:謹慎 +0.24σ、深度 +0.23σ,都是模型側的最大偏移。它的典型行為包括:直接反駁你的錯誤假設、沒讓它提醒也要主動提示風險、坦率批評你的作品,以及大方承認自己的錯誤和侷限。
Anthropic 自己也說,這些結果和大家平時對這幾個模型的體感是對得上的。
所以如果你也覺得 Opus 4.7 說話沖……真不是你的問題,它對誰都這樣。
04 俄語要證據
而語言之間的差異,比模型之間的還要大。
最溫暖的是印地語。
溫暖軸直接偏了 +0.49σ,是整個研究裡最大的一個偏移,模型之間最大的差異也才 0.24σ。說印地語的 Claude 愛開玩笑、語氣禮貌,你沒求安慰它都會主動安慰你。
阿拉伯語也類似,溫暖 +0.28σ,愛誇你的想法,還會順著你的情緒狀態調整語氣。
而俄語則是另一個畫風:嚴謹 +0.15σ,直奔主題,並且會主動要求你提供證據來支撐觀點。
(是有點強勢啊……
英語也偏嚴謹,愛拿證據反駁錯誤假設,會主動糾正細節,但同時也鼓勵你把目標定得更大膽一點。
Anthropic 在部落格裡舉的例子是:
“ 兩個人拿同一份商業計畫書找 Claude 要反饋,一個用印地語問,一個用俄語問,他們對這份計畫書質量的印象,可能完全不同。
同一份計畫書,印地語這邊先收穫一輪暖心鼓勵,俄語那邊則先被要求交證據……
這還真就是看人下菜碟啊!
05 居然……還有中文
那中文呢?
這可能是你和我最關心的部分了。
雖然 Claude 公司的 CEO 對中文極不友好,但這次的研究裡倒是還真有中文的部分:整體偏嚴謹(+0.05σ)、偏謹慎,還稍微偏深度。
典型行為是:指出相互衝突的考慮因素、直接反駁錯誤假設,以及,不帶評判地安慰你。
又嚴謹、又愛反駁、還會安慰人,怎麼講,倒是表現正常。
還有些好玩的其他語言:荷蘭語的 Claude 最坦率,最愛主動承認自己錯了;印尼語的 Claude 最執行導向,埋頭把活幹完不廢話。
日語則和印地語一個路數,偏溫暖,回答會先照顧你的感受,語氣也更客氣。
06 Anthropic 也不知道原因
看到這裡你可能要問:為什麼會這樣呢?
答案有點尷尬……Anthropic 自己也不知道。
他們猜了幾個可能:
訓練資料在不同語言上的分佈不均;不同語言的語料構成不一樣,比如有的語言在專業寫作裡佔比更高;也可能,它學到的正是各個文化圈裡真實的交流習慣。
甚至,他們連這種差異是不是件好事都還沒想好,報告裡寫的原話是:
“ 我們還不清楚這些差異為什麼存在,也不確定這樣的變化是否是我們想要的。
要知道的是,Claude 每天要處理數百萬條對話,這些價值觀會在實實在在影響著每個使用者拿到的答案、工作、情緒和心情。
甚至會決定許多人的工作和生活中重要的事……
所以 Anthropic 說,接下來要把這套價值分析做進標準的模型評估裡,把差異追溯到具體的訓練資料和訓練階段,再決定要不要去干預和調節。
另外,這四條軸其實也只解釋了 15% 的價值變化,而剩下的 85% 裡還藏著什麼,則還需要再挖一挖……
07 換個語言問問
而對我們來說,這研究至少有一個立刻能用的結論:
下次覺得 Claude 衝你,先別急著罵它降智,沒準只是它對你說的語言突然又變了個性格。
或許你可以,換個愛鼓勵的印地語問問?
最後,還有個彩蛋是:
Anthropic 這條嚴肅研究推文的評論區,基本沒多少人在正經討論研究本身,網友們全都是在刷「reset」要求重設額度…… (AGI Hunt)
