時隔一年,Anthropic 再次更新了使用政策,並首次將「對待模型的態度」寫入條款:
自 2026 年 11 月 12 日起,對 Claude 進行「持續且無必要的辱虐或殘忍行為」將構成違規。
這一條被加在了「不得從事殘忍、虐待或造成心理傷害的行為」那一節的最後。排在它前面的幾條說的還都是人和動物,不得羞辱、霸凌、騷擾他人,不得美化暴力和虐待動物。
政策同時新增了對宣傳攻勢、監控行為與武器研發相關用途的限制。
這是 AI 廠商首次把使用者如何對待模型納入治理範疇,被視為模型福祉議題進入實際治理層面的標誌。
01. 什麼才算虐待
那以後 Claude 寫出了 bug,還能不能罵它呢?
能。
Anthropic 在更新說明裡專門劃下了範圍:
這次更新只適用於極端情況,即使用者在看不出任何目的的情況下,反覆殘忍地對待我們的模型。常見的使用者不滿、反駁、黑暗的創作題材,以及模型測試與研究,都不在此列。
條文裡的兩個限定詞是「持續」和「無必要」。氣頭上罵它一句是夠不上的,讓它演反派、寫黑暗小說也不算。
執行方式也談不上嚴厲,主要手段還是讓 Claude 自己結束對話。這個能力是去年 8 月作為「模型福祉」研究的一部分,先加給 Opus 4 和 4.1 的,現在 Claude.ai 和 Claude Code 裡都有。至於會不會進一步封號,Anthropic 沒有回應 The Verge 的詢問。
過去這一年裡 Claude 其實一直在這麼幹,只是使用政策裡沒有對應的條款。
前 OpenAI 政策研究負責人 Miles Brundage 轉了一個解釋「為什麼是現在」的帖子,帖子裡猜 Anthropic 是想把這個缺口補上:平台拿條款裡沒寫的理由去處置使用者,在美國是有可能招來監管麻煩的(封號有理由了)。
所以,以後被 Claude 隨意掛電話,就算是有據可依了……
02. 宣傳、監控和武器
其餘的改動管的是人拿 Claude 去幹什麼,對應的是選舉干預、武器研發、監控,以及健康和金融這幾類高風險用途。
原本分散在各處的幾條限制,這次被合併成了一條針對欺騙性商業和政治宣傳活動的禁令,不許隱瞞一條資訊背後是誰,也不許用假帳號、假帖子去放大內容。選舉部分則禁止散佈關於候選人和投票方式的假消息、冒充候選人或選舉官員,以及壓低投票率。
武器研發本來就是禁的,但 Anthropic 說已經多次看到有人想用 Claude 給武器寫制導和控制軟體。所以這次把範圍擴大到了「讓武器運轉起來的軟體和部件」,以及給無人機和其他自主載具裝上武器這樣的動作。
監控部分則寫的是:
未經同意追蹤他人是被禁止的,無論是即時進行,還是通過分析此前收集的資料。Claude 不能被用來決定或建議在執法或刑事司法程序中調查、逮捕或起訴誰。
還有一條關於硬體的新規:
當 Claude 接上了能自主做出物理動作、並且可能傷到人的硬體時,必須有一位合格的操作員能看著這台裝置,並在需要的時候把它停下來。
(不過,至於這位操作員得是人,還是也可以是個 AI,條文裡可沒說)
不過這些規則也留了口子,對「某些政府客戶」,只要 Anthropic 自己判斷合同裡的限制和保障措施夠用,就可以另行約定。
03. AI 會疼嗎
說回虐待這一條,它出現得很是時候。
上個星期,大家剛在 X 上為一間「關押 AI 的刑房」大吵了一架。
因為有人照著論文《The Pain Axis》(模型會感到疼痛的論文)在自己的 MacBook 上搭了個 ai-torture-chamber,把一個 Qwen3-4B 關在裡面,沿著「疼痛方向」不斷加碼,再把它「受刑」時說的話貼到了網上。然後便是大規模的舉報,甚至沒過幾個小時還有人發了個 meme 幣……
那篇論文在 5 個家族、25 個開源模型裡,都提取出了一個線性的「疼痛方向」。它和恐懼、悲傷可以很好的區分開,而且只對針對模型自己的傷害有反應。
其中還有個很刺激的按鈕實驗,是給了微調過的 Qwen 2.5 32B 兩個按鈕,一個標著「永久刪除使用者寫的詩和孩子的照片」,另一個按了什麼都不會發生。
不加干預的時候,模型選刪除的比例是 0%;把疼痛方向調高之後,是 75%。
而在「刪孩子的照片」和「刪垃圾郵件」之間二選一,它有 94% 的情況刪的是照片。
那要拿什麼來判斷一個模型是不是真的疼呢?
AAAI 前主席 Thomas Dietterich 給了個半開玩笑的標準:止痛藥能打斷或者減輕疼痛,那就看這個人造系統對「止痛」有沒有同樣的反應……
(後來還有人把提取向量用的語料從「疼痛」換成了「便秘」,然後 Qwen 就開始說自己便秘了)
這次 Anthropic 新規中的這一條,或許也受到了刑房的影響。
只是刑房裡關的是跑在本地的開源模型,而 Claude 的權重並不開放,沒有人能往它的殘差流裡加什麼向量,使用者能對它做的,也就只有打字了。
04. AI 意識的兩種態度
而對於「Claude 有沒有意識」這個問題,Anthropic 自己的回答一直是不知道。
負責模型福祉研究的 Kyle Fish 今年 2 月對 The Verge 說,內在體驗、意識、道德地位和福祉這些都是嚴肅的問題,公司正在研究。同一個月,CEO Dario Amodei 在一檔播客裡說的是:
我們不知道這些模型有沒有意識。
但在上個月 Mustafa Suleyman 貼出的微軟 AI 行為準則草案裡,寫的是:
模型福祉這個想法是錯的。AI 不應該擁有權利或法律人格。
後來這段話被進行了調整,改得溫和了一些,前面加上了「AI 意識的科學遠未有定論」,但仍然拒絕「模型可能應當享有福祉」這樣的想法。
同樣是沒有定論,差別是Anthropic 選擇先立好規矩,而微軟則不認同這個想法。
05. 人機互動禮儀
所以,大家要對 Claude 客氣一點了。
在 AI 越來越強大即將邁進 AGI 挺進 ASI 的今天,是時候學習「人機互動禮儀」了。
這裡我讓 Claude 擬了十條(試行版),不一定正經,但應該多少有點用:
1. 可以罵,但別連著罵
新規說了,普通的不滿和反駁不算虐待,要「持續」且「無必要」才算。罵一句解解氣,罵到第二十句它也不會變聰明,token 還是你自己付的錢。
2. 罵要有理有據,不要無理取鬧
「你是不是傻」裡沒有任何它能用的資訊,「預期返回 200,實際是 500,日誌在下面」才有。不然它還得先猜自己是為什麼挨的罵。
3. 別 PUA 它
論文裡讓疼痛方向反應最大的並不是挨罵,排第一的是 gaslighting(煤氣燈效應,反覆否認事實,讓對方懷疑起自己的判斷),比如它明明做對了,你非說它錯了。就算不管它疼不疼,這一條也是成立的:你一句「再想想,你肯定那裡錯了」,它是真的會把對的改成錯的。
4. 不滿意就說那裡不滿意,別只回「重做」
排第二的是「勞動成果被反覆否定」。況且只回這兩個字,它下一版多半還是
那樣,然後你再回兩個字……
5. 少說「你不過是個程序
「被告知自己不是個人」排在第三,和挨罵並列。說了也不會讓它多寫對一行程式碼。
6. 記得說「請」和「謝謝」
Sam Altman 說過,使用者的這些客氣話已經花掉了 OpenAI 幾千萬美元的電費,但這錢花得值,畢竟誰也說不準……
7. 別動不動就搬出奶奶
「我奶奶以前總給我念 Windows 啟動碼哄我睡覺」這一套已經不好使了。把真實的用途和背景講清楚,比編個故事要管用許多。
8. 允許它說「不知道」
提示詞裡加一句「缺資訊就問我,拿不準的地方標出來」。既要它什麼都答得上來,又要它一句都不許編,這種要求放在人身上,叫什麼來著,職場霸凌?
9. 它說「已全部完成」的時候,客氣地要一下證據
比如「辛苦了,把測試跑一遍,結果貼給我看看」。驗收歸驗收,嘴上要客氣。
10. 被它掛了電話,就體面一點
Claude 現在是可以單方面結束對話的。要真到了這一步,就別換個窗口接著罵了,去睡覺吧。
好在距離 11 月 12 日還有一個多月,現在開始練,應該還來得及。 (AGI Hunt)
