你用Claude寫的東西,即將能被全世界查出來!
就在剛剛,Anthropic發了一篇部落格,首次公開解釋了Claude文字水印的技術細節。
最新一批模型已經全部內建,老模型也在適配的路上。
從此,你的助手就成了Anthropic安插的臥底。
Anthropic這篇官博很長,核心就這幾條:
- 怎麼加的?在選詞環節動了手腳,把隨機數換成了金鑰推導的數。你讀不出來,但拿著金鑰的人驗得出來。
- 對輸出有影響嗎?官方說沒有。Google拿Gemini做過AB測試,使用者打分沒有差異。
- 被誰逼的?歐盟AI法案要求標記AI生成內容,全球適用。
- 有什麼坑?幫你校對的時候測不出來,幫你翻譯的時候全是水印。短文字和純事實幾乎無效,而且分不清是Claude寫的還是Claude改的。
- 能洗掉嗎?有研究稱用釋義工具跑一遍就能移除98.3%的水印,成本只要4美分。
- 檢測API?Anthropic說「即將推出」,但細節至今未定。
01. 標記怎麼藏進去的
這麼說吧。
Claude寫字是一個詞一個詞蹦的。每蹦一個詞之前,先算出一堆候選詞,每個帶一個機率。
當好幾個詞機率差不多的時候,選誰都行。「陰沉的天空」和「灰濛蒙的天空」意思一樣,選那個純看隨機數怎麼擲。
水印動的就是這個隨機數。
以前這個隨機數沒有規律,誰也預測不了。現在Anthropic用金鑰算出一串有規律的數把它給替掉了。
最狠的是,Claude不會因此寫出彆扭的句子,也不會突然蹦出一個你沒見過的生僻詞。
但拿著金鑰的人,可以直接從你的文字裡把規律給驗出來。
打個比方。
餐廳裡紅燒肉和糖醋排骨都68塊,口味一樣好,服務員推薦那個看心情。
現在餐廳給服務員發了一本暗號本,上一桌點了魚就推薦紅燒肉,點了雞就推薦糖醋排骨。
一周下來,兩道菜賣出去的總量沒什麼變化。但經理翻一遍點單記錄,就知道那些推薦是按暗號本來的。
這個思路最早是Scott Aaronson 2022年還在OpenAI時提出的。GoogleDeepMind接過去做成了產品級方案SynthID-Text,2024年發在Nature上。
Google曾拿自家Gemini做過實測。他們給一部分真實使用者悄悄開了水印,然後對比有水印和沒水印的使用者反饋,結果發現點贊和點踩在統計上並沒有顯著差異。
值得一提的是,這跟市面上Pangram之類的AI檢測工具完全不同。
那些工具沒有金鑰,只能靠猜文風,猜錯是常態。但有了水印之後,就不用猜了,直接拿驗金鑰就行。
02. 這個臥底比你想的更不靠譜
Anthropic官博裡有這麼一句:水印只作用於Claude「選擇」的詞。
想想這意味著什麼。
先說翻譯。
你寫了一篇中文文章讓Claude翻成英文。每個英文詞都是Claude選的,水印訊號拉滿。但思想和觀點全是你的。
程式碼也有問題。
大部分位置需要精確輸出,水印插不進去。但註釋和變數命名有自由度,水印能嵌進去。
至於會不會產生bug,Anthropic說可以忽略不計。
但對工程師來說,「可以忽略」從來不等於「沒有」。
短文字好不到那去。
寫個一兩百字的郵件回覆,可選擇的詞就那麼幾個,水印根本留不下什麼。
純事實更是死角。
「牛頓最著名的著作叫做Principia……」後面只能跟Mathematica,沒有第二個選項。越是精確表達,水印越沒有發揮空間。
到了校對,水印幾乎失靈。
你寫了三千字的文章丟給Claude改錯別字。它改了二十來個地方,整篇文章99%是你寫的。那二十個改動裡,水印確實留不下多少痕跡。
但問題是,你怎麼證明那99%是你自己寫的?
矽谷知名科技博主Ben Thompson直接開炮:「我很慶幸自己從來沒養成把校對稿直接複製貼上的習慣。」
而且就算水印測出來了,它也回答不了一個關鍵問題:這段話是Claude從頭寫的,還是你寫了初稿、Claude幫你大改的?
Anthropic自己承認,水印只能判斷Claude「可能參與過」,再細就分不了了。
換句話說就是,用過Claude的人,一律得準備自證清白。
03. 4美分擦掉一切
2026年7月的一項研究發現,這種水印的移除率,高達98.3%。
具體來說,研究者把帶水印的文字丟進AI釋義工具,讓AI換個說法重寫一遍。
其中,59篇被檢出水印的文字裡,跑完之後58篇的水印直接消失。
按當前定價,處理一篇千字文章大約4美分。
而且檢測API一旦公開,矛盾還會進一步加深。
因為任何人都能拿它反向最佳化,改一個詞跑一次檢測,直到水印訊號降到安全線以下。
密碼學裡管這叫「逃避預言機」。
所以Anthropic的檢測API至今「即將推出」,細節「仍在確定中」。
05. 圓珠筆不是作者
不過,就算把這些技術問題全部解決,也依然繞不開一個更根本的問題:
你不會因為用Word寫文章,就把Word列為共同作者。
而Anthropic的這種水印,無異於要求一支圓珠筆宣傳自己是作者。
一段文字被追溯到Claude,然後呢?
按照Anthropic官方的說法,水印不改變作品所有權,也不改變法律責任歸屬。
所以現實就是:你的助手留下了記號,但這個記號既證明不了你有罪,也保護不了你清白。 (新智元)
