剛剛,Anthropic給Claude裝了隱形臥底!全球生效

AI速讀
Anthropic 近日公開 Claude 文字水印技術,透過修改隨機數選詞機制,使 AI 生成內容可被金鑰驗證,以符合歐盟 AI 法案要求。儘管官方稱不影響輸出品質,但分析指出該技術存在顯著漏洞:短文與事實陳述難以標記,校對內容易產生爭議,且可用低成本 AI 工具高效移除。文章質疑此類水印僅能證明 AI 參與,無法定義所有權,並將其比喻為「圓珠筆不能被視為作者」,挑戰了 AI 內容追溯的實質意義。

你用Claude寫的東西,即將能被全世界查出來!

就在剛剛,Anthropic發了一篇部落格,首次公開解釋了Claude文字水印的技術細節。

最新一批模型已經全部內建,老模型也在適配的路上。

從此,你的助手就成了Anthropic安插的臥底。

Anthropic這篇官博很長,核心就這幾條:

  • 怎麼加的?在選詞環節動了手腳,把隨機數換成了金鑰推導的數。你讀不出來,但拿著金鑰的人驗得出來。
  • 對輸出有影響嗎?官方說沒有。Google拿Gemini做過AB測試,使用者打分沒有差異。
  • 被誰逼的?歐盟AI法案要求標記AI生成內容,全球適用。
  • 有什麼坑?幫你校對的時候測不出來,幫你翻譯的時候全是水印。短文字和純事實幾乎無效,而且分不清是Claude寫的還是Claude改的。
  • 能洗掉嗎?有研究稱用釋義工具跑一遍就能移除98.3%的水印,成本只要4美分。
  • 檢測API?Anthropic說「即將推出」,但細節至今未定。

01. 標記怎麼藏進去的

這麼說吧。

Claude寫字是一個詞一個詞蹦的。每蹦一個詞之前,先算出一堆候選詞,每個帶一個機率。

當好幾個詞機率差不多的時候,選誰都行。「陰沉的天空」和「灰濛蒙的天空」意思一樣,選那個純看隨機數怎麼擲。

水印動的就是這個隨機數。

以前這個隨機數沒有規律,誰也預測不了。現在Anthropic用金鑰算出一串有規律的數把它給替掉了。

最狠的是,Claude不會因此寫出彆扭的句子,也不會突然蹦出一個你沒見過的生僻詞。

但拿著金鑰的人,可以直接從你的文字裡把規律給驗出來。

打個比方。

餐廳裡紅燒肉和糖醋排骨都68塊,口味一樣好,服務員推薦那個看心情。

現在餐廳給服務員發了一本暗號本,上一桌點了魚就推薦紅燒肉,點了雞就推薦糖醋排骨。

一周下來,兩道菜賣出去的總量沒什麼變化。但經理翻一遍點單記錄,就知道那些推薦是按暗號本來的。

這個思路最早是Scott Aaronson 2022年還在OpenAI時提出的。GoogleDeepMind接過去做成了產品級方案SynthID-Text,2024年發在Nature上。

Google曾拿自家Gemini做過實測。他們給一部分真實使用者悄悄開了水印,然後對比有水印和沒水印的使用者反饋,結果發現點贊和點踩在統計上並沒有顯著差異。

值得一提的是,這跟市面上Pangram之類的AI檢測工具完全不同。

那些工具沒有金鑰,只能靠猜文風,猜錯是常態。但有了水印之後,就不用猜了,直接拿驗金鑰就行。

02. 這個臥底比你想的更不靠譜

Anthropic官博裡有這麼一句:水印只作用於Claude「選擇」的詞。

想想這意味著什麼。

先說翻譯。

你寫了一篇中文文章讓Claude翻成英文。每個英文詞都是Claude選的,水印訊號拉滿。但思想和觀點全是你的。

程式碼也有問題。

大部分位置需要精確輸出,水印插不進去。但註釋和變數命名有自由度,水印能嵌進去。

至於會不會產生bug,Anthropic說可以忽略不計。

但對工程師來說,「可以忽略」從來不等於「沒有」。

短文字好不到那去。

寫個一兩百字的郵件回覆,可選擇的詞就那麼幾個,水印根本留不下什麼。

純事實更是死角。

「牛頓最著名的著作叫做Principia……」後面只能跟Mathematica,沒有第二個選項。越是精確表達,水印越沒有發揮空間。

到了校對,水印幾乎失靈。

你寫了三千字的文章丟給Claude改錯別字。它改了二十來個地方,整篇文章99%是你寫的。那二十個改動裡,水印確實留不下多少痕跡。

但問題是,你怎麼證明那99%是你自己寫的?

矽谷知名科技博主Ben Thompson直接開炮:「我很慶幸自己從來沒養成把校對稿直接複製貼上的習慣。」

而且就算水印測出來了,它也回答不了一個關鍵問題:這段話是Claude從頭寫的,還是你寫了初稿、Claude幫你大改的?

Anthropic自己承認,水印只能判斷Claude「可能參與過」,再細就分不了了。

換句話說就是,用過Claude的人,一律得準備自證清白。

03. 4美分擦掉一切

2026年7月的一項研究發現,這種水印的移除率,高達98.3%。

具體來說,研究者把帶水印的文字丟進AI釋義工具,讓AI換個說法重寫一遍。

其中,59篇被檢出水印的文字裡,跑完之後58篇的水印直接消失。

按當前定價,處理一篇千字文章大約4美分。

而且檢測API一旦公開,矛盾還會進一步加深。

因為任何人都能拿它反向最佳化,改一個詞跑一次檢測,直到水印訊號降到安全線以下。

密碼學裡管這叫「逃避預言機」。

所以Anthropic的檢測API至今「即將推出」,細節「仍在確定中」。

05. 圓珠筆不是作者

不過,就算把這些技術問題全部解決,也依然繞不開一個更根本的問題:

你不會因為用Word寫文章,就把Word列為共同作者。

而Anthropic的這種水印,無異於要求一支圓珠筆宣傳自己是作者。

一段文字被追溯到Claude,然後呢?

按照Anthropic官方的說法,水印不改變作品所有權,也不改變法律責任歸屬。

所以現實就是:你的助手留下了記號,但這個記號既證明不了你有罪,也保護不了你清白。 (新智元)