Anthropic所為被列入“歷史上規模最大的智慧財產權盜竊之一”

AI速讀
AI巨頭Anthropic被索尼與華納音樂起訴,指控其非法使用數萬首音樂作品訓練Claude模型,潛在賠償金達數十億美元。案件核心在於Anthropic早期透過BT下載等盜版路徑獲取數據,即便訓練行為本身可能被認定為「合理使用」,但非法獲取資料的過程仍構成侵權。此案在Anthropic準備IPO之際爆發,將迫使AI公司面對資料來源的透明度問題。同時,音樂產業展現出明確策略:嚴厲打擊未授權盜用,但願意與遵守授權體系的AI公司(如Suno、Stability AI)合作共贏。

2026年8月28日,美國加利福尼亞北區聯邦地區法院收到了一份厚達48頁的訴狀。

原告席上,是索尼音樂出版、華納查普爾音樂及其數十家關聯出版實體;被告席上,除了人工智慧公司Anthropic,還有其聯合創始人兼CEO達里歐·阿莫迪(Dario Amodei)以及聯合創始人本傑明·曼(Benjamin Mann)。

這些音樂出版商指控Anthropic通過BT下載、網頁抓取和第三方資料集等方式,大規模獲取受版權保護的作品,並將其中的歌詞、樂譜等內容用於Claude模型訓練。

原告將其稱為“歷史上規模最大、最公然且仍在持續的智慧財產權盜竊之一”。

訴狀涉及“數萬首”音樂作品。按照原告提出的計算方式,如果法院最終認定構成故意侵權,美國版權法允許每部作品判處最高15萬美元法定賠償;刪除或者修改版權管理資訊,還可能導致每項違法行為最高2.5萬美元的法定賠償。

這意味著,Anthropic面臨的理論賠償風險可能達到數十億美元。



Anthropic並不同意出版商的主張。公司發言人表示,Anthropic將在法庭上積極為自己辯護。

這場訴訟發生在一個極其敏感的時間點。

2026年6月,Anthropic正式確認,已經向美國證券交易委員會秘密提交IPO申請檔案。8月27日,美國科技媒體The Information又報導稱,Anthropic準備在美國勞動節之後公開招股檔案,最快可能於9月底至10月初上市。

就在三個月前,Anthropic剛完成650億美元融資,投後估值達到9650億美元。公司當時披露,其年化收入已經超過470億美元。

與此同時,另一場由作家群體發起的版權集體訴訟,剛剛以Anthropic支付15億美元為條件獲得法院最終批准。

在即將接受公開市場審視之際,索尼和華納提起的新訴訟,又撬開了Anthropic最不願面對的一段資料獲取歷史。


01 700多萬本盜版書

達里歐·阿莫代,首席執行長(左),本傑明·曼(圖片來源:Anthropic)

時間倒回2021年6月。

Anthropic成立還不到半年,本傑明·曼開始尋找能夠迅速擴大模型訓練語料的資料來源。他最後把目光投向了Library Genesis,也就是LibGen。

這個長期被出版行業視為盜版“影子圖書館”的網站,存有數量龐大的電子書。

後來公開的法院材料顯示,曼代表Anthropic使用BitTorrent協議,從LibGen下載了至少約500萬本電子書。2022年7月,Anthropic團隊又從另一個盜版資源庫Pirate Library Mirror,也就是PiLiMi,下載了至少約200萬本電子書。

在此前的Bartz訴Anthropic案中,美國聯邦地區法官威廉·阿爾蘇普(William Alsup)認定,這些電子書屬於盜版內容,並將Anthropic的相關行為形容為“簡單直接的盜版,只是規模巨大”。

這700多萬本書原本讓Anthropic捲入的是作家版權糾紛,現在卻成了音樂出版商發起新訴訟的證據入口。

索尼和華納在訴狀中稱,LibGen和PiLiMi裡的內容不只有小說、教材和非虛構作品,也包括歌詞集、樂譜集和其他音樂出版物。

訴狀列舉的作品包括《Livin’ on a Prayer》《September》《Great Balls of Fire》《Ramblin’ Man》和《Hallelujah》等經典歌曲。

與許多隻能通過模型輸出反推訓練資料的AI版權案件不同,這一次,音樂出版商已經擁有另一場訴訟留下的內部檔案和司法記錄。

訴狀援引公開材料稱,曼曾在Anthropic內部將LibGen形容為“sketchy AF”,大意是“非常可疑”。Anthropic內部的Archive Team也曾將這個網站描述為對版權的公然侵犯。

此前法院還認定,曼知道自己從LibGen取得的數百萬本電子書屬於盜版內容。

索尼和華納因此將阿莫迪和曼一併列為被告。

出版商認為,曼親自參與了早期下載,阿莫迪則對資料集獲取擁有審批權,並批准了相關行動。訴狀據此要求兩人對BT下載行為承擔直接或者幫助侵權責任。

Anthropic是否構成侵權,兩位創始人是否需要承擔個人責任,都仍有待法院審理。

但對Anthropic而言,案件的麻煩在於,原告不再只是在猜測Claude可能使用過那些資料,而是試圖利用已經公開的內部資料,重建Anthropic早期獲取訓練語料的完整過程。


02  從網頁抓取到“拆書掃描”


BT下載只是Anthropic被指控的資料獲取路徑之一。

按照新訴狀的說法,Claude使用的歌詞還可能來自公開網頁、Common Crawl等大型網路資料集,以及Books3和The Pile等第三方訓練集。

幾個來源疊加在一起,意味著同一首歌可能在不同資料集中重複出現。

索尼和華納尤其提到了Musixmatch和LyricFind。

這兩家網站通過授權向使用者展示歌詞。音樂出版商認為,網站獲得歌詞展示許可,並不意味著第三方可以將網頁裡的歌詞批次複製下來,用於商業模型訓練。

訴狀稱,Anthropic可能通過自己的網路爬蟲或者第三方抓取資料獲得這些內容,其下載的Common Crawl資料裡也包含來自上述歌詞網站的頁面。

此前Bartz案查明,曼在Anthropic創立早期取得過196640份Books3中的未經授權圖書。

Anthropic內部資料一方面肯定這個資料集“質量高”,另一方面也討論過其可疑的法律狀態。The Pile又將Books3等不同來源組合進一個更大的開放訓練集。

這意味著,一家AI公司即使沒有親自訪問最初的盜版網站,也可能通過二手、三手資料集接觸到相同作品。

當網際網路上能夠輕易獲取的優質文字逐漸不夠用時,Anthropic還採用了更加物理的方法。

法院材料顯示,2024年前後,Anthropic斥資數百萬美元購買數百萬本紙質書。服務商拆掉書籍裝訂,將書頁切割成適合批次處理的尺寸,再逐頁掃描成包含機器可讀文字的PDF,隨後丟棄紙質原件。

這項計畫後來被外界稱為“Project Panama”。

一份後來解封的內部規劃檔案寫道:“我們不希望外界知道我們在做這件事。”

不過,這部分行為需要與盜版下載嚴格區分。

阿爾蘇普此前認為,Anthropic合法購買紙質書後將其數位化,再把數字副本用於模型訓練,這種轉換行為可以獲得合理使用保護。

因此,“買書、拆書、掃描”本身並沒有在Bartz案中被認定為侵權。

索尼和華納現在試圖提出的新問題是:這些被掃描的書籍是否包含它們控制的歌詞和樂譜,Anthropic此後又如何記憶體、加工和使用這些內容。

這也說明,AI版權爭議已經不能只用“訓練是否屬於合理使用”一個問題來概括。

同一部作品從進入公司伺服器,到被清洗、記憶體、訓練和輸出,可能涉及多個相互獨立的複製行為;不同環節是否構成合理使用,也可能得到不同答案。


03 被演算法過濾掉的版權資訊


音樂出版商提出的另一項指控,涉及版權管理資訊。

所謂版權管理資訊,通常包括作品名稱、詞曲作者、版權所有人和版權聲明等內容。

對普通使用者而言,這些資訊可能只是網頁底部或者正文之外的附加文字;對清洗訓練資料的工程師而言,它們卻可能被識別為需要刪除的重複內容或者“雜質”。

訴狀援引Anthropic內部討論稱,公司曾比較多種網頁正文提取工具,以尋找更有效的內容清洗方式。其中一些工具可以過濾網頁頁尾、版權所有人名稱和版權提示。

索尼和華納據此指控,Anthropic在處理歌詞和其他訓練文字時,刪除或者修改了受法律保護的版權管理資訊。

如果法院最終認定Anthropic明知這些資訊受到保護,仍然故意將其刪除,爭議就會從普通版權複製延伸到美國《數位千禧年著作權法案》中的版權管理資訊條款。

索尼和華納要求法院按照每項違法行為最高2.5萬美元計演算法定賠償。

但這項主張能否成立,仍然取決於出版商能否證明Anthropic刪除了那些具體資訊,以及公司在刪除時是否具備法律要求的主觀認知。

原告還需要證明,這種刪除行為會誘導、促成或者掩蓋版權侵權。

換句話說,正文提取工具能夠自動刪除網頁頁尾,並不必然等於違法。真正的爭議在於,Anthropic是否知道被刪除的是版權管理資訊,以及這些資訊被刪除後,是否被用於掩蓋後續的複製和傳播。


04  訓練可以是合理使用,盜版下載未必是


不過,在此前的版權訴訟中,Anthropic也曾獲得一項關鍵裁決。

2025年6月,阿爾蘇普在Bartz案中裁定,在該案涉及的特定情況下,Anthropic把版權圖書用於訓練Claude,可以構成美國版權法意義上的合理使用。

他將模型訓練視為具有高度轉換性的使用,認為模型利用作品學習語言關係並生成新內容,與直接向使用者重新提供原書存在明顯區別。

但是,這項裁定同時劃出了一條重要邊界。

法院認為,公司不能因為最終的訓練用途可能構成合理使用,就倒推出從盜版網站取得作品的行為同樣合法。

Anthropic將700多萬本盜版電子書下載下來,並長期保存在內部中央資料庫,沒有獲得合理使用保護。

這一限定後來產生了15億美元的後果。

2025年9月,Anthropic與作家集體訴訟達成和解。2026年7月20日,美國聯邦地區法官阿拉塞莉·馬丁內斯-奧爾金(Araceli Martínez-Olguín)最終批准協議。

和解涉及482460部符合條件的作品,被認為是美國版權訴訟史上金額最大的和解之一。符合條件的作者和出版商預計每部作品可獲得約3000美元賠償。

Anthropic沒有在和解中承認違法。

索尼和華納正在利用的,正是Bartz判決留下的這條邊界。

它們沒有把全部賭注押在“使用歌詞訓練AI是否屬於合理使用”上,而是將Anthropic的行為拆成多個部分:BT下載、網頁抓取、第三方資料集獲取、訓練過程中的複製、模型輸出,以及版權管理資訊刪除。

這種訴訟策略試圖證明,即使法院未來認可某些模型訓練用途具有轉換性,Anthropic仍可能因為取得和處理資料的方式承擔責任。

訴狀最終提出四類主要指控,包括BT下載構成直接侵權、阿莫迪和曼幫助侵權、Anthropic自身實施直接版權侵權,以及刪除或者修改版權管理資訊。

這也讓AI版權案件的爭議邊界變得更加具體。

模型沒有向使用者吐出一整段歌詞,並不能自動解決訓練資料最初是否合法取得的問題;反過來,即使企業購買了正版文字,也不意味著此後所有記憶體、加工和輸出方式都會得到相同的法律保護。

AI公司需要回答的,正在從“模型是否複製作品”,變成“作品從那裡來、經歷了那些處理,又以什麼方式進入模型”。


05  大音樂出版集團先後加入戰局


音樂行業與Claude的交手已經持續近三年。

2023年10月,環球音樂出版集團(Universal Music Publishing Group)、康科德音樂集團(Concord Music Group)和ABKCO起訴Anthropic,指控Claude使用並輸出約500首受版權保護歌曲的歌詞,其中涉及碧昂絲、滾石樂隊和海灘男孩等音樂人的作品。

2025年1月,雙方就部分爭議達成安排。

Anthropic同意維持並完善Claude的版權保護措施,阻止模型直接向使用者輸出受保護的歌詞,而且這些限制需要覆蓋未來版本。

美國聯邦地區法官Eumi K. Lee隨後批准了這一安排。

但圍繞Claude的音樂版權訴訟並未停止。

2026年1月,環球音樂出版、康科德和ABKCO再次提起規模更大的訴訟,涉及超過2萬首作品,索賠金額超過30億美元。

2026年3月,貝塔斯曼旗下BMG權利管理公司又針對493部音樂作品起訴Anthropic。

8月17日,Round Hill Music也將Anthropic告上法庭,並表示,隨著更多作品被納入案件,潛在賠償可能達到數億美元。

索尼和華納的新訴訟意味著,全球三大音樂集團的出版業務如今都已分別捲入針對Anthropic的版權訴訟。

索尼和華納還在訴狀中稱,Claude現有的歌詞保護措施可以通過改變提問方式、反覆提示等方法繞過。

訴狀援引Anthropic早期微調資料稱,公司工作人員曾被鼓勵要求Claude執行推薦歌曲、改寫文字等任務;內部測試還曾要求模型利用披頭士、鮑勃·迪倫等人的歌詞片段寫詩。

需要強調的是,關於保護措施是否容易繞過、模型是否被有意訓練成複製歌詞,以及那些具體作品構成侵權,目前仍屬於原告指控,法院尚未作出判斷。

Anthropic也已經開始反擊。

2026年8月,公司在環球音樂出版等機構提起的第二起案件中申請駁回部分訴求,阿莫迪則單獨要求法院撤銷針對其個人提出的直接侵權指控。

新一輪訴訟才剛剛開始。


06  音樂公司的兩套AI策略


音樂行業對AI的態度正呈現出明顯的兩面性。

在法庭上,音樂公司不斷追究未經授權訓練資料的來源;在法庭外,它們又開始把音樂版權交給另一批AI公司使用。

區別在於,授權、報酬和使用邊界是否能夠提前談清楚。

2025年11月,華納音樂集團(Warner Music Group)與AI音樂公司Suno結束此前的版權訴訟,並達成下一代AI音樂模型授權合作。Suno承諾推出使用行業授權內容的新模型。

華納音樂集團CEO羅伯特·金克爾(Robert Kyncl)當時將這項協議稱為創作者群體的一場勝利。

2026年8月12日,已經起訴Anthropic的BMG也與Suno達成全球戰略合作。

協議覆蓋BMG的錄音和音樂出版曲庫,參與的藝術家和詞曲作者可以自行選擇是否加入並獲得報酬,雙方還將處理Suno此前使用BMG作品產生的問題。

五天後,Round Hill創始人兼CEO喬希·格魯斯(Josh Gruss)在起訴Anthropic時公開表示:“許可並不是創新的障礙,它保護的是這些原材料的合法所有者。”

最有意味的場景發生在索尼、華納起訴Anthropic的三天前。

2026年8月25日,索尼音樂集團、環球音樂集團和華納音樂集團共同參與Stability AI的7600萬美元B輪融資。同輪投資人還包括美國藝電和AMD Ventures。

Stability AI同時強調,其Stable Audio 3.0音樂模型使用的是“完全獲得授權的資料”。

對索尼、環球和華納而言,投資Stability AI與起訴Anthropic並不矛盾。

相反,這兩件事共同劃出了音樂行業目前試圖建立的邊界:一邊是願意進入授權體系、允許權利人選擇參與並分享收益的模型;另一邊是仍然需要為早期訓練資料來源接受司法審查的模型。

音樂公司反對的未必是AI訓練本身,而是未經許可取得作品、沒有向權利人支付費用,也無法解釋訓練資料來源的商業模式。


07  Anthropic需要交代“資料來源帳”


索尼和華納要求法院做的事情,不只是判令Anthropic賠錢。

它們還要求Anthropic披露Claude使用的訓練資料、訓練方式,以及收集和處理版權作品的方法,並銷毀Anthropic控制範圍內的侵權副本。

法院最終可能接受其中一些主張,也可能駁回另一些。

但對即將走向公開市場的Anthropic而言,訴訟本身已經成為無法迴避的風險。

公開招股檔案通常需要披露重大訴訟、潛在賠償責任,以及可能對公司業務產生重要影響的監管和合規風險。

投資者也會追問:Anthropic是否知道模型訓練資料來自那裡,能否證明取得方式合法,還有多少作品可能引發類似索賠。

一旦法院要求銷毀部分資料,問題還可能進一步延伸至已經完成的模型訓練。

模型參數是否需要重新訓練,刪除原始副本能否有效消除侵權影響,以及不同版本的Claude使用了那些資料,都可能成為後續爭議。

截至2026年5月,Anthropic的投後估值已經達到9650億美元。越接近公開市場,公司越需要證明,高增長收入並不是建立在無法核查的資料來源之上。

Bartz案已經讓Anthropic付出了15億美元的和解代價。現在,環球、BMG、Round Hill、索尼和華納又分別從歌詞、樂譜、網頁抓取、模型輸出和版權管理資訊等方向提出新的索賠。

這些案件尚不足以證明“所有AI訓練都必須付費”。

但它們已經向AI行業傳遞出一個更明確的訊號:合理使用可能保護特定的訓練行為,卻未必能夠清洗資料取得過程中留下的盜版記錄。

對於Anthropic而言,訓練資料已不只是提升模型能力的原料,也開始成為需要向法院和投資人解釋的資產來源與潛在負債。

AI訓練真正可能告別的,不是所有免費資料,而是那種不記錄來源、不核查權利,也不準備為獲取方式負責的時代。(軒轅科技評論)