8 月 28 日,索尼音乐出版公司(Sony Music Publishing)、华纳查佩尔音乐公司(Warner Chappell Music)联合另外 33 家音乐出版商,向美国加利福尼亚州北区联邦地区法院提起诉讼,被告除人工智能公司 Anthropic 之外,还把两位联合创始人达里奥·阿莫代伊(Dario Amodei)与本杰明·曼(Benjamin Mann)列为个人被告。案件编号 5:26-cv-09217,审理地为圣何塞。

诉状指控 Anthropic 开展了”一场肆无忌惮的、以非法方式通过 BT 下载、抓取和下载受版权保护作品的运动,目的是开发、运营并从中攫取巨额利润”。原告方认为,Anthropic 在未获授权的情况下,大规模使用数以万计的受版权音乐作品——包含歌词与乐谱——来训练 Claude 系列模型。
15 亿美元和解为何”不够”
这起诉讼的一个直接背景,是去年那笔创纪录的和解。Anthropic 在承认盗版超过 700 万册图书用于训练人工智能后,同意向作家群体支付 15 亿美元;该和解已于今年 7 月获法官批准。
音乐出版商认为这个数字远远不足。”对一家把如此大规模的侵权行为转化成惊人的 2 万亿美元估值的公司来说,15 亿美元显然不足以起到遏制侵权行为的作用,”诉状写道。
赔偿诉求方面,原告要求对每一件被认定为故意侵权的作品最高索赔 15 万美元,对每一处被删除或篡改的版权管理信息追加最高 2.5 万美元。涉案作品数以万计,如果按上限计算,整体规模可达数十亿美元级别。原告同时要求陪审团审判、颁布禁令、销毁侵权复制件,并要求 Anthropic 就训练数据作出说明。
一条聊天记录成了证据
诉状把时间线拉回到 2021 年 7 月。原告称,Anthropic 的”大规模非法 BT 下载运动”始于该月,联合创始人本杰明·曼”亲自使用 BitTorrent 从 Library Genesis(LibGen)非法下载并上传了数百万册盗版图书”,而阿莫代伊批准了这一做法。
到 2021 年底,美国联邦调查局关停了 LibGen,但按诉状说法,”在此之前网络盗版者已复制了它的内容,创建了一个新的图书馆”,即 Z-Library。Z-Library 同样很快被关停,而在作家诉讼中披露的内部消息显示,Anthropic 通过”盗版图书馆镜像”(Pirate Library Mirror,简称 PiLiMi)拿到了这个副本的副本。
曼被指在 PiLiMi 上线后不久就指示员工下载,并向同事发消息称这个镜像来得”正是时候”。一名 Anthropic 员工回复道:”zlibrary my beloved(挚爱 zlibrary)。”
音乐出版商把这些对话作为 Anthropic 推崇并依赖盗版快速获取训练数据的证据。他们称,通过爬取 LibGen 与 PiLiMi 的非保密目录,从书名、作者、ISBN 等书目元数据可以判定”Anthropic 至少下载了数百本包含乐谱和歌词的图书”。原告表示将通过证据开示程序揭示其下载行为的”全部范围”。
被点名的作品包括披头士乐队全集、泰勒·斯威夫特的”最佳”歌曲合集以及《VH1 摇滚乐 100 首最伟大歌曲》等选集,具体曲目涉及《Eye of the Tiger》《Ain’t No Mountain High Enough》《September》《Uptown Funk》《Hallelujah》、泰勒·斯威夫特的《Paper Rings》和玛丽亚·凯莉的《All I Want for Christmas Is You》。诉状还指控 Anthropic 从 Musixmatch、LyricFind 等歌词网站抓取内容,并为获取更多数据而拆毁实体书,制作了”数百本歌本和乐谱集”的未授权数字副本。
争议焦点:Claude 会不会”吐出”歌词
Anthropic 否认使用从 LibGen 和 PiLiMi 下载的图书训练商用 Claude 模型。出版商则认为,这一说法取决于如何定义”训练”。诉状提出了一条间接链路:人工智能开发常包含”预训练”阶段,一个模型可能用另一个模型生成的”合成数据”训练,或接受另一个模型的行为反馈;Anthropic 至少用一个非商用模型生成的合成数据训练过一个已商业发布的 Claude 模型,而该非商用模型的训练文本源自 LibGen 或 PiLiMi。
此外,作家案中新近解封的文件显示,一名 Anthropic 证人作证称,公司已停止用 LibGen 训练大语言模型,但仍在使用该数据集来检测模型输出中的长文本片段是否与原文过于接近——也就是用于护栏。
在输出层面,出版商称 Claude 会在被问及某首歌的和弦走向时,”一并生成”受版权保护的歌词;在创作”新歌”时也会把真实歌词与生成歌词混编,并能”在各类提示下复现这些作品的灵魂”。他们还指控,Anthropic 员工曾在公司要求测试模型能否根据用户喜好推荐相似歌曲后,”反复以出版商受版权保护的歌词提示模型”。
双方的核心分歧
对于指控,Anthropic 发言人回应称:”这是同一批律师提起的第三起诉讼,把已经在法院审理中的案件里的主张又拿出来重复一遍。”发言人同时表示:”训练生成式人工智能模型属于变革性的合理使用——正如法院在 Bartz 案中所认定的——我们将有力地为自己辩护。”
值得注意的是,Bartz 案中支持合理使用的裁定,恰恰建立在作家一方未能证明市场损害、也未能证明人工智能工具在其市场中形成替代之上。而音乐权利人认为自己在这一点上比作家更有胜算:诉状称 Anthropic 公开追踪其产品对歌词创作者构成的威胁,且知晓当前登上音乐榜单的人工智能生成歌曲,正与那些被用于训练、却未获报酬的作品直接竞争。诉状还援引美国版权局的观察:当生成式模型的输出”即便与某件特定受版权作品并不实质相似,却在该类作品的市场中形成竞争”时,包括歌词在内,这些输出可能稀释版税池。
阿莫代伊在作家诉讼中作证时承认,Anthropic 本可以合法购买这些受版权保护的作品,但选择了 BT 下载,因为公司想避开”法律、操作和商业上的繁琐拉锯”。法院将其意图总结为下载盗版书”以省去付费的麻烦”。出版商强调,与其最大的几家人工智能竞争对手不同,Anthropic 从未主动接触他们商谈授权。
这并非 Anthropic 首次陷入版权纠纷。参与本案的部分律师此前也代理了 Concord 音乐集团与环球音乐集团今年 1 月对 Anthropic 提起的诉讼,并主导了 Bartz 诉 Anthropic 一案。同类诉讼正在密集出现:WikiHow 于今年 8 月起诉 OpenAI,指控超过 1.1 万篇教程文章被未经许可抓取;爱思唯尔、Cengage、阿歇特、麦克米伦和麦格劳-希尔等出版机构于今年 5 月起诉 Meta,指控其用受版权图书与期刊论文训练 Llama 模型;谷歌也面临出版商与作者就 Gemini 训练数据提起的集体诉讼。
“Anthropic 从未寻求也从未取得任何许可,来合法使用音乐出版商的受版权作品,”诉状写道,”更谈不上用于人工智能训练数据或输出。”最终这些主张能否成立,将取决于法院如何认定市场损害这一关键要件。







