音乐圈出了个大新闻:索尼音乐和华纳音乐出版,把 Claude 的母公司 Anthropic 告上了法庭,单曲最高索赔 15 万美元,总额可能冲到几十亿美元。媒体直接用了"史上最大规模版权盗窃"来形容。这已经不是 AI 第一次因为"学歌"被告,但这一次,把 AI 训练数据的合法性,推到了只能由法院裁决的临界点。读完你会明白:AI 到底是怎么"学"一首歌的,以及这场官司为什么和你手机里那个天天用的 AI 息息相关。
一个被称作"史上最大版权盗窃"的官司
全球两大音乐版权巨头——索尼音乐和华纳音乐出版——正式把 Anthropic 告上了美国法院。指控很直接:Anthropic 未经授权,用受版权保护的音乐和歌词训练了它的 Claude 模型。
索赔金额更吓人:单曲最高索赔 15 万美元,整体或达数十亿美元。
这还不是孤立事件。此前环球音乐(UMG)就已经在跟 Anthropic 打同一类官司。Anthropic 当时的回应是:训练歌词是"变革性使用",属于合理使用(fair use);而 UMG 回击得毫不客气——“证据确凿,明显不是合理使用。”
一个是 AI 圈公认最强调"负责任 AI"、最"守规矩"的公司,一个却被扣上"史上最大版权盗窃"的帽子。这种反差,本身就是今天最值得聊的话题。
AI 没有"听歌",它只是把歌词"背"了下来
要理解这场官司,得先搞清楚:AI 到底是怎么"学"音乐的?
很多人以为,AI 听了几十万首歌,学会"风格",然后自己去创作。这是想象,不是技术现实。
实际上,大模型的训练是这样一个过程:把海量文本——包括大量歌词——一个个"喂"进网络,让模型学会预测"下一个词最可能是什么"。
问题就出在这。当一个模型见过足够多某首歌的完整歌词,它在被提示时,可能整段整段地像背书一样把原歌词"复述"出来,而不是重新创作。这种能力,业内有个专门的词,叫"记忆"(memorization)。
这就触到了版权法的核心命门:音乐人写一首歌,是独立的智力创作;而如果 AI 只是把别人写好的词"背"出来再吐给你,那它到底是在"学习",还是在"复制"?
索尼和华纳的观点很明确:未经许可把受版权保护的歌词灌进训练集,本身就是一次大规模复制;模型还能逐句复述,更是二次侵权。而 Anthropic 的辩护词,关键就在"变革性"三个字——它想说,模型的整体能力是一种新的表达,而不是对原歌词的简单搬运。
这场争锋,本质是版权法里最古老的一道题:你"参考"了别人的作品,到底算致敬,还是算抄袭?只不过这一次,考场从"人"换成了"模型"。
为什么一首歌能索到 15 万美元?
很多人看到"15 万一首歌"会懵:一首歌凭什么索赔这么贵?
这里得说清楚,它靠的不是某首歌的市场价值,而是美国版权法里的法定赔偿机制。当权利人很难证明实际损失时,法律允许就每一件被侵权的作品,在固定区间内直接索赔。美国《版权法》允许权利人在一些情形下按"每件作品"直接主张法定赔偿,在故意的最高档,单件可索赔到约 15 万美元。
换句话说,这 15 万不是一个"价签",而是一把"杠杆"。
真正让"总额或达数十亿美元"成立的,是另一个数字:被牵扯进训练集的歌曲数量。
像索尼、华纳这样的版权巨头,曲库体量动辄数十万甚至上百万首。如果法院认定 Anthropic 的整个训练集都构成侵权,那么"15 万 × 上百万首",再怎么保守,也能瞬间推到几十亿美元。这也是为什么索尼和华纳要选"每首歌单独索赔"的打法——它不是要 Anthropic 赔一首歌的钱,而是要让"每一首歌"都变成一颗能引爆的雷。
对任何一家 AI 公司来说,这个数字都堪称灭顶。这已经不是"赔点钱"的事,而是"训练数据从哪来"的合法性问题,第一次有了明确的商业定价。
这场官司的三层输赢
如果把视角拉开,这场官司的输赢,远不止是 Anthropic 一家的事。
第一层,是所有 AI 实验室。今天被"点王"的是 Anthropic,可全行业的大模型,训练数据里都塞满了受版权保护的文本、歌词、书籍、图片。这起案件怎么判,等于给"训练数据能不能随便用"立一个标杆。赢了,大家松口气;输了,整个行业都得重新审视自己的训练集——合规成本、数据授权成本会直线上升。
第二层,是音乐产业。音乐行业这些年被流媒体压得喘不过气,版税薄得像刀片。现在它手里多了两张牌:一张是"版权诉讼",向 AI 巨头要钱;另一张是"授权谈判",把 AI 拉回谈判桌。歌手的每一首歌,第一次从"音频资产"变成了"AI 训练原料"。这个行业的议价权,正在被重新洗牌。
第三层,是端着手机的你我。你平时用 AI 写歌词、改文案、做总结,从没想过"它会不会把别人的东西原样吐给我"。这场官司揭开的,是那个不太舒服的真相:你用的 AI,底层很可能有一块当年没人付过钱的原料。一旦判例确立,未来 AI 生成内容的边界、甚至 AI 内容能不能商用,都会跟着变。
AI 的"免费午餐"吃到头了
最后泼一盆冷水。很多人觉得,AI 公司理直气壮用版权数据,是因为"这是技术进步"。
但现实中,"为了技术进步"从来不是版权法的免责金牌。当年谷歌的数字图书馆案,谷歌靠"变革性使用"赢了下来,靠的是提供检索、不完整复现原文。而 AI 模型能一字不差复述歌词,恰恰踩在"完整复现"这一侧——这正是 UMG、索尼、华纳咬住不放的点。
所以,这大概率不是一场速战速决的官司,而是一场可能拖上好几年的拉锯战。但无论输赢,它都释放了一个明确信号:
AI 行业粗放式"拿来主义"的免费午餐,吃到头了。
从今天起,"训练数据从哪来"不再是研发团队关起门来能解决的问题,而会被抬上法庭、抬进行业规则,一轮一轮地被重估。AI 的下半场,拼的不只是模型有多聪明,更是它用什么喂出来的,以及喂的时候,有没有问过主人。
如果觉得今天这篇说清楚了 AI 版权这道坎,点个在看,顺手转发给在关心 AI 的朋友。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。