法官批准 Anthropic 15 亿美元和解:为训练 Claude 所用的盗版图书买单
文章摘要
(注:AP News 原文抓取被拒,以下内容主要基于 HN 讨论中引用的法院文书、判决要点与社区分析整理。)
Bartz 诉 Anthropic 一案迎来终局:法官 William Alsup 正式批准了 15 亿美元的集体和解协议。这起案件由一群作者发起,后有出版方加入,核心争点并不是”能不能用图书训练模型”,而是”这些图书是怎么来的”。Alsup 在此前的关键裁定中已经把两件事切开:用合法取得的图书训练大语言模型属于合理使用(fair use),他甚至用了”极具转化性”(exceedingly transformative)这样的措辞;但从 LibGen 这类盗版库批量下载并长期保存图书副本,则构成侵权。15 亿美元赔的是后者。
和解的具体条款在讨论中被反复引用:每一部符合条件的作品赔付约 3000 美元。按传统出版合同的默认约定,作者与出版方五五分账;如果作者是唯一权利人(自出版作者,或版权已回归的作者),则可拿到全额。多位权利人的情况按合同或均分处理。值得注意的是,Alsup 把集体诉讼律师团的费用比例砍掉了一半——从 12.5%(约 1.875 亿美元)降到 6.8%(约 1.01 亿美元),律师团未获报销的诉讼支出为 260 万美元;三位集体代表各获 1.5 万美元。
案件过程中曝光的一个细节引发了大量讨论:Anthropic 确实花了数百万美元大量购买纸质图书(往往是二手书),然后由服务商拆掉书脊、裁切页面、扫描成带机器可读文本的 PDF,纸质原件随后被丢弃。这条路径被判定合法——因为私人拥有的印刷品数字化落在合理使用范围内。于是出现了一个颇具荒诞感的结局:合法的做法是”买来毁掉”,作者从二手书交易中一分钱拿不到;而已经存在的扫描版本反倒不能用。
对整个行业而言,这个判决的实际效果是双向的:它确认了训练本身的合法性(对所有实验室是利好),同时把”数据来源必须干净”变成硬门槛。而要合法建成一个百万册规模的图书语料库,需要买书、拆书、扫书的资本开支——这实际上把独立研究者和小团队挡在了门外。
HN 评论精华
-
jdlshore 一句话点明了最容易被误读的地方:”关键不在于这些书被用来训练 Claude,而在于它们是盗来的。” 他同时以作者身份补充:他参与了集体诉讼,文件写明默认按作者与出版方 50/50 分账,除非双方合同另有约定。
-
BeetleB 从对称性角度为这个数字辩护:既然裁定针对的是盗版而非训练,那类比就应该是个人盗版——如果你盗一本书要赔 3000 美元,你大概不会觉得该赔 3 万或 30 万。trentor 补充了对照数据:音乐盗版案里 Thomas-Rasset 每首歌赔 8 万、Tennenbaum 每首 2.2 万,法定上限是每部作品 15 万美元,所以 3000 美元”是个礼物”。xboxnolifes 则指出这种双标:”换成其他任何盗版场景,HN 都会说每首歌赔 2 万美元是疯了。”
-
wgjordan 引用 17 U.S.C. § 504(b) 反驳”个人类比”:美国版权法允许权利人选择追讨”侵权人因侵权而获得的任何利润”,公司靠盗版书获利与个人自用的责任量级完全不同。blackqueeriroh 从另一头拆掉这个论点:你无法证明任何单本书对 Anthropic 的利润有实质贡献——从训练集里剔掉一本书,模型会变差吗?答案是绝对不会。”你的智力产出对任何公司几乎永远只在总量意义上有价值,孤立地看则没有。”
-
modeless 给出了最犀利的整体评价:和解之后,实质上什么都没变,只是头部实验室从更高的市场进入门槛中获益。作者没多挣钱(除了 Anthropic 向出版方支付的一次性”保护费”和律师的分成),除了二手书交易市场和扫描仪供应商,没有别人受益。”这不是司法程序的问题,一切都完全符合法律。它只是一个荒谬的状态。”
-
nextaccountic 把”买书拆书扫书”的合法路径称作近乎自我戏仿:”吸走全人类知识的公司最后不只是隐喻地、而是物理地毁掉了这些书,像一个信息吸血鬼。” 他指出如果 Anthropic 能买电子书就不必如此,可惜没有百万册量级的电子书批量渠道。JAlexoid 反驳这种情绪,认为按此逻辑就该顺便禁掉二手书转卖和图书馆——私人拥有的印刷品数字化本来就是合法的,包括企业。
-
sillysaurusx(books3 数据集的创建者)现身给出创作者视角的遗憾:他做 books3 就是为了把”AI 公司该不该被允许在图书上训练”这个问题推到台面上。”只用于训练时盗版图书没问题”这个结果本就是长线赌注,但它本可以让个体 hacker 训练自己的模型。”现在我们进入了一个必须有几千万美元资本才能做实质工作的世界。” spaqin 直接称之为”教科书级的抽梯子”,而 usef- 冷冷补了一句:”从当前评论区来看,HN 的多数人似乎正想把梯子抽掉。”
-
ilamont 提醒大家去读法官对动议的回应原文,并整理出关键数字:每部作品 3000 美元、律师费从 12.5% 砍到 6.8%、三位集体代表各 1.5 万美元。
-
renlo 主张钱最终流向的是收租式的出版方而非艺术家,并引用 Authors Guild 的说明佐证;Aurornis、robterrell、jdlshore 用亲身经历纠正他——诉讼由作者群体发起,个体作者可以自行登记,robterrell 名下就有一本书在其中。gruez 从算术上驳斥:”如果是 50/50 分账,就不可能’大部分给出版方’。平均单个出版方拿得多,只是因为出版方数量少,不等于大头归他们。”
-
protocolture 提出了一个反直觉却有说服力的角度:3000 美元的赔付超过了大多数自出版图书一生的版税收入(他引用的数字是 500 到 1500 美元),”这更像是一笔捐赠”。他同时表达了对舆论转向的困惑:”在 AI 争论里,我不断看到人们把自己推向极端的版权最大化立场。我原以为经过 Napster 那一轮,社会已经翻过版权最大化这一页了。更糟的是,这个领域有意义的改革一直在等一家几十亿美元的公司来推动,现在机会来了,却突然出现了这么愤怒的反对,让我百思不解。”
-
timmmmmmay 用书评做类比说明合理使用的边界:”我写一篇影评卖给杂志,它当然衍生自那部电影,它是合理使用,我不需要事先取得电影版权方许可、也不用分成。你真的希望它换个运作方式吗?我可不认为该给每位作者对书评的一票否决权。”
-
carbyau 把版权问题拆成两条并给出自己的立场:作者拥有复制发行权,这没问题;但这个权利持续得太久了。”20 年之后你应该去想下一个点子,或者像我们其他人一样干活。50 年、70 年、90 多年,收益归遗产继承人?去他的。”
-
driverdan 贴出 Alsup 的原始裁定链接。tzs 补了一段有趣的背景:Alsup 是位很特别的法官,审过 Oracle 诉 Google、Waymo 诉 Uber 等重要科技案,本人还是个长期用 BASIC 写程序的业余程序员,为自己的业余无线电爱好写过短波传播预测软件。brlewis 顺势提出一个尖锐疑问:Alsup 判决时显然意识到”逐字复现”在理论上可能,但他知道这件事已经被实际做到了吗?如果知道,他还会不会用”极具转化性”来形容这个过程?
-
HackerThemAll 提出属地问题:世界其他地区的作者怎么办?ronsor 回答得很直白:美国对美国公司有管辖权,其他国家的作者如果能找到一种美国法院愿意承认与执行的管辖途径,欢迎去争。