法官批准 Anthropic 15 亿美元和解:为训练 Claude 所用的盗版图书买单

查看原文 HN 讨论

文章摘要

(注:AP News 原文抓取被拒,以下内容主要基于 HN 讨论中引用的法院文书、判决要点与社区分析整理。)

Bartz 诉 Anthropic 一案迎来终局:法官 William Alsup 正式批准了 15 亿美元的集体和解协议。这起案件由一群作者发起,后有出版方加入,核心争点并不是”能不能用图书训练模型”,而是”这些图书是怎么来的”。Alsup 在此前的关键裁定中已经把两件事切开:用合法取得的图书训练大语言模型属于合理使用(fair use),他甚至用了”极具转化性”(exceedingly transformative)这样的措辞;但从 LibGen 这类盗版库批量下载并长期保存图书副本,则构成侵权。15 亿美元赔的是后者。

和解的具体条款在讨论中被反复引用:每一部符合条件的作品赔付约 3000 美元。按传统出版合同的默认约定,作者与出版方五五分账;如果作者是唯一权利人(自出版作者,或版权已回归的作者),则可拿到全额。多位权利人的情况按合同或均分处理。值得注意的是,Alsup 把集体诉讼律师团的费用比例砍掉了一半——从 12.5%(约 1.875 亿美元)降到 6.8%(约 1.01 亿美元),律师团未获报销的诉讼支出为 260 万美元;三位集体代表各获 1.5 万美元。

案件过程中曝光的一个细节引发了大量讨论:Anthropic 确实花了数百万美元大量购买纸质图书(往往是二手书),然后由服务商拆掉书脊、裁切页面、扫描成带机器可读文本的 PDF,纸质原件随后被丢弃。这条路径被判定合法——因为私人拥有的印刷品数字化落在合理使用范围内。于是出现了一个颇具荒诞感的结局:合法的做法是”买来毁掉”,作者从二手书交易中一分钱拿不到;而已经存在的扫描版本反倒不能用。

对整个行业而言,这个判决的实际效果是双向的:它确认了训练本身的合法性(对所有实验室是利好),同时把”数据来源必须干净”变成硬门槛。而要合法建成一个百万册规模的图书语料库,需要买书、拆书、扫书的资本开支——这实际上把独立研究者和小团队挡在了门外。

HN 评论精华