一笔「疯狂」的 5000 册冷门书订单,让欧洲书商起了疑心
文章摘要
《爱尔兰时报》驻柏林记者 Derek Scally 报道了一桩正在欧洲独立书商之间蔓延的怪事:从爱尔兰戈尔韦到德国柏林,书商们不约而同地感到「有非常奇怪的事情正在发生」——他们怀疑,科技公司正在通过大规模采购旧书来训练 AI。
事件的起点是戈尔韦著名书商 Kennys。今年五月,Tomás Kenny 收到了一笔他形容为「bananas(疯得离谱)」的线上订单:5,000 册书。但真正引起他警觉的不是规模,而是选目的杂乱——「有的是高质量非虚构,比如《康尼马拉史》,下一本可能就是《埃迪·霍布斯 SSIA 理财指南》」。kennys.ie 对大额订单并不陌生,它是全球第二家开设网站的书店(1994 年),长期服务于亚洲大学等要为新开的英文图书馆填满书架的大型机构。但公共资金支持的机构联系他时通常会谈批量价格,而这笔五月的线上订单完全没有还价——这是第二面红旗。
柏林的书商在应对同样规模的订单:它们在夜里通过邮件抵达,利润可观却令人费解,涉及的都是「任何头脑正常的人都不会买」的积灰旧书——比如《驾照考试通关,2018 年版》。书商们说,这类订单金额在 1 万到 5 万欧元之间并不罕见,在亚马逊和其他线上书商冲击行业的当口,这是一笔受欢迎的收入。然而许多人担心,接下这些订单等于在给自己签死刑判决书。
他们援引的证据是今年 1 月《华盛顿邮报》关于美国古旧书商遭遇类似大规模订单的报道:AI 巨头 Anthropic 主导的「Project Panama」花费「数千万美元」收购书籍,然后裁掉书脊、扫描书页,把知识喂进 Claude 等产品背后的模型。该计划的细节是通过一起版权诉讼的法庭文件曝光的,那起诉讼最终以与图书作者达成 15 亿美元和解告终。
柏林古旧书商 Urban Zerfass 认为一些科技巨头正在欧洲做同样的事:「Anthropic 的计划在给投资人的文件里写得清清楚楚,与此同时亚马逊在每笔交易上抽 20%。」德国出版商与书商协会将大规模「扫描并化浆」的做法称为破坏性且违法的。协会发言人 Thomas Koch 表示:「根据德国法律,扫描书籍——无论出于何种目的——都是不被允许的,构成对著作权法的明确违反。这件事如今发生在二手书上,是这种做法的又一个高度令人不安的例子。」
德国书商们碰头研究后推断,整个下单流程是由 AI 驱动的机器人自动执行的,且只关注有 ISBN 号的书(ISBN 系统 1966 年引入)。柏林拍卖行 Bassenge 的艺术史学者兼买手 Markus Brandis 对德国《世界报》说:「今天 ISBN 让机器人或 AI 能够记录它还缺哪些书、还有哪些没扫描。」
事情的性质和合法性高度取决于发生地。欧洲书商注意到大宗订单出现了转向:不再是昂贵地跨大西洋直邮,而是发往欧洲各地的地址——怀疑这些是集货点,书籍随后装集装箱整批运往美国。在美国,较为宽松的「合理使用」(fair use)政策使得书籍所有者扫描并销毁自己的副本成为合法行为,这正是 2025 年 Anthropic 与作者和解案的法律基础。
Anthropic 对美国媒体的声明是:Claude 的训练数据是「公开可得的网络数据、商业采购的数据集,以及我们自己生成的数据」的混合;「获取书籍是整个 AI 行业训练大语言模型的通行做法」;「我们的数据采购项目中没有任何一个会购买并销毁珍本或古籍。」德国书商并不买账——他们根据订单的庞大规模断定,这个过程仍在通过第三方服务商进行;而且虽然只有 Anthropic 在法庭上被曝光,很可能许多科技巨头都在干同样的事。
至于终局,Zerfass 认为后果远不止书商的丧钟:「在我看来,这里的意图是进一步割裂人类的思考,让人们更加怀疑自己的批判性思维能力。」戈尔韦的 Kenny 则更务实但同样警觉,他说 AI 正在「让我们这个行业感到恐惧」:「书商往往站在很多道德困境、政治和伦理议题的最前沿。多数场景下轮不到我来决定。但如果他们拿一本书去扫描,目的是攫取知识产权,那么 Kennys 不想成为其中一部分。」
HN 评论精华
这条帖子拿到 93 分。讨论的重心并不在「书商该不该卖」,而是集中在版权制度的荒诞后果、扫描件的归属,以及「销毁书籍到底是不是必要的」这几个点上。
-
jvanderbot 开了第一枪:这些公司能立刻做的一件显而易见的好事,就是像 Google Books 那样把这些书数字化(公开)。discreteevent 一句话点破了核心矛盾:「那样他们就得面对版权问题了。AI 是那台把一切洗得干干净净的洗衣机。」conartist6 接上:「孩子们记住,如果你说『我是为了 AI』,那就是合法的。如果你说『我是为了人类的福祉』——我们可还记得 Aaron Swartz。」wongarsu 补充说,从报道看这批订单里的书基本都没进入公有领域,出版商只会告得更狠。
-
DougBTX 概括了这个「滑稽的处境」:按各方说法,在美国用书训练模型(以及建搜索索引,比如 Google Books)属于合理使用,但分享书籍数据集本身是绝对禁止的(明显属于非转化性复制)——「所以任何想训练模型的人,都必须自己去买、自己去毁掉每一本书的实体副本。」
-
「为什么非得毁书」这一分支收到不少解释:FartyMcFarter 问为什么不能扫描后转卖或送人。trescenzi 和 sznio 从工艺角度回答:撕掉书脊得到单页可以走自动进纸扫描仪,保持装订完整则需要平板扫描仪和一个操作员,成本差距巨大。ursuscamp 补了法律角度:按法院说法,销毁书籍而非转卖反而有助于他们的合理使用抗辩。mcphage 指出确实存在非破坏性的自动扫描设备。Oarch 于是发问:「这些天才 AI 公司就不能花几个小钱开发一台非破坏性扫描仪吗?搞了这么多 AI,连这么简单的任务都搞不定?」sznio 的回答很冷:不能,因为那是成本,唯一合理的支出是流向股东的钱;而且他怀疑他们想再来一次「内存囤积」式的操作——买光这些稀有书让竞争对手拿不到,扫完销毁则加倍确保对手无从获取。
-
vintermann 提出了本帖最被反复辩论的观点:报道说机器人只针对有 ISBN 的书,那就不太可能是稀有珍本,而是已经躺在国会图书馆及其各国对应机构里的东西。他有家人做过旧书生意,「相信我,这些书里绝大多数的最终归宿本来就是被打成纸浆」。如果法律强制他们训练完就销毁扫描件,那才是坏事(万一里面真有已经失传的内容);但如果他们保留扫描件甚至只是文字稿,「说实话,这大概比现状是个改进」。
- iamacyborg 反驳说有 ISBN 的稀有珍本多得是。abanana 从措辞入手做了很锋利的分析:Anthropic 那句「没有任何采购项目购买并销毁珍本或古籍」,是刻意用「rare or antiquarian」来指代「1966 年前、无 ISBN」的书;这句声明在回答一个根本没人问的问题,好让他们将来可以主张自己从未说过不销毁有 ISBN 的书。
- toofy、troupo 从另一头打:只有当他们共享扫描件和文字稿、而不是藏起来时,才谈得上是改进。vintermann 承认「不是好到你能看见它们,只是好到它们大概还会存在于某处」;troupo 回敬:「哈。相信一家营利公司会永远把某些数据留在存储里,这居然算『足够的改进』,而这一切存在的证据却拿不出来。」
- Yizahi 说得更直白:哪家公司会在事成之后保留自己违法操作的证据?没有一家 LLM 公司为营利使用他人 IP 付过一分钱给版权方,「他们当然会把残渣碎掉,把数字化数据藏进或删除在最深的非法离岸角落里」。
- femto 半开玩笑地说,Anna’s Archive 也许会成为某些书籍最后的堡垒,尤其如果它们能拿到 AI 公司内部收藏中那些不是从 Anna 那儿来的部分。
-
Cthulhu_ 提出了乐观解读:从零售商角度这难道不是好事吗——大批库存、包括《驾照考试通关 2018 版》这种滞销积压,按原价整批出清、不问缘由,简直是书商的梦想(他也不认为 AI 消化这些书会影响图书销量,正如电子书、Google Books、古腾堡计划当年都没有)。femto 加了个前提:只要 AI 吞书不会让真人更难拿到副本就行——有些绝版书本来就没剩几本。abanana 则指出,那个例子明显是被挑出来的极端滞销品,而这些订单的体量恰恰展示了 AI 公司挥霍投资人的钱的又一种方式。phoghed 把两难总结得很精辟:「下载内容来训练?不道德且违法。花钱买?你在浪费投资人的钱。」
-
BLKNSLVR 贡献了帖里最好玩的一段:这算不算第二种形式的 AI 精神病——「训练语料精神病」?对内容的无尽渴求,「更多!喂我!」,这是不是回形针最大化机器的「训练材料最大化」版本?「最后会不会发现,正是缺了《驾照考试通关 2018 版》,才导致此前所有模型在交规上产生幻觉?这下 OpenAI 终于能重新超过 Anthropic 了!万岁!我们找到它了!」abanana 认出了《霹雳五号》里 Johnny 5 的「MOAR input!!!」梗,感慨这部片子「意外地有预言性」。
-
luxuryballs 唱了反调:真正的「精神病」是有人卖书卖多了反而被人报警——有人买书为什么需要给出解释?如果一本书稀有且你想保存它,那就别轻易卖,或者提价,或者像法拉利卖车那样搞合约制。PunchyHamster 反驳说,等到轮到绝版书就晚了,我们已经看过 AI 公司因为破坏性扫描稍微便宜一点就毁掉珍本的新闻;「而且纵观历史,任何大规模销毁书籍的实体,最后都被证明是坏人。」cwnyth 顺势甩出一句:「这有个非常简单的解法,但那些坚持著作权要保护到作者去世后 70 年的人不会想听。」carlosjobim 补了句现实:「你家附近的学校每年或每两年就会用垃圾箱整箱扔书。」
-
ilamont 提供了一条来自实务界的一手线索:他认识的两位美国自出版非虚构作者今年早些时候都报告过通过亚马逊发生的大额新书采购,一次 50 册以上——这很不寻常,因为这些书本来销量很差,亚马逊上几乎没有二手副本。他的猜想是:有人在大批采购图书,打包后卖给多个 LLM 训练客户(而不只是 Anthropic 一家),只扫描一次然后反复出售扫描件,同时保留「每一册都是合法购买」的监管链证明。他说 Claude 以美国首次销售原则和版权法的复杂性为由否掉了这个猜想,但当他提出可能是中国公司在为面向海外市场转售的模型做类似操作时,得到的回答变得含糊。
-
paweladamczuk 对报道里那句「根据德国法律,扫描书籍——无论出于何种目的——都不被允许」表示震惊:「不好意思,什么?」ZenDroid 和 wasmitnetzen 澄清了细节:德国著作权法没有美国式的合理使用,但有私人使用和学术使用的例外条款(自然人为私人用途的个别复制是允许的,前提是不直接或间接用于商业目的),商业使用则没有豁免,且书籍在 § 53 (4) b) 下有特别保护;违法的是复制行为本身,而不是复制件的发布。teh64 补充说,戏仿、评论等用途仍允许使用作品的部分内容,例外条款其实相当多。
-
制度层面的建设性提议来自 VladVladikoff:「真希望我们有称职的监管者。」他的方案是强制扫描件必须通过一个官方仓储采购,保存扫描件并转售给其他想训练模型的公司,强制所有图书请求都走这个官方仓储,并把一部分收入返还给出版商——「这是个可解的问题」。Kim_Bruning 从美国宪法版权条款的原旨发问:这在任何意义上还算是「促进艺术与科学的进步」吗?只要稍微改一下法律或开个口子,这完全可以变成一次保存与归档行动。
-
stockresearcher 提出了一个冷静的解释:就英文书而言,这些公司只是在为已经通过「某些可疑手段」获得的东西补一张合法性外衣;公有领域的书根本不用费事,古腾堡计划之类的源早就爬完了。他给书商的建议是:把那些真实读者根本不感兴趣的二手书提价。palmotea 则提了个恶作剧式的对策:既然订单模式这么明显,不如做一批按需印刷的垃圾书去填这些订单。
-
criddell 想起 Kevin Kelly 在 2008 或 2009 年说过的话:他曾差点把所有纸质书数字化并处理掉,但在参观一座私人藏书室后顿悟——书籍从未像今天这样便宜,将来也不会这么便宜;纸质书有一种力量,不用电池、永不过时,而且「今天你能攒出的这类藏书,50 年后是攒不出来的」,于是他决定保留并继续经营这座纸质图书馆。
-
ChrisArchitect 指出了相关的前序讨论:HN 此前讨论过《AI 公司正在粉碎珍本书》(item?id=49068738)。