优质非虚构书籍是 AI 垃圾内容的反面
文章摘要
历史学家 Benjamin Breen 在这篇文章里提出一个核心论断:高质量的非虚构书籍恰恰是 AI 生成垃圾内容(AI slop)的反面,而我们其实正身处一个被严重低估的非虚构黄金时代——尽管读者数量在持续下滑。
文章从作者本人的一段个人经历讲起。他在大学时期做过图书馆的勤工俭学工作,负责把书放回书架。那份工作让他有机会在美国国会图书馆分类法 A 到 F 段的藏书里随机抽样阅读,这种体验对他的智识养成有决定性影响。他把这种模式称为”经过筛选的自学”(filtered auto-didacticism):接触到的每一本书都已经通过了专业遴选,而不是像今天的算法推荐那样把你困在同质化的信息茧房里。他举了斯蒂芬·茨威格《昨日的世界》(关于战前维也纳的回忆录)、David Levering Lewis 那部已经绝版、亚马逊销售排名极低的杜波依斯传记等例子,说明真正的好书往往正在从公众视野中消失。
但作者的批评矛头并不指向书本身,而指向承载它们的机构。他哀叹研究型图书馆的衰败:可自由浏览的开放书库正在被”学习实验室”和”数字创新中心”取代,而那些极其出色的旧书面临的命运是被数字化或直接被处理掉。
为了解决”好书找不到”的问题,Breen 自己动手做了一个工具——Book Prize Index,一个收录了约 6500 部获奖非虚构作品的可搜索数据库。它用的是语义搜索而不是关键词匹配,所以你可以输入类似”适合喜欢 Pavement 乐队的老爸读的书”这种模糊描述,也能得到像样的结果。
文章最后梳理了战后一系列技术与社会条件如何共同催生了品质更高的非虚构写作:喷气式旅行让实地调研成为可能、图书馆访问权的民主化、编目系统的改进、媒体平台的出现,以及数字工具的普及。作者认为非虚构的质量大约在 1980 年代到 2000 年代之间达到顶峰,并对当下是否正在走下坡路提出了疑问。
HN 评论精华
-
northhex:曾在某个图书奖项做过志愿者,他提醒大家书籍奖项虽然是”好于平均水平的信号”,但没那么可靠。出版商会把书海投给每一个稍微相关的奖项,这就跟摄影师花钱参赛只为拿到”获奖摄影师”头衔、企业交钱提交材料争取”密歇根州百佳雇主”一样,只是做生意的成本。很多时候待评图书太多而合格评审太少,谁获奖近乎随机。他举了 NCR 图书奖的丑闻为例——评委根本没读过那些书;PROSE 奖的类别多到离谱,普通类别的入围甚至获奖,其声望价值通常被严重夸大。
-
throwaway219450:奖项也是时代的产物,反映的是评委偏见、读者的文学口味,以及赤裸裸的裙带关系与精英主义。看看雨果奖、星云奖、轨迹奖历年的获奖作品,会发现不少平庸之作,尤其是跟同届落选的提名作品对比时更明显。
-
adamddev1:现在走进大学图书馆看到的场景很悲哀——学生们坐在无穷无尽的好书书架之间,面前的笔记本电脑上几乎全都开着 ChatGPT。图书馆已经沦为一个”坐下来打开 LLM 的地方”。
-
DubiousPusher:接上一条,他认为讽刺之处在于 LLM 最擅长、几乎就是为此而生的能力,恰恰是告诉学生该去翻哪本书、去哪里挖出多年无人碰过的知识金块、建立那些博士生要花十年才能发现的跨领域联系。他自己就是这么读到 E.P. Thompson《英国工人阶级的形成》和 Graves《向那一切告别》的——与其跟 LLM 兜圈子问知识,不如直接向它要书单,效果远好于谷歌搜索,而且能挖到很深的角落。
-
jeffreyrogers:一个关于认知的观察——大脑存储”长文本阅读所得”的方式,恐怕和”跟 LLM 聊天所得”非常不同。读到有挑战性或全新的内容时,他会花大量时间思考这些内容如何与自己的经验和已有知识对接,读得慢是因为必须停下来消化,这个过程中他在不断整合和重组自己的思维;而跟 LLM 交互更像是被动接收,知识没能真正嵌进来。他还补充说,大学时用 Mathematica 学线性代数,考试能应付,但后来不得不重学一遍,因为从未真正深入理解——他觉得从 LLM 那里得来的知识也有类似的浅层特征。
-
nimonian:从教育理论角度给出了对应概念——”同化”(assimilation)与”顺应”(accommodation)。同化是新知识直接嵌入既有认知图式;顺应则要求你改变整个图式,而被挑战感和”醍醐灌顶”的深刻感正来自后者。他举例:小孩学会”外国人”指来自本国之外的人,等 11 岁第一次出国旅行才恍然大悟”原来我在这里才是外国人!” 由此,可以把上一条评论重新表述为:LLM 的输出倾向于”极易被同化”。
-
theshackleford:反对把被动性归因于工具本身。他自己一直不擅长”读书—学会”这条路径,只能通过动手做、并能随时追问不懂的点来学习,而 LLM 让这种学习方式成为可能,人类老师对他的容忍度早就消耗完了。他的实际做法是照旧写下自己的理解、做闪卡、主动练习,只是多了追问的能力。当有人抱怨”任何对 AI 的批评都被’你用错了’一句话打发掉”时,他澄清:说 LLM 让学习变被动,就像说书让学习变被动因为你可以不动脑地略读——媒介允许两种方式,浅层参与是选项之一,不是唯一选项。
-
m463 / tony_cannistra / lesostep:一串关于空间记忆的有趣讨论。有人边走路徒步边听有声书,回忆起某个知识点时会连带记起当时走在哪条山路上;有人重听十多年前的播客,清晰记得当年戴着有线耳机从公交站走回家的场景。ahartman00 补充了学术名称——”情境依赖记忆”(context-dependent memory)。
-
adamtaylor_13:作为创业者,他在给公司网站写案例研究时发现 LLM 写好散文的能力”糟糕得惊人”。即便你不断引导,它们依然写不出稳定的高质量文字。他的结论是:一个好文案的价值从未如此显眼。
-
conception:一个更普适的猜想——AI 在所有领域产出的都是平庸内容,只是你只在自己真正精通的领域才察觉得到。加上大量提示词和框架约束可以榨出还不错的东西,但默认情况下”下一个最可能的 token”很少产出有质量的东西;如果你觉得它产出了,也许该重新检查一下自己对该主题的专业度假设。
-
dofm:一段颇细腻的文学性论证。他认为人写作是在为某种内在感受或概念摸索恰当的措辞,写作有一部分是写给自己的;而 LLM 永远只为受众而写。换到其他生成媒介更容易理解:MidJourney 从不为了好玩而随手涂画,所以”乐趣”从未进入它的创作;Suno 不曾花几小时在吉他上摸索一段 riff,它的音乐从未被”终于弹对了”那一刻的直接喜悦所塑造,也不会为某把七品音有杂音、弦距过高的特定吉他优化可弹性。作家有大量看不见、未被记录的动机在长期塑造作品——为一句蹩脚措辞而自责、因编辑的批注而消极抵抗地避开某些词、因为大家都在等着去酒吧而草草收尾、专门挑一个类比去膈应某位写来毒舌读者信的人。他还提到 Gemma 4 的文风比 ChatGPT 或 Claude 舒服得多,猜测小型开放权重模型没有那种”必须讨人喜欢、迎合用户”的商业压力,因此不容易染上那股千篇一律、过度乐观的”加州销售助理”腔。
-
felipeerias:做了个实验——给 Claude Fable 充了 25 美元的 Pangram(AI 文本检测)API 额度,尝试数百次,它始终无法产出一篇不被立刻识别为 AI 的可读原创文字。他认为通过检测需要模型具备良好的自我感知(”糟糕,我在写得像个 AI!”)和对自身输出的精细控制能力。他给出的一个可能解法是:在有限而风格统一的语料上训练模型。例如 Talkie 这个在 1930 年前英文文本上训练的模型,规模和能力都远小于 Fable,但文风独特到经常被 Pangram 判定为人类所写。
-
paxys:抓住了文章里一处好笑的自相矛盾。原文说”这里除了收集数据和写代码的工具,以及至关重要的语义搜索之外,真的没什么’AI’的成分”——那基本上等于说一切都是 AI 做的。不过 paxys 认为这并不坏:完全可以一边主张获奖图书优于 AI 垃圾,一边承认同样的 AI 在别的用途上是有价值的工具。wackget 则更刻薄地总结为两行:”痛斥 AI 制造垃圾 / 用 AI 做了个网站”。
-
Planktonne:从另一个角度提出质疑——代码的来源本身削弱了项目的立意。如果一个项目声称自己关乎品质,那么当你知道创作者把创造过程的部分责任外包出去了,就很难相信他在别处会有高标准。这个项目需要被真诚地在意才可信、才有意义,而 vibe coding 的做法让人对此产生怀疑。
-
maxdo:唱反调的一条。他参加读书会多年,认为”人类垃圾内容”在文学里是真实存在的:几乎每本书都在把一个核心想法硬撑成一本书的体量;真正独特的想法很罕见,人们只是从不同角度反复攻击同一批想法;作者的既有信念几乎能预测整本书的走向和结论,洗脑效应是真实的。他的问题是:AI 垃圾比书籍垃圾差在哪?至少用 AI 你可以把核心想法蒸馏出来,而一本书要花 10 到 40 小时才能消化完那些一点都不新鲜的观点——很多书本来只值一篇杂志文章的篇幅。jonfromsf 补刀:”商业书籍 99% 是垃圾”;vkazanov 接着说:”自我提升类书籍!全部都是!’养成好习惯,别养成坏习惯,因为林肯就是这么做的……’”
-
fzeroracer:直接回击了上面那条。他认为”能蒸馏出核心想法”之所以不构成 AI 的优势,是因为这个说法把书当成纯消费品,目标仅仅是读完然后翻过。在他看来即便是最差的书也比 LLM 产出的东西有价值,因为你至少能从”意图”中学到东西——作者在哪里失败了、为什么失败、卡在了哪里、哪些论点没能立住。而 LLM 的写作是一片虚空,没有任何可学之物。
-
benbreen(原文作者/网站创建者):在评论区现身致谢,表示会加入 Axiom 商业图书奖,但对是否收录”年度好书”类榜单还在犹豫,因为它们和正式的图书奖项性质不同。他坦承目前语料库偏历史类过重,因为他自己是历史学家、对那些奖项更熟,并欢迎 HN 读者继续推荐可以补充的奖项。