HN 上有多少是 AI?

查看原文 HN 讨论

文章摘要

作者是 lcamtuf(Michał Zalewski,afl-fuzz 等工具的作者),发在他的 Substack「lcamtuf’s thing」上。全文很短,是一篇数据小调查,TL;DR 就在开头:截至 2026 年 6 月,每日头条中约 50% 是关于 AI 的、或者是由 AI 生成的。

开场先交代了立场。 他说自己和 Hacker News 的关系很复杂:这个站点是极客新闻最重要的聚合器,也是他这个博客的主要流量来源;但同时它有相当数量的有毒评论者,是一个「朝我这个方向扔侮辱的可靠来源」——他自嘲说如果想尝尝味道,这篇文章本身就被人叫过「注水」和「slop」。这段自嘲后来在 HN 讨论里被反复引用。

他指出这不是 HN 第一次被趋势主导。 这个站点由极客运营、为极客服务,所以并不能免疫于科技潮流——比如 2018 年前后有相当多聚焦加密货币和 NFT 的帖子。但他认为最近这次转变更深刻:几乎每一天,版面都被「关于 AI 的、由 AI 写的、或者被 AI 评论的」帖子所主导。他放了一张 2026 年 7 月 21 日的截图,标注为「HN AI 奇点」,同时坦承那是特别糟糕的一天,所以为了给出更诚实的评估,他分别在 2026 年 2 月和 6 月做了两次系统性调查。

2 月的原始调查方法。 为了了解信息流里 AI 相关话题占多少,他对整个 2 月的每日前 5 名做了采样。结果:2 月 4 日和 2 月 12 日,AI 占了 5 席中的 4 席;2 月 5 日可以说整个榜单都是(第 3 名是某 AI 厂商的「潜艇式营销」)。整个 2 月只有三天前 5 名里没有 LLM 新闻——2 月 1 日(第一条 AI 帖在第 7 名,然后是第 9)、2 月 9 日(第一条在第 8)、2 月 25 日(AI 在第 6、9、10)。

实验的第二部分是判断哪些帖子可能是 AI 写的,他用了 Pangram。他把 Pangram 描述为一个「非常好且保守」的 LLM 生成文本检测模型,并花了一段专门为检测器辩护:这类工具在技术人群里名声不好,但反对意见往往基于过时的假设或彻底的误解。他的核心论证是——这些工具能工作,并不需要 AI 写作在任何意义上「非人类」,只需要当前这批 LLM 的默认腔调是准确定性的:让它写同一篇文章两次,你会得到风格上相似的结果。单个的写作习性是像人的,但你的写作恰好组合出完全相同的那一套习性,可能性极低

为了验证结果,他还人工复核了所有被标记的帖子,认为结论说得通,「如果说有偏差,Pangram 反而有几个漏报」。他举了 2 月 19 日第 3 名的帖子(《AI 不是同事,是外骨骼》)作为被标记的例子——那篇有 500+ 赞和 500+ 评论,他认为它有一大堆危险信号。

6 月的更新数据用了更细的分类。 他用纯黑色表示「纯粹的 AI 自我凝视」(厂商公告、关于这项技术优缺点的评论文章等),用斜纹图形表示那些重度倾向 AI 但有更广泛影响的帖子(例如 Instagram 的 AI 客服账号被黑一事);和之前一样,只是沾边的帖子(例如内存涨价的报道)不做标记。结论是:6 月上半月约 60% 的每日 HN 版面是 AI 相关或 AI 生成的,接近月底逐渐回落到约 50%——相比 2 月的 40% 有所上升。

文章正文到此为止。值得一提的是,作者在自己 Substack 的评论区里补了一条关于评论侧的链接(指向 marginalia.nu 上的一个 HN 相关页面),说明他本人也认为「帖子有多少是 AI」和「评论有多少是 AI」是两个不同的问题。

HN 评论精华

这条帖子 275 分、344 条评论。讨论很快就脱离了数据本身,变成一场关于「HN 是不是完蛋了」的大型集体情绪释放——怀旧、迁移建议(Lobsters、Usenet、自建论坛)、以及「抱怨 AI 的人是不是比 AI 帖本身更烦」的元争论,占了绝大部分篇幅。真正讨论方法论的只有零星几条。这条帖子最大的反讽被很多人点破:一条关于「HN 上 AI 太多」的帖子,本身就是一条 AI 帖,而且冲上了头版。