TheNumbers.com 发生了什么:一个警告所有人的信号
文章摘要
电影产业数据分析师 Stephen Follows 复盘了一起看起来局部、实际上极具系统性意味的事故。2026 年 3 月 5 日,TheNumbers.com 突然下线,没有任何说明。这是一个被电影行业信赖了三十年的数据库,收录了 78,396 部电影和 236,176 位从业者的资料。它离线一周多,之后以一个骨架版本回归——历史图表、影片详情页和 Report Builder 工具都不见了。
CEO Bruce Nash 事后披露的原因是多重压力叠加下的服务器崩溃。第一层是流量结构的彻底扭曲:网站约 90% 的访问来自 AI 爬虫,只有 10% 来自人类。文章给出了一个非常刺眼的对比数字——Anthropic 的爬虫每送回一个访客,就抓取了三万八千多个页面;而 Google 的对应数字是 5 个页面。传统互联网赖以运转的假设「搜索引擎流量与读者价值成正比」已经彻底失效。
第二层是安全问题。这个网站有三十年历史,约有 16 万个遗留文件,构成了巨大的攻击面。日志显示存在「自动化探测和抓取」的痕迹,暗示有人在尝试未授权访问,以便把数据用于商业获利。Nash 指出 AI 让黑客技术民主化了:「实施复杂网络攻击的门槛已经大幅下降。」一个叫 XBOW 的自主渗透测试工具已经排到了 HackerOne 排行榜第一。
第三层是动机,也是这个故事最独特的地方:Polymarket 把 TheNumbers.com 指定为票房类结果的权威裁定源。这意味着谁能比所有人提前看到这家网站的数据,谁就能在预测市场上抢跑交易,获得巨大的交易优势——这就为入侵创造了直接的金钱动机。
文章还罗列了整个开放网络的普遍伤情:Read the Docs 为了防御单个爬虫每月下载 73TB 数据花掉了 5000 多美元;iFixit 一天内被单个爬虫打了一百万次;GNOME 项目发现 97% 的流量来自机器人;维基百科因为 AI 摘要导致人类访问量同比下降 8%。TheNumbers 之所以活下来,是因为它的收入来自独立的数据服务业务;而没有这种冗余的小项目就没那么幸运——文章举了 ZEGO 的例子,一家 37 年历史的纺织公司在一次网络攻击后申请了破产。
结论是:「开放网络建立在一些如今已经过时的假设之上。」独立网站、档案库和小型数字项目正同时面对两种存在性威胁——耗尽资源的机器人流量,以及越来越容易获得的攻击工具。
HN 评论精华
- abetusk:他认为很多人漏掉了文章的重点。「不只是 agent 在锤这个站点,而是可能潜藏着允许恶意利用的漏洞,这才是它下线、然后带着一小部分数据和简化设计回来的原因。」文章推测恶意用户在争取特权访问以获得预测市场的下注优势——如果你每周都能比所有人提前看到 The Numbers 的数据,你就能抢跑所有其他交易者。
- primitivesuave(本帖最有价值的第一手经历):他曾运营一个网站,公开展示美国政府在 COVID 期间发给小企业的所有补助,追踪 DOJ 起诉的欺诈贷款,并允许任何人对公开数据集跑结构化查询。首页最显眼的位置就放着「下载全部数据」的链接(约 10GB 未压缩,完全免费)。但 AI 爬虫认为「通过遍历 search 端点的每一种分面组合、下载数 TB 的原始 HTML」更高效。即使有 CloudFront 缓存和相当高效的后端,月账单里光网络出入流量就到了约 1000 美元,他第二个月就把站关了。整站生命周期内收到的捐款总共约 2000 美元。
- primitivesuave(回答「为什么 AI 爬虫比搜索引擎负载重」):两者兼有——更彻底也更频繁,「肯定超过搜索引擎流量的 100 倍」。他在 robots.txt 里是允许搜索引擎的,因为他希望 1150 万笔贷款都被单独索引,这确实带来了几次关于欺诈贷款的举报线索,而这些流量「几乎连个涟漪都算不上」,AWS 账单只有每月 50-100 美元。收到账单告警后看日志:99.99% 的请求都打在 /search 端点上,带着大约 10-12 个分面的几乎所有排列组合。「只有一个爬虫,但因为绝大多数查询都缓存未命中,触发了巨量的网络出流量。」
- ratelimitsteve:一句话概括了机制差异——「Google 爬你一次,而 AI 是每次有人问一个它觉得你这页可能相关的问题时就抓一遍你的页面。」
- pverheggen:「vibe code 出来的爬虫爆炸式增长,行为很糟糕而且无视 robots.txt。」
- ethagnawl:从远处看有过度简化的风险,但这个站点——尤其是免费的公开部分——看起来是静态站点生成器重写的理想候选。配上一个能识别机器人的 CDN,应该能以合理成本撑很多年。
- jaredwiener(对上述技术方案的关键反驳):「但这也摧毁了网站背后的商业模式。」你技术上当然可以重新设计来承受机器人流量,但如果机器人流量只是把数据拿走、同时减少人类访问这个站的需要,他为什么还要花力气维护它?他后面补了一句更本质的:「LLM 很棒,但它们不产生新信息。产生新信息还是需要人。而如果你把人做这件事的激励砍掉,LLM 就会饿死。」
- jaredwiener(对「用 LLM 重写这个站」方案的反讽):「这不就是 NRA 的论证吗?阻止坏人拿枪的唯一办法是好人也拿枪。」LLM 登场,把站点锤到下线或账单逼近破产,然后解决方案是花钱买 LLM 来修它并监控它。「你这站点真不错啊,要是全世界拔地而起的巨型数据中心开始从几万个 IP 地址锤它,那可太遗憾了……」
- hyperhello:既然爬虫反正都会拿到,那就把数据打成 zip 放某处吧。codemonkey-zeta 指出这没用:文章里维基百科也在经历同样的抓取之痛,而它明明已经提供了批量数据。HeatrayEnjoyer 追问:这些机器人到底是谁在跑?前沿实验室的开发者应该知道维基百科有批量 API,不必要的抓取也在增加他们自己的成本,为什么 2026 年了这还是个问题?esseph 的回答是灰黑市数据生意:所有公司都要数据,银行要数据,罪犯也要数据用于自己的骗局,所有人都想拿到尽可能多的数据,而且不在乎怎么拿。
- zackmorris(长篇技术论):这个问题二十年前就被 Varnish 缓存和 Coral CDN 解决了。他认为真正暴露出来的是「近年来 web 服务器变得多么弱」——2000 年代即使架构糟糕的 PHP 站点也能跑到每秒 200 个请求,静态站上千很常见;而今天的站点因为 ORM 和 N+1 问题会跑几百上千次数据库查询,响应时间 500ms 以上,1000 个并发用户就把服务器压垮。他认为根本问题是没人以一种脱离编程语言和数据库的通用方式解决「俄罗斯套娃式缓存」,我们本该有用 ETag 作为 key 构建依赖图、对依赖数据做真正缓存失效的机制。「缓存失效难到这个程度,实际上是个开放问题。」
- PunchyHamster(回应):那些方案成立的前提是「你付的是数据中心带宽价格」。如果你付的是云厂商按 GB 计费的价格,即使纯文本,被一堆机器人盯上也会累积成大数字。
- atherton94027:更多情况是站点跑在 VPS 上,而云厂商一直在压缩 vCPU 的定义边界——「Amazon 至今还把超线程当成一个核心来计费。」
- jambalaya8:他一直喜欢这个站,但看到那种「期待站长为你做事」的愤怒让他反感。「说白了,如果他想不打招呼就把站撤下来,那完全是他的权利。这是他的站。他也不欠任何人一个 .tar.gz。这是他的劳动。」他还有一条更激烈的:真正的解决方案简单又明显——把所谓的「预测市场」定为非法。情报界在 1996 年就通过研究和实验得出预测市场是个坏主意的结论。
- dumberquestions:「讽刺的是,预测市场当初的宣传卖点是帮助社会做出更好的预测。」
- Terr_(接上,一段小怒吼):宣传者声称这个系统通过帮助社会更早发现和收敛于有用的真相而服务公共利益,「但发生的恰恰相反。拥有专业知识或非公开信息的人被激励去误导和拖延,越久越好,因为那能最大化他们的下注收益。」
- mrandish:群体智慧、超级预测者、校准和预注册都是能带来更好预测的有用工具,「把它变成在线赌博才是走偏的地方。」
- Cthulhu_:让预测市场自己在到期前提前锁定交易?这假设所有预测市场都公平且遵守同一套规则。如果 Polymarket 这么做,竞争对手可以选择不做,而这些交易所不受任何单一国家或司法辖区约束,用户会直接跳船——「因为用户不在乎。参见股票市场,公司会不惜代价去省下几纳秒。现在把这种极限优化搬到全球、无监管、匿名的环境里。这就是科技自由主义者/加密货币兄弟想要的。」
- datadrivenangel:如果 AI 公司摧毁了开放网络,最终它们将不得不像 Netflix 自己拍电影、Amazon 自己开实体店那样,开始自己策划知识来源。nradov 回应说这已经在发生:前沿 LLM 厂商一直在雇领域专家,在目标垂直领域自己造专有训练数据。
- draw_down(全场第一条,带刺):「不好意思!就在昨天我们中很多人还刚决定 AI 抓取不是个真问题,每次它被拿来当理由,都是在掩盖别的东西。」