老网络去哪儿了?我们跟踪了 657,607 条链接来寻找答案
文章摘要
一份旧的 0.mk 数据库备份里躺着 657,958 条创建于 2009 到 2014 年之间的短链接,连同它们的点击计数。团队恢复了其中 657,607 条 2015 年前的记录,并在 2026 年 8 月挨个访问了每一个目标地址。在 655,178 条安全、可爬取的链接记录中,76.7% 已经不再返回一个能加载的页面。
0.mk 是北马其顿的第一个短链接服务,2009 年由三个人利用业余时间做的兴趣项目,通常每周只投入几小时。十七年后,其中一人在一块硬盘上找到了旧数据库备份,决定把它复活。作者明确声明这不是整个网络的普查——大多数用户在马其顿——而是一个线上社区在那段时期分享内容的一份大规模幸存记录,包含本地新闻、个人博客、图床、论坛和当时的主流平台。
生存测试的结果:在 655,178 条可爬取的历史链接中,51.24% 连接失败(DNS、超时、TLS),25.44% 返回 HTTP 错误(4xx/5xx),只有 23.32% 加载成功(2xx/3xx 响应)。而文章立刻指出,连这 23.3% 都高估了幸存率——一堵登录墙、一个塞满广告的停放域名、一条”此内容已不可用”的提示,都算作”加载成功”。一个能工作的页面,不代表原来的内容还在那里。
数据的严谨性在几处细节上体现得很好。为什么是 657,607 条链接但只有 494,781 个 URL?因为多条短链接有时指向完全相同的目标,这类重复记录有 162,826 条。把每个目标只算一次后剩下 494,781 个不重复 URL,其中 492,620 个可爬取,加载成功的只有 21.3%——去掉重复目标后这个百分比几乎没动,78.7% 仍然打不开。在不重复 URL 层面,55.0% 在网络层失败(对不确定的结果已经从第二个网络重试过),23.7% 返回 HTTP 错误。最常见的 HTTP 结果是 404,覆盖 76,403 个不重复 URL;另有 29,663 个返回 403 或 429——这些页面对爬虫没有加载,但可能只是在阻止自动请求而非真的消失了。作者因此坚持使用”没有加载”而不是”已经消失”的措辞。域名层面的图景一样:133,605 个可爬取主机名中,只有 34,827 个至少有一个 URL 能加载,另外 98,778 个一个都没有。
按年份看,2009 到 2014 年各年”没有加载页面”的比例在 URL 层面分别是 64.58%、60.39%、92.53%、59.43%、75.06%、78.16%。2011 年那个 92.53% 的异常值有一个明确解释:一个账号创建了 83,398 个指向同一个主机名(pelaphptutorials.com)的不重复链接。把这个主机只算一次,2011 年的数字就变成 61.74%,与 2010 和 2012 年几乎完全一致。作者据此提醒:原始链接量不是用户增长曲线——去掉那一批后 2011 年从 103,053 条记录降到 19,655 条,而 2012 年是 23,148 条。
一个反复出现的结论是:可辨认的幸存者多是巨头——YouTube、维基百科、谷歌旗下的各种产品;而个人博客、论坛、本地新闻站、图床散布在整个”不可用”集合里。中心化的网络总体上比小网络扛得更好。
文章有一节题为”墓园漫步”,列出了这个 2010 年代互联网博物馆里的一些住户:Facebook 老照片 CDN(fbcdn.net)有 835 条链接指向,一个都没加载;Google Code 有 803 条,现在多数 URL 重定向到其归档;PureVolume 有 796 条,老服务没了但域名还有响应;Rapidshare 139 条、Megaupload 71 条、Picasa 网络相册 69 条,无一 URL 能加载。有意思的对比是:PureVolume 653 个不重复 URL 中有 633 个现在返回页面,Google Code 754 个中有 628 个能加载或重定向——原来的服务没了,但域名还在响应。一个 HTTP 响应不等于内容被保存了下来。
还有一层”马其顿地层”:这些链接指向 A1 电视台(2011 年关闭),以及《Utrinski Vesnik》《Dnevnik》《Vest》三家报纸(均于 2017 年停刊)。数百条指向本地新闻的链接,如今除了偶尔在互联网档案馆里,别处都读不到了。作者用了一句很有分量的话——短链接活得比新闻编辑部更久。
最后是几件”珍宝”。有史以来第一条被缩短的链接(2009 年 7 月 14 日凌晨 3 点 52 分)不是什么宣言或发布公告,而是某人 WordPress 博客上的一个 CSS 样式表,总共两次点击——”帝国的起点都很卑微”。第二天有人缩短了 localhost,0.mk/localhost 指向 http://127.0.0.1/,得到两次点击,每一次都把访客送回了他们自己的机器——”最短的 URL 指向最孤独的目的地”。最短的链接指向了最长的域名:0.mk/1 记录了 10,415 次点击,指向一个 63 个字符的、2000 年代的猎奇长域名,而那个域名本身现在也没了——四个字符指向六十三个,持续了 17 年。最长的 URL 有 38,753 个字符,是 2012 年的一个 CodePen 链接,查询串里字面重复着 TRYING_THE_MAXIMUM_URL——”有人在测试我们。我们通过了,而且我们还保存着他们的测试。”另有 4,478 条链接指向其他短链接服务(bit.ly、TinyURL、goo.gl)——短链接指向短链接,脆弱性翻倍;谷歌在 2025 年关掉了 goo.gl,所以现在这些全都成了中间缺了一环的链条,我们这一半还能用,指向一个不再解析的服务,作者称之为”链接腐烂的平方“。而那个不朽的:0.mk/7 创建于 2009 年 7 月 15 日,指向 google.com,95,999 次点击并还在增长,十七年和一次复活之后,它今天仍然指向那里。
最后一节解释了 0.mk 为什么回来。2014 年时它的收入覆盖不了托管成本和维护所需的工作,垃圾信息不断,过滤意味着更多工程投入,滥用举报需要人来审核,于是原班人马关掉了服务。十七年后,作者说 AI 改变了这个等式——它现在能处理开发、垃圾检测、滥用审核、支持和监控中的大部分工作,这些正是老项目负担不起的东西,这让复活 0.mk 变得现实。恢复的链接现在跑在 300 多个城市的边缘节点上。
HN 评论精华
-
作者本人(tdx) 在评论区做了完整的自述,并特别强调了方法论上的诚实:他刻意使用”没有加载”而非”消失”;返回 403 或 429 的可能只是屏蔽了爬虫;返回 2xx/3xx 的即便现在指向停放域名、登录墙或内容已删除提示也计为加载成功。他也主动点出了 2011 年那个单账号 83,398 条链接造成的巨大失真。
-
本帖占据了最大篇幅、也最热闹的一条支线,其实与链接腐烂本身无关:几乎全体评论者在争论 2009–2014 到底算不算”老网络”。tokai 起头:”是我老了吗?09 到 14 在我看来根本不算老网络。对我来说老网络是人们还在出版实体网站『电话簿』的时候。”acheron 附和:”认真的,2009 年已经是所有人都在说 web 2.0 好几年之后了!那离『老网络』差得远。”随后各种断代方案纷纷登场:SwellJoe 认为”老网络是 1993 到 2007,之后一路下坡”;jperras 提出以谷歌搜索公开(约 1997 年之前)为界;binarymax 和 inigyou 干脆把那个时代称作”白垩纪网络”;s0rce 给出了三段分期:前图形时代、前谷歌搜索时代、前社交媒体/Facebook 公开时代;ColdStream 补了一个子时代——”2002 到 2005 年那段 Flash 胡闹期”。nkrisc 提出了最外交的方案:”那仍然是与今天显著不同的时代。我们叫它中世纪网络吧。也许是晚期中世纪网络。”
-
这场断代争论里最被认同的实质性划线来自 clickety_clack:“前社交媒体大概是那道分水岭。是它把内容从网络里抽走、吸进了围墙花园。” morganf 给出了更具体的版本:老网络是 Facebook 真正起飞、征服如此多人心智之前的网络(那是老网络这场败仗的第一记重击);老网络的关键组成是当年所谓的”博客圈”,而博客的顶峰正是 FB 崛起前的最后几年和 FB 时代的头几年。benjaminl 的版本最简洁:”对我来说老网络是人们还有个人主页的时候。个人主页消失时,老网络就死了。”
-
adrianwaj 提出了一个角度独特的划法:”对我来说,新网络始于『想要一个网站就得雇个网页开发者』这件事结束的时候。一旦它变成 DIY、不需要自己的域名、不需要看 HTML,新网络就诞生了。今天,如果你拥有自己的域名并会摆弄 HTML,那你基本上仍属于老网络。”他补充说人们怀念老网络,但那时也是一团翻腾的乱麻,”搜索结果倒是好,但那只在谷歌到来之后”。
-
关于为什么网页会死的技术讨论质量很高。shevy-java 起头:”网页会死大概是原始网络最大的设计缺陷之一。”efskap 给出了本帖被引用最多的一段:”这是数字媒体的巨大讽刺。复制数据精确到比特,保存是『原样』的,但实践中它需要有人维护服务器,需要有人在意,需要有人区分什么值得保存。我们热链到所有那些图床,是因为我们无法想象它们会消失。“cortesoft 立刻给出了更犬儒也更准确的修正:”不,我们热链所有那些图床,是因为我们不想自己掏钱托管。”(EvanAnderson 顺势回忆了当年把别人热链的图片换成”我是个带宽小偷”之类嘲讽图的乐趣,以及收到对方坚称他”黑了他们网站”的邮件。)
-
Gormo 提出了对原文标题的重要反转:“网页会死与其说是原始网络的最大设计缺陷,不如说是当今网络的最大设计缺陷”——越来越多内容藏在付费墙后、被日益严格的 WAF 拦截、通过复杂的 JavaScript 在客户端渲染。他的预测很尖锐:”20 年后,1996 到 2015 年左右的大部分网页内容仍然可以访问,但今天的大部分网页内容大概不会。“以静态 HTML 交付的老式网站,归档和镜像既简单又直接。inigyou 给出了一个半开玩笑但切中要害的解决方案:”禁止 JavaScript 发起请求。这样『另存为』就又能用了。”
-
marginalia_nu 对”复制数据精确到比特”这个前提做了必要的纠正:这有点理想化了。实践中批量复制并不完全精确,位腐烂(bit-rot)是非常真实的现象,在传输中和存储中都有;处理 2000 年代初的文件时经常会发现有几个已经损坏,即便它们只在硬盘之间复制过。tekne 反驳说内容寻址存储和纠错码能以极小的基础设施投入把位腐烂的概率压到天文数字级别的低,并提出”真正让东西从网上消失的是版权——种子文件永不消亡“(他随后自行补充说无人做种的种子确实会死)。marginalia_nu 的回应很务实:”软硬件上都有缓解手段,但大多数消费级机器默认几乎都不做——没有 ECC 内存,文件系统里没有纠错。”
-
ChadNauseam 提出了本帖最有建设性的技术方案:内容寻址是长期解法。点击一个链接时,有些情况下你希望服务器为你生成新鲜响应(比如显示天气的网站),但很多时候你只是想要被链接的那份内容(比如解释某个数学概念的网页)。后一种情况下,如果链接里带有内容的哈希,第三方就可以托管副本、在原运营者不复存在后仍让链接有效。Gormo 指出 IPFS 基本就是这么工作的,rustcleaner 提到 Hyphanet(原 Freenet)。mike_hearn 泼了一盆冷水,也是这条线最现实的一句:”但谁会去做呢?任何人都可以运营一个 archive.org 式的站点,但那需要大量工作和金钱,所以几乎没人做。连谷歌现在都不做了。”
-
ryandrake 写出了很多人的怀旧与愤怒:”我记得当年那种天真的暗示/期待——URL 应该是永久的。一旦一个文件由它的 URL 标识,你就可以收藏它,而它会一直在那儿。绝对最坏的情况下,如果有人真的真的非得改一个文件的 URL,他们会礼貌地返回 301 Moved Permanently,并为此感到非常抱歉。现在人们根本不在乎 URL。站长们想挪就挪文件,链接断了谁管呢,那是引用方的问题!他们漂亮的文件层级比网络保持连通更重要!“tesin 的回复很戳心:”『站长(Webmasters)』——1998 年之后我就没听过这个词了。”inigyou 补了更狠的一句:”已经四十年了。一半的站长都死了。你没法让东西活得比你自己更久。”
-
SAI_Peregrinus 提出了”网络内容的墨菲定律”:”任何你以后想引用的东西都会消失,而且没有归档副本;任何你想删掉的东西都会永远留存。“johnnyanmac 给出了完美的例证:”一篇对比不同国家 CEO 文化和激励机制的有趣博客?彻底没了,我搜过好几次都没找到,它才三年。那段二十年前中学生飞踢踹坏自动售货机的视频?昨天刚出现在我的信息流里。”
-
sumtechguy 提醒说连 archive.org 保存的内容也相当有限,他知道一个最近消失的大站,档案馆只有部分 HTML 部分;他还提到早年只要有人放上 robots.txt,历史就会凭空消失——他工作过的一家公司就因为域名抢注者放了个 robots.txt 而”彻底不存在了”。-0_0- 顺势提出了一条应当被命名的互联网定律:”任何有人指出自己遇到某个技术问题的网络评论下面,必然会有另一个人回复说他个人没遇到过。”
-
levocardia 和 randomblock1 提出了对这篇文章最直接的批评:整篇文章(乃至整个网站、整个”产品”)都是 AI 生成的,randomblock1 指向了站点上一篇名为”zero-humans”的页面作为证据,并说”LLM 腔调太多了,根本不需要 AI 检测工具就能看出来”。Lord_Zero 提出了一个实质性的追问:博客说 0.mk 当年的收入覆盖不了托管成本,但现在却上马了昂贵的 AI 集成(还不算开发的 token 成本);而且”回复任何 0.mk 邮件,消息会进入一个由 AI 读取、分诊并采取行动的反馈队列”——这难道不危险吗?如果有人越狱这个 AI 让它删掉所有人的账号呢?
-
mryall 贡献了本帖最佳吐槽:”一个下线了十来年的短链接服务,现在发文讲别的网站没能保持在线,真是相当讽刺。0.mk,你只有一份工作啊……“ButlerianJihad 用《蓝色天堂》(Brigadoon)的剧情做了回应——那个每一百年只出现一天的神秘苏格兰村庄。
-
hyperionultra 问了一个大家都好奇的问题:单个数字或字母的域名通常是”保留”的,他们怎么拿到的?neom 找到了确切答案:北马其顿的域名规则允许——”.mk 域名的名称由最少 1 个、最多 63 个字符组成。”temp0826 补充说 ICANN 可能对 .com/.net/.org 设了规则,但那不是所有顶级域通用的。
-
怀旧的细节在这一帖里格外密集:drooopy 想起 1997 年在 Geocities 上的《战士公主西娜》和《X 档案》粉丝站,并加了一句”别忘了在我的留言簿上签名!(此处应有低分辨率的纸笔 GIF)”;pluc 补上”显示 00000089 的计数器”和”88x31 的按钮、468x60 的横幅和表格布局”;mattkevan 的定义是”用 Fireworks 切 PNG 再用表格排版的时代”,toast0 纠正说”PNG?我们那时候是(大部分静止的)GIF,而且我们很满意”;mattkevan 于是补完:”哈是的你说得对。没有那个动图施工路障,就不算真正的个人主页。”pluc 还提醒了一件容易被遗忘的事:”没经历过的人会很难相信,AJAX 当年是和今天的 AI 一样强的流行词。想想异步请求曾是创新的巅峰,真是疯狂。”
(原文抓取成功。需要注意的是,多位 HN 评论者认为这篇文章及整个 0.mk 站点内容为 AI 生成,作者本人在站点上也有一篇名为 zero-humans 的说明页,本总结据原文内容撰写并在评论部分如实记录了这一质疑。)