匿名末日:你写的字正在出卖你

查看原文 HN 讨论

文章摘要

博主 dynomight 在这篇兼具数学与思辨的长文里提出一个”猜想”:只要你在互联网上以不同笔名发表了足够多的文字,仅凭文本本身就能把这些身份关联到一起——因为你在写作中留下了统计意义上的”指纹”。他设想有朝一日会出现一个网站:粘贴进某人刚写的一段新文字,它就能返回此人以任何名义发表过的所有文字的链接。虽然目前公开互联网上还没有这样的工具,但他相信它很快会变得轻而易举。他补充说,这篇文章大部分写于 2025 年中,搁置一年间 LLM 识别作者的能力已大幅提升——给 Claude 4.8 喂这篇文章草稿的前 1000 字,它就认出了是他本人。

文章的核心是一个信息论论证。设想每人出生时被分配一串随机二进制串,每次发帖都要”签名”。串太短,很多人会撞;串足够长,就几乎唯一,足以关联所有笔名。那个临界点在哪?如果只知道作者是当下在世、生活在英语世界的人(约 4.9 亿人),临界点约为 29 比特(因为 2^28.86 ≈ 4.9 亿)。写作风格正扮演着这串”签名”的角色:你并非一次签完整串,而是每写一个词,就有一定概率泄露其中一个比特——比如你用的破折号是”带丑陋空格 — 这样”还是”不带空格—这样”,就暴露了某一位。当两个笔名重叠泄露的比特数远超 29 时,攻击者甚至无需了解其他任何人,就几乎可以断定二者是同一人。

为论证这不只是理论上可能、而是很快会发生,作者细致盘点了写作中承载信息的各类特征。他把作者身份识别的历史追溯到 1440 年——洛伦佐·瓦拉靠语言用词证明《君士坦丁献土》是伪造的;1964 年 Mosteller 与 Wallace 用词频统计(尤其是 by、from、to、upon 这类”虚词”而非涉及主题的实词)判定了《联邦党人文集》争议篇章的作者是麦迪逊。他随后列出海量稳定特征:词长/句长/段长、标点频率、虚词与代词偏好、情态动词、模糊限制词、字符与词的 N-gram、词汇多样性、句法复杂度、被动语态、名词化、分支结构、状语从句位置、牛津逗号、who/whom、拆分不定式,乃至一贯的拼写错误和独特笔误等等。接着他用”分箱 + 折算”的方法估算各类特征的信息量:光是年龄、性别、职业、地区、政治倾向等人口统计特征,在考虑分布不均和相关性后仍约有 17 比特;HEXACO 的 24 项人格侧面约贡献 39 比特;再加上写作风格本身……总量远远超过关联身份所需的 29 比特门槛。结论令人不安:只要你的写作风格里含有至少 29 比特信息、且你写得够多,你就”完了”(you’re done)。他进一步大胆推测一个”广义匿名末日”:未来只要你通过任何高带宽渠道与世界交互,都会暴露身份——戴面具、用变声器仍会被体型、步态、化学特征识别;封锁浏览器、用门罗币、串三层 VPN,仍会被你滚动页面时手指抖动的方式认出。

HN 评论精华

评论区既有对论证严谨性的学术性挑刺,也有对”如何反制”的务实探讨,还夹杂对 AI 时代的联想。