Show HN:你在「权重」里吗?——查查大模型有多认识你
文章摘要
「Are You in the Weights?」是一个有趣的小工具:你输入一个人名,它会并行地向多个大语言模型(既包括前沿模型,也包括较小的模型)发起查询,以判断各个模型对此人的「认识」有多深。随后它把各模型给出的结果聚类并打分,揭示出关于某个人的哪些信息已经存在于 AI 模型训练数据的「权重」之中。
换言之,它试图直观回答一个越来越受关注的问题:你的名字和相关信息,是否以及在多大程度上被「记进」了大模型里。对内容创作者、研究者以及关心 AI 透明度的人来说,这既是一面镜子,也暴露出模型会自信地编造关于真实个体的虚假信息这一普遍现象。
(注:原文页面仅返回标题片段,以上内容主要依据 HN 讨论整理。)
HN 评论精华
- jasonkester(365 赞):模型会自信地生成听起来合理却虚假的人物信息,把真实细节与编造内容混在一起,「就像看一个很糟糕的视奏者在表演」。
- amdivia(265 赞):对假阳性表示严重担忧,尤其是阿拉伯语名字被误判为恐怖分子,凸显出潜在的偏见问题。
- urbnspacecowboy:指出站点缺少隐私政策,担忧数据收集问题,同时分享了用虚构名字测试得到的搞笑结果。
- nickcw:因开源贡献而被准确识别,开玩笑说「在权重里」就像从「全景透视漩涡」中幸存下来。
- jubilanti:指出一个关键隐私问题——在作者修复之前,所有搜索都被公开列在排行榜上。
- turtlesoup(作者):解释「强度」指标结合了模型置信度与聚类加成,并承认模型「出了名地校准不准」。