我举报了两篇伪造作者的论文,结果两篇都被录为口头报告
文章摘要
原文标题是《Q&A from the slop trenches》(来自垃圾战壕的问答),作者是 Caleb Robinson 和 Isaac Corley,发表于 2026 年 7 月 30 日。两人这个夏天一共审了 22 篇投给 NeurIPS、WACV 和 TerraBytes(ECCV 的地理空间研讨会)的论文,其中 15 篇(68%)含有完全伪造的引用、给真实论文编造作者名单,或明显是 LLM 生成的(幻觉出来的技术黑话、不知所云的文字、不相关的引用)。分venue看,Caleb 是 11 篇中 6 篇(55%),Isaac 是 11 篇中 9 篇(82%)。文章的三部分是:吐槽这件事有多浪费时间、做一个关于”LLM 参与科研写作与审稿”现状的小型文献综述、以及开源 Isaac 写的参考文献审计工具。
文献综述部分列了一串触目惊心的数字。《自然》4 月的分析估计 2025 年”可能”有数以万计的论文含有无效的 AI 生成参考文献;Zhao 等人对 arXiv、bioRxiv、SSRN 和 PubMed Central 的审计估计仅 2025 年就有约 146,900 条幻觉引用,且是稀疏地散布在大量论文中而非集中于少数惯犯,早期职业研究者和小团队最容易中招;他们追踪含幻觉引用的 bioRxiv 预印本到正式发表版本,发现 85.3% 的幻觉原封不动地留了下来。《柳叶刀》对 250 万篇生物医学论文的审计发现,至少含一条伪造参考文献的论文比例两年内涨了六倍:2023 年 2828 篇中有 1 篇,2025 年 458 篇中有 1 篇,2026 年初已达 277 篇中有 1 篇。Ansari(2026)分析了 100 条出自 NeurIPS 2025 已发表论文的幻觉引用——每一条都通过了三到五位专家评审,携带它们的 53 篇论文(约占录用量的 1%)至今还躺在会议论文集里。
污染是双向的。AI 写作检测公司 Pangram 对 ICLR 2026 评审意见的分析发现 21%(15,899 条)完全由 AI 生成,超过一半有某种程度的 AI 参与。Gartenberg 等人测得《Organization Science》在 ChatGPT 之后投稿量激增 42%,超过 30% 的同行评审存在不同程度的 AI 使用。ICML 2026 在投稿中埋了提示注入陷阱,抓到 795 条评审(约占全部评审的 1%)来自 506 位被分配到”禁用 LLM”政策的评审人却使用了 LLM。更糟的是 AI 评审可以被直接博弈:Li 等人(2026)发现在不改变论文实际科学内容、甚至不知道评审模型是哪个的情况下,对抗性重写摘要就能改善 AI 生成的评审结果,最强的攻击成功率约 38%,在 10 分制上把 Gemini 3 Flash 评审人的评分抬高 1.31 分、GPT 5.4 Mini 抬高 0.88 分。
问答部分是全文最有画面感的地方。最糟的是什么? Isaac 说有两篇投稿引用了他本人认识的作者的论文,却把作者换成了虚构的研究者——论文、会议、其他作者都是真的,编造出来的名字也足够接近,扫一眼根本发现不了。他建议拒稿并直接向组织方举报,结果两篇论文都被录为口头报告,条件只是”把幻觉引用改掉”(HN 标题即出自此处)。Caleb 遇到的是一篇 53 页、通篇是幻觉黑话的 NeurIPS 投稿,还有一篇 40 页的也好不到哪去,其中一篇甚至在大部分引用旁留着 LLM 的批注。他还讲了一个典型案例:他本以为某篇 WACV 投稿相当不错,直到发现它把 SatMAE 的作者列成了 “Yuyang Cong, Saurabh Khanna, Chen Meng” ——真实作者是 Yezhen Cong、Samar Khanna、Chenlin Meng(arXiv:2207.08051)。
关于”LLM 写的”有哪些破绽,两人给的清单不同。Caleb 排序是:那些标志性句式(”不是 X,而是 Y”“真正的 X 是 Y”)、满屏加粗和破折号;密到难以解析的句子;过度吹嘘结果。Isaac 的更细致:正文里的数字和表格对不上——作者写完后重跑实验,忘了让 agent 更新或核对,”没人再读自己的论文了”;Claude 特别喜欢把所有数字细节都塞进正文,连本该放附录或代码里的细节也不放过;让 agent 写讨论部分,它往往只是把表里的指标原样复述一遍,不添加任何原创思考。他还吐槽 Fable 5 现在改成滥用冒号而不是破折号,并倾向于产出 B2B SaaS 式的营销腔。
在”你们自己也用 Claude,区别在哪”这个问题上,两人都强调本文不是在说不要用 LLM。Caleb 说博客很多内容最初就是某种 agent 起草的,但他们会大量地验证、编辑、彻底重写;这篇文章的文献综述就是他用 Claude 开的头,但他读了 Claude 找出来的论文、按自己的理解重新组织、从二手博客里挖出原始研究、删掉不相关的细节——”学习本来就是写作乐趣的一部分”。Isaac 的做法是投稿前彻底通读自己的论文;一个他觉得好用的技巧是让 Claude 找出所有含糊之处,然后用多选题来”面试”他,以便双方在协助写作时对齐;他还提到自己积累了多年真实 BibTeX 的 Zotero 库,大部分引用根本不需要查。他强调”在 LLM 出现之前就发展出研究品味”是最关键的一条,”我无法想象现在的年轻研究者要怎么在黑暗中摸索”。
关于责任归属和制度对策,两人都比较悲观。Isaac 强烈怀疑披露制度的作用:披露对善意者有用,但多数人不会诚实使用——他们给 TorchGeo 加了”不用 LLM / LLM 辅助 / 全是 LLM 写的”三档 AI 政策,”没有人会去勾最后一格自曝”。他认为真正需要的是桌拒机制,或至少一个能捕捉常见 LLM 错误、判断论文是否值得进入评审的标记工具——”现在是评审人在众包桌拒,这对仅剩的善意评审人不公平”。他还提到 ICLR 现在在 OpenReview 上公开作者姓名,猜测其他会议会跟进。Caleb 的分工建议是:作者别投低质量论文;导师别让学生投低质量论文;组织方想办法拒掉低质量论文——最后一条说起来容易做起来难,因为 AI/ML 会议的投稿规模早已失控(他刚看到 AAAI 2027 收到了 4.8 万份摘要投稿)。Caleb 还自曝做过一次实验:Opus 4.6 和 Karpathy 的 autoresearch 仓库刚出来时,他让一个 autoresearch 循环在 LandCoverAI 数据集上跑出”SOTA”,再让 agent 写了篇”论文”——看上去像模像样,但他绝不会拿去投稿,因为那根本不是研究贡献。
文章最后开源了 bib-audit,一个 MIT 许可的 Claude Code skill,已上架他们新建的 skills marketplace(claude plugin marketplace add isaaccorley/skills 后 claude plugin install bib-audit@isaaccorley-skills)。它接受 .bib、.bbl 或 PDF;后两者由 Claude 先把渲染后的参考文献还原成结构化字段(作者认为”反渲染参考文献是语言任务,不是正则任务”),然后脚本把每条引用拿到 Crossref、arXiv、DataCite 和 Semantic Scholar 上解析,逐字段与登记机构的记录做 diff,按严重程度从高到低报告:不存在的引用、伪造的标识符和虚构的作者、真实论文上的错误元数据(作者名单被截断、预印本与正式发表的年份漂移),格式问题排在最后。diff 覆盖完整作者名单,这一点很关键——像 SatMAE 那种换作者的伪造,仅靠标题存在性检查是查不出来的。格式检查部分提炼自 John Owens 的《Common Errors in Bibliographies》。工具在指控上也很克制:没有 DOI 或 arXiv ID 的条目只能靠标题匹配,这类发现会标为”需人工核实”的建议项,作者建议在评审中只陈述观察(”arXiv 记录上的第一作者是 Yezhen Cong,不是 Yuyang Cong”),把动机判断留给编辑。.bib 路径只读、无依赖,只在标识符锁定的不一致上失败,可以直接放进 CI 当投稿前的关卡。文末还有一段给评审人的严正警告:投稿(包括参考文献)是保密的,而这个审计要把其中一部分发给托管 LLM——ECCV 2026 明令禁止用 LLM 写评审(本地跑或走 API 都不行),并禁止评审人向 LLM 分享投稿的大段内容;WACV 把 LLM 生成的评审称为”极不负责任的行为”,可以用桌拒评审人自己的论文作为处罚;NeurIPS 限制评审人能与 LLM 服务分享的内容,其 AI 辅助评审实验才是被许可的通道。
HN 评论精华
这条帖子拿到 276 分、162 条评论。讨论的重心不在”怎么抓假引用”,而在整个学术出版闭环正在被自动化掉这个更大的命题上。
-
nneonneo 的置顶评论(102 条子树)把现状总结成一条链:AI 研究领域里,论文由 AI 写(如本文所述,也是任何认真读近期 AI 论文的人都能看出来的),论文由 AI 审(NeurIPS 正在做 AI 辅助评审实验,且他觉得无论喜不喜欢,趋势就是往 AI 评审走),论文由 AI 阅读、总结、消化(因为顶会论文多到没人来得及全部过目)——”我们正在飞快地把人类从学术发表循环里自动化掉”。strictnein 的续写把它推到荒谬处:我们只需要一批由 AI 运营的期刊,向别的 AI 收费让它们阅读,然后由 AI 运营的大学去提拔那个在 AI 期刊上发表和被引最多的 AI。conception 泼冷水说不用畅想未来,benchmaxxing 已经在这儿了。jsrozner 提出了更精确的判断:与其说是在把人自动化出循环,不如说是在飞快地自动化垃圾的生产;我们离 AI 能判断研究质量还很远(甚至可以说大多数人类也判断不了),”社会上多数事情不像数学,我们没法靠验证来自动化地把噪声从信号里摘出去”。hellohello2 提供了一个少见的正面视角:AI 显著改善了非英语母语作者(尤其中国)的写作,文字更标准化、更无聊,但整体更好读,他碰到的难读论文变少了;他觉得最麻烦的是半真半假的表述——句子不算错,但读着就是不对劲。
-
dghlsakjg 提出的角度是”这是学术界从未认真对待开放获取的副作用”:如果论文和期刊没有被出版商设卡,验证被引文献是否存在本该易如反掌。nhinck2 反驳说验证存在性本来就很简单,crote 给出技术细节:几乎所有期刊都有公开索引,至少含作者信息和摘要,加上 DOI 引用就够了,即便是闭源期刊也一样;难的是核对内容,而这一点并不会因为开放获取就变简单——你仍然要读懂论文、比对它与引用它的论断是否相符。dghlsakjg 的追问点出了实际摩擦:具体在哪儿查?要不要手动一条条抠出来单独查?没有订阅能验证被引用的原文吗?每本期刊是同一套系统还是得熟悉多个数据库?”坐在大学图书馆的电脑前查一篇论文当然容易,那查几十万篇呢?”jsrozner 认为真正的解法是开放且可公开查询的引文图谱,Google Scholar 完全可以以近乎零的边际成本提供,但它不会。
-
low_tech_love 被文中一句话惊到:”因为会议规定投稿就必须审 4–5 篇”——真的是这样吗?我投一篇正经论文,就要被一群天知道哪来的人强制审?emil-lp 确认属实,并说 4–5 篇还是往低了说,他被要求审 7 篇;至于怎么分配:你在 3 万篇里挑 30 篇投标,结果他一篇都没抢到,最后审了 7 篇自己并不够格评判的论文。tgv 难以置信地追问是哪个领域能有 3 万篇。YeGoblynQueenne 分享了自己的应对:碰到这种情况就快速读一遍,写几句它讲了什么、写得好不好,说明超出自己专业范围,给一个低置信度的弱接受,把判断权留给领域主席——至少还能帮他快速过一眼、发现完全是垃圾时报警。probably_wrong 替 *ACL 系列会议澄清:评审人不是”随机的人”,必须满足”至少两篇主会或 Findings 论文,外加至少一篇 ACL Anthology 或主要 ML/AI 会议论文”,所以都是发表过的作者;但强制审稿确实是事实——投稿数逐年攀升,志愿者根本不够。
-
bradley13 把根因归到”publish or perish”,认为取消它这个问题大半会消失;他承认管理者想要简单指标,但研究没有简单指标。GuB-42 提出了那个难回答的反问:有不简单的指标吗?”publish or perish”的好处是它基于具体的东西,虽然被博弈得厉害、AI 之后更甚,但被大量引用的论文往往确实有用;取消它之后,在没有更好办法的情况下只会变成比谁人脉好、比谁话说得漂亮——比现在还严重。Matumio 引用 Barry Schwartz 的话回应:”如果你依赖激励,你就在削弱价值观”——问题在于不是所有有价值的东西都容易被度量,我们过去是把一些资源浪费在腐败和误判上,现在则是浪费在逼所有人追逐错误目标上。Viliam1234 的类比很到位:科研里的”publish or perish”就像软件开发里的”代码行数”,连技术债都一模一样——我们发表了海量论文,知道其中大多数大概无法复现,却不知道是哪些。asdff 提醒说教授本来就有教学、服务、主持委员会、带学生毕业等一堆考核项,评终身教职时都会看。
-
若干针对具体做法的质疑很有意思。angry_octet 提出了一个尖锐的悖论:灌水作者(或他们的 agent)会把 bib-audit 也接进流水线,于是参考文献变得完美无瑕,反而抹掉了一个清晰的低质量信号。leikarnes 建议投稿时一并上传所有被引论文的 PDF,turtletontine 逐条驳回:让作者下载再上传可能上 GB 的文件是过重的负担,对很多来源还可能构成版权侵权,而且像会议报告这种非出版文本根本无从上传;已经有 DOI 这种标准索引键了,要求提供 DOI 列表更合理也更可行,但仍然防不住作者名单写错。delis-thumbs-7e 说自己一路在想”为什么不先把论文喂给 LLM 筛掉明显的垃圾”,读到文末的评审人警告才明白——保密规定和各家会议的 LLM 政策就是答案。mlmonkey 主张”以毒攻毒”用 LLM 做同行评审,tdeck 一句话回绝:如果你在意的是质量,那显然不行。kimjune01 则认为无需人工介入就过滤掉事实错误或无法验证的投稿应当完全可以接受。
-
sumanthvepa 警告说用 Pangram 检测 AI 是个很糟的主意:他拿自己确知是本人写的文字去测,被判定为 AI 生成。tibbar 的解释颇有洞见:Pangram 实际上在测的是默认的 Claude 语气,对技术性的 GPT 文本它就不触发。Kaethar 补充说 AI 文本检测工具正在和各家实验室调整后训练目标的速度赛跑。
-
惩戒力度也被讨论。DarkUranium 认为这应该被当作剽窃处理并承担类似后果,虽然他自认这大概是一厢情愿;azan_ 反问”所以就是打手心?”,emil-lp 说在他所在的领域,剽窃很容易导致丢工作——你总不会为一篇论文把人关进监狱,那在坐牢和丢工作之间还有什么别的选项吗?wavewrangler 说他以为已经有期刊对不诚实披露 AI 使用实施一年以上封禁、arXiv 似乎也在做;在他看来,如果你连幻觉和错误都懒得查,”问题不在 AI,问题在无能和懒惰”。Hendrikto 的态度最强硬:应当把制造和传播假科学的人驱逐和排斥出去,这是能想象到的最自私、最反社会的行为之一。tolugenius 抓住了文章的核心事实追问:既然连”举报了伪造作者、论文照样被录为口头报告”都会发生,那就等于立下了”只要运气好没被抓到就行”的先例。
-
一条来自作者的现场澄清值得记录:jsw97 对文中”这个博客很多内容最初是由某种 agent 起草的”表示震惊——”谁会这么干?我的声音就是我的声音,让 LLM 打初稿这种事我压根没想过,我以为那是大学生才干的事”;xiaoyu2006 说自己能接受人写初稿、LLM 校对润色,反过来则不行。作者之一(volumes94)现身回复说这句话过于简化、他会去改:他和 Caleb 是先聊了一通各自的审稿糟心事,觉得做成访谈体会很有趣,于是让 Claude 根据他们的对话生成问题,答案是两人从零写的,最后让 Claude 做了校对。
-
最后是几条离题但有趣的。kingstnap 贴出 arXiv 的月度投稿量统计,说他们该换成对数坐标了,”我能想象 2027 年的学术界会变成 Moltbook 那样”;turtletontine 认为方向没错,但要注意这在各学科间极不均衡——生产垃圾的人多半在追热闹的大方向,ML 比多数领域惨得多,还有很多重要但冷门到没人来灌水的题目,仍由认真的研究者主导,只是冷门到你不会知道。Der_Einzige 逆向发言:他们写了篇 ICLR 2026 的论文专门讲如何规避 AI 写作检测,并把”我喜欢这个输出,但一知道是 AI 生成的就不喜欢了”这类反应称为”碳沙文主义”的外化和一种偏见,还顺带指出”meritocracy”一词最初被造出来的那本书恰恰是批判这个概念的,所以他们认为自己的工作”损害精英主义”是个好结果。