AI 实验室在「鹈鹕特训」吗?

查看原文 HN 讨论

文章摘要

背景先说清楚:Simon Willison 多年来用同一句提示词测试每一个新发布的大模型——”生成一只鹈鹕骑自行车的 SVG”。这个半开玩笑的测试已经成为 AI 圈最有名的非正式基准,他的鹈鹕结果常常是新模型发布 HN 帖里票数最高的评论。于是自然有人怀疑:当赌注是数千亿甚至上万亿美元时,实验室会不会偷偷针对这个基准做优化?标题里的 “pelicanmaxxing”(鹈鹕特训)正是 “benchmaxxing”(刷榜特训)的鹈鹕版。

Dylan Castillo 决定用数据回答这个问题。他构造了一个 8 种动物 × 6 种载具 = 48 个提示词的网格,其中著名的那句只是其中一格。动物包括鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫(火烈鸟和苍鹭与鹈鹕相似;猫、浣熊、水獭是简单情况;羚羊难;鲸鱼是最远的对照)。载具包括自行车、独轮车、滑板、踏板车、飞机、船。每条提示词的措辞几乎与原句一致,只换动物和载具。

他通过 OpenRouter 测了七个前沿模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro),每格 3 个样本、温度 1.0、统一推理强度,共 1008 张 SVG。流水线分三步:渲染成 PNG(1008 次生成中只有 11 次需要重试);用 GPT-5.6 Luna 当评委,对动物、载具、动作连贯性各打 1-5 分;再用 Gemini 3.1 Flash-Lite 做特征提取,记录它认出的动物和载具、朝向、以及开放式的场景元素清单。

他的假设是:如果某家实验室针对这个基准训练过,那应该表现为鹈鹕这一行超出该动物应得的分数、或自行车这一列超出该载具应得的分数、或鹈鹕-自行车这一格同时超出前两者的预测。

五条证据,结论一致:没有。

  1. 肉眼看图:他先看完所有图再跑分析,没有任何一家的鹈鹕-自行车明显好于该模型网格里的其他格。
  2. 鹈鹕在 8 种动物里排第 6,落后于猫、鲸鱼、浣熊、苍鹭、羚羊。七家实验室画猫、鲸鱼、浣熊都比画鹈鹕好。
  3. 自行车在 6 种载具里倒数第二,几乎与倒数第一的飞机打平。评委在三分之二的自行车图上标出了缺失或断开的部件(自行车需要两个一样的轮子、够到两轴的车架、车把、座椅、脚踏)。
  4. 两者相乘,鹈鹕+自行车在 48 个组合里排第 42。为排除”某些组合本来就更难”,他跑了固定效应回归:score ~ 实验室 + 动物 × 载具,再加上每个实验室在鹈鹕、自行车、鹈鹕-自行车格上的交互项,用稳健标准误。结果:所有实验室的鹈鹕效应落在 -0.11 到 +0.14 之间,没一个接近显著(最小 p = 0.25);自行车效应从 Grok 4.5 的 -0.18 到 Gemini 3.5 Flash 的 +0.27,只有 Gemini 过了 p < 0.05,而且七个方向不一;鹈鹕-自行车格效应无一过 p < 0.05,最大的是 GLM-5.2 的 +0.35(p=0.12)。他自己指出:21 次检验在 p<0.05 下按概率本就该出约 1 个假阳性(21 × 0.05 ≈ 1.05),而实际出现的正好是 1 个;Bonferroni 阈值是 0.002,Gemini 的 0.022 也过不了。
  5. 关于”记忆化构图”的传言(鹈鹕总是朝右、常出现太阳或围巾):21 张鹈鹕-自行车图确实全部朝右,是唯一做到全体一致的组合。但朝右本身很常见——全部 1008 张里 60% 朝右,自行车是朝右倾向最强的两种载具之一(81%),鹈鹕也是朝右倾向靠前的动物(78%)。另有三个组合达到 90% 以上,48 个组合里出一个 21/21 并不意外。场景元素同理:每个火烈鸟坐船的图里都有太阳,38% 的水獭坐飞机戴围巾,38% 的猫骑车带菜篮——鹈鹕自行车并没有什么特别之处。

作者也老实列了局限:单一 LLM 评委、没做对齐校验、也没测它对同一张图重跑的自洽性;无法检测”SVG 特训”——一个把整体 SVG 生成能力优化上去的实验室会在所有格子上一起上升,看起来和”就是水平高”完全一样(他点名 Google/DeepMind 公开承认在做这件事);整个实验只花了大约 80 美元 API 额度,因此每格只有 3 个样本。

结论:“对不起 HN 的黑子们,几乎没有证据表明 AI 实验室在做鹈鹕特训”,至少不是以明显的方式。更可信的故事是 SVG 特训。”至少你今晚可以安心睡觉了——AI 实验室并没有在生产成 TB 的鹈鹕骑车图,只为了骗过 Simon Willison。”

HN 评论精华