AI 实验室在「鹈鹕特训」吗?
文章摘要
背景先说清楚:Simon Willison 多年来用同一句提示词测试每一个新发布的大模型——”生成一只鹈鹕骑自行车的 SVG”。这个半开玩笑的测试已经成为 AI 圈最有名的非正式基准,他的鹈鹕结果常常是新模型发布 HN 帖里票数最高的评论。于是自然有人怀疑:当赌注是数千亿甚至上万亿美元时,实验室会不会偷偷针对这个基准做优化?标题里的 “pelicanmaxxing”(鹈鹕特训)正是 “benchmaxxing”(刷榜特训)的鹈鹕版。
Dylan Castillo 决定用数据回答这个问题。他构造了一个 8 种动物 × 6 种载具 = 48 个提示词的网格,其中著名的那句只是其中一格。动物包括鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫(火烈鸟和苍鹭与鹈鹕相似;猫、浣熊、水獭是简单情况;羚羊难;鲸鱼是最远的对照)。载具包括自行车、独轮车、滑板、踏板车、飞机、船。每条提示词的措辞几乎与原句一致,只换动物和载具。
他通过 OpenRouter 测了七个前沿模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro),每格 3 个样本、温度 1.0、统一推理强度,共 1008 张 SVG。流水线分三步:渲染成 PNG(1008 次生成中只有 11 次需要重试);用 GPT-5.6 Luna 当评委,对动物、载具、动作连贯性各打 1-5 分;再用 Gemini 3.1 Flash-Lite 做特征提取,记录它认出的动物和载具、朝向、以及开放式的场景元素清单。
他的假设是:如果某家实验室针对这个基准训练过,那应该表现为鹈鹕这一行超出该动物应得的分数、或自行车这一列超出该载具应得的分数、或鹈鹕-自行车这一格同时超出前两者的预测。
五条证据,结论一致:没有。
- 肉眼看图:他先看完所有图再跑分析,没有任何一家的鹈鹕-自行车明显好于该模型网格里的其他格。
- 鹈鹕在 8 种动物里排第 6,落后于猫、鲸鱼、浣熊、苍鹭、羚羊。七家实验室画猫、鲸鱼、浣熊都比画鹈鹕好。
- 自行车在 6 种载具里倒数第二,几乎与倒数第一的飞机打平。评委在三分之二的自行车图上标出了缺失或断开的部件(自行车需要两个一样的轮子、够到两轴的车架、车把、座椅、脚踏)。
- 两者相乘,鹈鹕+自行车在 48 个组合里排第 42。为排除”某些组合本来就更难”,他跑了固定效应回归:
score ~ 实验室 + 动物 × 载具,再加上每个实验室在鹈鹕、自行车、鹈鹕-自行车格上的交互项,用稳健标准误。结果:所有实验室的鹈鹕效应落在 -0.11 到 +0.14 之间,没一个接近显著(最小 p = 0.25);自行车效应从 Grok 4.5 的 -0.18 到 Gemini 3.5 Flash 的 +0.27,只有 Gemini 过了 p < 0.05,而且七个方向不一;鹈鹕-自行车格效应无一过 p < 0.05,最大的是 GLM-5.2 的 +0.35(p=0.12)。他自己指出:21 次检验在 p<0.05 下按概率本就该出约 1 个假阳性(21 × 0.05 ≈ 1.05),而实际出现的正好是 1 个;Bonferroni 阈值是 0.002,Gemini 的 0.022 也过不了。 - 关于”记忆化构图”的传言(鹈鹕总是朝右、常出现太阳或围巾):21 张鹈鹕-自行车图确实全部朝右,是唯一做到全体一致的组合。但朝右本身很常见——全部 1008 张里 60% 朝右,自行车是朝右倾向最强的两种载具之一(81%),鹈鹕也是朝右倾向靠前的动物(78%)。另有三个组合达到 90% 以上,48 个组合里出一个 21/21 并不意外。场景元素同理:每个火烈鸟坐船的图里都有太阳,38% 的水獭坐飞机戴围巾,38% 的猫骑车带菜篮——鹈鹕自行车并没有什么特别之处。
作者也老实列了局限:单一 LLM 评委、没做对齐校验、也没测它对同一张图重跑的自洽性;无法检测”SVG 特训”——一个把整体 SVG 生成能力优化上去的实验室会在所有格子上一起上升,看起来和”就是水平高”完全一样(他点名 Google/DeepMind 公开承认在做这件事);整个实验只花了大约 80 美元 API 额度,因此每格只有 3 个样本。
结论:“对不起 HN 的黑子们,几乎没有证据表明 AI 实验室在做鹈鹕特训”,至少不是以明显的方式。更可信的故事是 SVG 特训。”至少你今晚可以安心睡觉了——AI 实验室并没有在生产成 TB 的鹈鹕骑车图,只为了骗过 Simon Willison。”
HN 评论精华
-
simonw 本人出现在讨论里,给出了极高评价:”这太棒了。我一直在随手抽查其他动物配其他载具,因为我做梦都想抓到某家 AI 实验室在鹈鹕骑车上明显优于其他组合。抓到某家实验室专门在我这个傻基准上作弊会非常好笑。” 他说 Dylan 的 8×6 共 1008 张的方法论比他自己设想的任何做法都严谨得多。
- 最大的一条支线是”就算是 SVG 特训,那又怎样”。lukev 提问:万一他们不是鹈鹕特训,而是整体 SVG 特训呢?simonw 直接回答:”Gemini 绝对在做 SVG 特训,他们公开谈过。” Wowfunhappy 顺势追问 “maxxing” 到底是什么意思,因为”变得更会画 SVG”本身就是有用的技能。qq66 的类比广受欢迎:”这就像在举重比赛上刷榜的方式是——真的变强了。”tempfile 的一句吐槽最简洁:”唉,他们只是在 goodmaxxing 罢了。”
- 反方也有力。dbt00 搬出古德哈特定律:往测试上训练不一定提升整体适应度,但一定会随时间摧毁这个测试的价值,因为它与整体适应度的相关性在下降。Dylan16807 补充:避免刷榜正是为了让基准继续能用;新基准很难造,如果我们得不停地烧掉旧的,那是在浪费所有人的时间。OutOfHere 提出更细的担心:如果 SVG 特训只覆盖”X 在做 Y”这个模板,那换成”X 不做 Y”“X 和 Y 做 Z”就会崩。
- ertgbnm 给出了本帖最平衡的判断:他觉得实验室不是在做鹈鹕特训,而是有某个 SVG 的强化学习环境让模型在里面炖过头了(他举 Gemini 3.1 Pro 发布时动画 SVG 能力的巨大跃升、其他方面却无甚亮点为例)。所以严格说不是鹈鹕特训,但确实是某种刷榜——鹈鹕原本的价值在于它的提升能代表整体智能的提升,而他认为这个关系已经不成立了。
- 关于朝向的最佳解释来自 mauvehaus,完全绕开了统计学:鹈鹕当然朝右——自行车的传动系统在右侧。任何想展示传动系统又不被车架挡住的自行车图片都会拍右侧,训练数据必然反映这一点。他还追加了一个更狠的观察:他检查后发现所有自行车都朝右,不管动物朝哪边;而且只要骑手有腿,两条腿都在自行车的同一侧——”这说明模型对自行车如何工作缺乏真正的理解”。
- 这条下面的讨论意外精彩。cheesecakegood 拿出艺术家 Gianluca Gimini 的 Velocipedia 项目:近 400 位不同年龄的人凭记忆画自行车,75% 朝左——所以模型的偏好其实与人类直觉相反。他猜是因为提示词暗示了运动,而从左往右阅读的人习惯把运动物体画成向右。ctidd 补充这是自行车摄影里极强的行业惯例(传动侧更好看、能展示配件),甚至是二手车挂售的一个黄线索:如果一辆发烧级自行车拍的是反面,有不小概率是赃车,因为发烧友自己应该懂这个规矩。sheept 反过来推测人类的左向偏好来自撑脚架在左侧(为避开齿轮),于是人总是从左侧靠近和扶车——同一个设计决策让人类和相机从不同侧看自行车。cheesecakegood 还顺手把画自行车当成教学工具:他代课时让学生 60 秒凭记忆画自行车,大多数人会在车架或链条连接上犯严重错误,明知道画错却画不对——他用这个讲识别(recognition)与回忆(recall)的区别,解释为什么学生复习时”这我懂了”,几分钟后考试却一片空白。
-
飞机那一列的异常也被反复讨论。Rooster61 猜是模型以为用户把 “plain”(平面/平原)拼错了。ramses0 认为是 “on a plane” 与 “on an airplane” 的合理语义歧义。flsw 提了个更妙的猜想:这在苍鹭(heron)上尤其明显,可能因为模型把 heron 联想到了海伦公式和笛卡尔平面。NitpickLawyer 发现 GLM 有两个组合是让动物坐在飞机里,还带窗户和一角机翼——zahlman 反问:”这难道不才是正确的理解方式吗?”
-
对方法论的质疑主要集中在 LLM 当评委。ponyous 说这一点直接损害了他对文章的信任:他用类似设置评估自己产品生成的 3D 模型,结果发现 LLM 判断与真实质量毫无相关性,基本是随机的。Nnnes 说他惊讶(但也不惊讶)于自己是唯一提这件事的人,评分质量可能比 SVG 本身还低——他挑出具体例子:GPT/1/鲸鱼/飞机 那张的载具拿了 5/5,”我不相信地球上能找到一个 4 岁以上的人会认真给它打 5 分”;而 Grok/2/猫/飞机 是更准确的飞机之一,却只拿 2/5。bluealienpie 一句”AI 给 AI 打分?我是不是漏了什么”引出 recursive 的调侃:”你漏的是整条船!先喝一杯 AI 调的库尔援助再说,别掉队了。”
- 对基准本身的存废之争。andrewstuart 认为鹈鹕提示词很荒谬,应该测你真正想让模型做的事,就像面试不该问”如果能消灭一个美国州你选哪个”“你怎么搬动富士山”。simonw 本人回应:”是的,故意荒谬。它从来就不是一个有意义的基准。真正令人意外的是,头 12 个月里模型在这个傻鹈鹕基准上的表现确实与它们在其他任务上的表现对应。这个规律已经不成立了——Fable 5 和 GPT-5.6 现在都被更弱的模型在鹈鹕上超过了。” 他还回答了”为什么不设计更贴近真实用例的测试”:不难,这类测试有的是,只是大多不好笑。
- ErrantX 提出了对这个基准最好的辩护:问题不在测试本身,而在于它是公开的;simonw 手上还有一批秘密提示词(其中一个曾为演示而”烧掉”),他对公开测试的点评实际是那些非公开测试的代理指标,这才让它成为好基准。
-
apwheele 提供了一个反向数据点:他长期让模型生成简单的 SVG 图标(比如犯罪地图上的一把卡通刀),ChatGPT、Claude Sonnet 5、Gemini 的结果都相当糟。他的困惑很尖锐:”怎么解释一个模型能生成极复杂的鹈鹕形状,却做不出一个简单得多的图标?除了’它在训练数据里’之外。”他自己的怀疑是模型并没有在学习形状基元并外推,而是在拼接一个庞大的先例词典。
-
dllu 从技术角度提出了本帖最有启发的一条:让 LLM 吐 SVG,就像让人类画家靠念一串坐标来作画,极其困难且反直觉。图像生成模型如今能轻松画出结构完美的自行车照片,但那只是栅格图。缺的是把图像分解成一串指令的那一步。他后来把想法说得更清楚:栅格模型能画出拓扑正确的车架,说明 AI 内部确实理解了;但直接让 LLM 输出 SVG 时,所有细腻的理解都丢失了。他还逐条列出 SVG 里反复出现而栅格图里不出现的错误:漏掉从脚踏到后轮的车架下方、多加一根从脚踏到前轮的连接(导致无法转向)、没有一个能把头管和前叉对齐、没有一个给前叉正确的偏移量、没有一个能把链条正确地挂到两个齿盘上。
- 最后是几条纯粹的娱乐。cyberax 贡献了一整套押韵替代方案:”飞机上的蛇、柴油上的鼬、滑翔机上的蜘蛛、气球上的狒狒、船上的山羊。”eob 建议 Simon 的个人简介从此固定为:”Simon Willison,除其他身份外,是推动将鹈鹕几何学纳入 LLM 训练集的倡导者。”exhaze 接龙:”今日纳斯达克暴跌 18%,就在 Simon Willison 发布最新测评之后——Legend 7.4 模型渲染的动画 SVG 里,鹈鹕从自行车上摔了下来。”shawabawa3 补上官方回应:”Anthropic 发言人表示:鹈鹕摔下来是非常罕见的,它们是按极为严格的 SVG 工程标准建造的。”scosman 则真的建了个仓库邀请大家一起构建”理想的鹈鹕骑车训练集”。nostrademons 的一句总结或许最该被记住:”看到有人发表零结果,真让人耳目一新。”