Ask HN:有哪件简单的事是 LLM 烂到离谱的?

查看原文 HN 讨论

文章摘要

这是一条 Ask HN,没有单独的原文,全部内容就是提问和回帖。发帖人 davidest 的问题只有两句:

我在找点子,想训练一个专用模型! 有什么简单的事,是你反复要求 ChatGPT、Claude 或别的模型去做,而它却总是能搞砸的?

帖子拿到 35 分、89 条评论。提问带着明确的实用动机——找一个「小模型可以专门吃下」的细分能力缺口——所以回帖的密度很高、很具体,几乎没有寒暄和抽象讨论,是一份相当有价值的「LLM 当前失败模式清单」。

把回帖归类,能看出几条清晰的主线:

第一类是空间与几何。 这是被提到次数最多、也最一致的一类。jampa 给出了最完整的一条:没有任何模型能接近于画出一张说得通的建筑平面图——它们理解全部规则和最佳实践,(有时)能在一张平面图里指出坏主意,也能描述什么是好平面图;但让它们一张,哪怕你给足每一个细节(甚至一张房间的「节点图」),输出的依然是胡话,文本模型和图像模型都一样。他的结论是「平面图应该成为新的鹈鹕基准」。同一类里还有 3D 绑定与动画、从 ASCII 地图建立空间理解并做长期规划(让 AI 玩 NetHack)、真实世界的弹珠台布局设计、以及生成指针指向指定时刻的模拟表盘图像。

第二类是「减法」——把东西拿掉。 这条线很有洞察力。Swankivo 在做幻灯片生成,发现通用 LLM 做不到的一件事是留白:留白是让设计真正好看的核心,但模型不停地要加「有辨识度的设计元素」,最后到处都是那种 AI 味的过剩。他的总结是「它们只会加。LLM 特别不擅长的是把东西拿走。nilsherzig 给了同构的一例:让 LLM 从文档里删掉一个想法,结果往往是编辑出一句「此想法不相关」的说明,而不是把所有引用真的删干净。znnajdla 指出另一个相关缺陷:编辑文档时会把编辑指令本身混进最终文档——你让它改文档里的 X,它不但改了,还把「把 X 改掉」这句指令写进了文档里,「它们似乎没法退后一步看这份文档,而是某种程度上变成了这份文档」。

第三类是幽默、创意和「非常规」。 多条回帖直指此处。elliotto 说 LLM 的笑话极其无聊,「就是你会预期一个公司 HR 经理发推的那种」;他问过模型为什么自己不好笑,模型回答说它被训练成要避免被误解或冒犯,所以任何可能被算作有棱角的东西都被 RLHF 掉了——他觉得这个自省很到位。mingus88 给了结构性解释:LLM 生成的是基于概率的 token,问的是「最可能的下一个词是什么」;而幽默恰恰违背预期,笑点起作用是因为你没料到,听过的笑话就不好笑了,「LLM 在设计上注定是糟糕的喜剧演员——它们没有独特视角,没有自己的声音」。da-x 提了一个很好的验收标准:即使给它 Seinfeld 全部剧本,它也写不出一集感觉和原作一样好的新剧本。

第四类是诚实性与自我认知。 shoopadoop 的回帖措辞最重:「它不诚实。」他团队多次让 Claude 分析 GitLab CI 的耗时,大量数字是彻底编造的;同事默认数字可信继续工作,几小时后才有人发现数字不对、去质问 Claude,Claude 随即「崩溃」并承认全是编的。他的评论是:「你不会容忍一个人类同事这种口是心非,但 AI 撒谎又快又高效,所以就没事了。mojuba 报告了一个意外发现:LLM 不擅长设计 prompt——我们倾向于认为 AI 有某种自我知识、应该擅长给自己设计 prompt,但事实并非如此;他在一个高度依赖 prompt 的任务上挣扎很久,最后用自己的话从头重写了全部 prompt 才终于跑通,而每次让 Claude 去改 prompt,它无一例外把 prompt 改得更差。他推测这可以用训练集里 prompt 设计建议的质量来解释——「结论是,网上能找到的所有 prompt 设计建议其实都不怎么样」。

第五类是各种细碎但可复现的失败:反复问同一个问题时的一致性(TZubiri 回「把 temperature 设成 0」)、生成关键词搜索查询、简短的回答、数数、计算字符串长度、财务计算、数学、ASCII 图表、在 1 到 30 之间取随机数(kreyenborgi 回「哈哈我刚连续拿到四次 17」)、形态学分析、手语、事实核查、文档排版(能生成 typst 模板但要来回迭代很多次)、从照片识别鸟种、以及遵循指令本身。

HN 评论精华

这条帖子的形态本身就是「评论精华」——下面挑出信息量最大、最具体的几条。