大语言模型奖励专业能力
文章摘要
Sean Goedecke(GitHub 工程师)这篇短文要反驳的是一个流行观点:既然大家用的都是同一批模型,那么「会提示的人」和第一次接触 LLM 的人得到的结果应该差不多,所以使用 LLM 根本不存在什么技能可言。他的论断相反且非常明确——提示(prompting)中最重要的技能,是你所提示的那个领域里的专业能力。
他先承认前提的一半是对的:在 2010 年代,如果你有技术盲区(比如不会写 CSS),你要么依赖一位有本事的同事,要么祈祷互联网上恰好有人问过你这个具体问题。今天,任何人都能通过委派给 LLM 写出「凑合能用」的 CSS。LLM 把所有人都变成了通才(generalist)。
但接着他用 Terence Tao 与 ChatGPT 讨论雅可比猜想(Jacobian Conjecture)新发现反例的那段对话作为反例。作者的评价是:这根本不是我在用的那个 ChatGPT——即便给他无限 token,他也到不了 Tao 到达的地方。他从这段对话里提炼出几点观察:Tao 的消息非常短、直击要点,他不逐条回应模型,只回应要旨;模型的输出也比作者自己跟 GPT-5.6 Sol 谈数学时简洁得多——通过释放「专家信号」,Tao 把模型推入了「对数学家说话」的模式,而不是「向外行解释」的模式;Tao 会在模型看起来不对时推回去,但不直接否定,而是说「这比我期望的要复杂」这类话;他自己做出多次跳跃与建议,几乎从不接受模型关于「下一步往哪走」的意见。
但作者随即强调:你不可能靠照抄这几条技巧就像 Tao 那样提示数学问题。他技术的关键是真的理解那些数学——能从模型多段回复里拎出那个相关的想法,能提出替代路径或替代表述,能识别出「哪里看起来怪怪的」。
作者把这个结论迁移到自己的领域:Terence Tao 作为数学家的水平,高于他作为程序员的水平,但「领域知识让你更会用 LLM」这件事他自己也经历过。如果你对某个代码库有一套好的心智模型(a good theory of your codebase),你就能把 LLM 推得比毫无熟悉度时远得多。因为你心里有个「好的解法大概长什么样」的判断,你才能说出「不对,我觉得这里可以更简单」「但我们不是已经有 X 了吗」「能不能用我们熟悉的这套术语来表达这个问题」。这呼应了他此前写过的一个观点:系统设计问题由具体的特定细节主导,而不是通用原则;他宁可要对代码库的熟悉,也不要对软件系统的深刻通用理解。
文章的落点是:领域知识的有用性意味着,即便模型变得更强,人类专业能力仍将持续有价值。对很多任务来说,瓶颈是人而不是模型——困难的部分在于向模型精确传达人想要的是哪一类解法。信息其实「已经在模型里」,但要把它拽出来需要一个非常聪明的人。文章后来加了一段编辑说明回应 HN 讨论:有人指出 OpenAI 的数学提示词其实很外行,所以专业能力并非必需;作者回应说 OpenAI 确实有一支专家数学家团队负责检查和过滤模型建议的发现,而这一步目前跳不过去。
HN 评论精华
-
postalcoder 提出了讨论中最有力的反驳,也是文章后来专门回应的那条:Anthropic 那位搞数学的人的提示词本质上就是「假设你必须解决这个猜想,一切都指望它了,好好想,多想几个思路,但记得相信你自己而不必迷信常规智慧」——非常不专业,却奏效。他还指出 Tao 那段对话的目的是建立直觉,而不是从零解题。他的结论很妙:「有意思的是,每个人对这些模型到底奖励谁都得出不同结论。有人说通才受益最大,有人说是专家。像人生中的其他事一样,也许赢家就是那个真的动手去做的人。」atleastoptimal 补充了一个关键限定:数学之所以适用是因为它自我可验证,一旦有了证明就不需要外部证据;在模型无法自我验证的场景里,专业能力才是评估输出所必需的。
-
Swizec(工程管理者)提供了本帖最有意思的一手数据:所有大模型 API 都给你统计数据,他们能看到每个人烧了多少 token、产出了多少东西,而token 消耗量与产出之间存在相当强的负相关——人烧的 token 越多,产出好结果的可能性越低。他自己的方法论是「就跟它说话」(Just Talk To It)。
-
sramsay 用具体例子印证了「释放专家信号」的效果:他会开场写「我在圣经学研究上有相当背景,可以假定我读过新约研究领域最重要的著作。不要翻译希腊语、拉丁语、希伯来语或叙利亚语。现在我想知道……」,这会显著改变对话质量;告诉模型你有 20 年 C 语言经验、理解机器组织和内存布局也同理。QuercusMax 说他在个人项目里加了一句「我是专业软件工程师,虽然这是业余项目但我不是在 vibe coding,我要可靠的软件」,agent 立刻开始主动建议各种让代码更健壮的做法。
-
abixb 提出了「放大镜式的镜子」(amplifying mirror)这个被多人接受的比喻:LLM 最终是你与它交互方式的反射——你的语气、提示的结构、你倾向关注问题的哪些方面、你的词汇广度和世界知识。谨慎地把它当作自己心智与感官延伸的人会蓬勃发展,把它当作心智替代品的人会挣扎。ramraj07 把这个比喻推进一步:放大镜不只是特性,而是 LLM 的根本驱动力——它消耗的每一个 token,首要目标都是搞清楚你是谁、你想要什么;你打「Hola」和打「hi」传递的信息量就已经天差地别。
-
boron1006 给出了最重要的负面视角:在科学计算领域,AI 对有专业知识的人是巨大的乘数,但它同时也在贬值这份知识——因为完全不懂的人可以用听上去合理的胡说八道把整个领域堵满。「现在的情况是,如果有人告诉我他们做了某件事,我去查发现全是 AI 垃圾,那我在这个项目上花的时间就比那个『做出来』的人还多。这个局面完全无法维系,只会不断从有更重要事情要做的人身上抽走时间和资源。」
-
kwakubiney 提了一个被反复点赞的「反向问题」:在 LLM 时代,你要怎么获得专业能力?这套逻辑奖励的是 LLM 出现之前就已经有专业能力的人,那些还没有的人怎么办?michaelchisari 的回答简洁有力:跟在重型机械时代怎么练出力气一样——自己去举重。技能得靠人为设定的约束来建立:纸笔、读书、不用 AI。lionkor 同理:自己做东西、不用它调试、不用它查资料,会很痛苦,而那份痛苦就是学习。travisgriggs 从另一头表达了同样的焦虑:他刚花三小时用 agent 搭出一套 BLE 配网压力测试脚本,之所以顺利是因为他有大量 BLE、Python 和 shell 经验;他的不安在于——以后可能再也没人能获得这种经验了,而这会在有经验的人和没经验的人之间造成真实的张力。
-
zmmmmm 提出了一个耐人寻味的分类:现在存在一条日益扩大的鸿沟,一边把 LLM 看作乔布斯意义上的「心智的自行车」,一边认为它将完全取代人类智能的角色。他怀疑这与其说是关于 LLM 的判断,不如说是两种人的原型——LLM 两种模式都很擅长,它只是竖起一面镜子映照使用它的人;当前大多数预测其实是人们对自己希望的结局的一厢情愿。jappgar 一句话总结:「确实有两种人,骑自行车的和偏爱自动驾驶车的。」
-
petres 提供了诚实的自我怀疑:这篇文章不错,也许有几分道理,但它基本上写的是我作为程序员想读到的东西——专业能力仍然值钱。而他自己观察到的是相反的:自 LLM 出现以来,专家与非专家之间的差距一直在缩小,虽然还在,但正在消失。Austiiiiii 表达了同样的警惕:这事真的需要被正式研究一下;他倾向于认为这符合自己的经验,但排除不了确认偏误——而且这个假设对他的职业与财务如此便利,恰恰是他认为必须保持怀疑的原因。
-
cyberax 给这个现象找了个名字:马太效应(Matthew Principle)——凡有的,还要加给他;没有的,连他所有的也要夺去。
-
aanet 提到一个被所有人忽略的角度:Gell-Mann 失忆效应——把「记者」替换成「LLM」就完全成立。任何在自己领域里有真本事的人,都不止一次纠正过 LLM 的回答,但转头读别的领域时又忘了这一点。
-
bob1029 的比喻同样精彩:LLM 像死星,如果你不知道该往哪儿瞄,多半会打偏且毫无效果甚至负效果;目标越远,你的射击方案就要越精确。给现有产品加个暗色主题基本算贴脸开火,而从零构建整个代码库、或把遗留代码库重构成新的,按这个比喻算是好几光年之外。