大语言模型奖励专业能力

查看原文 HN 讨论

文章摘要

Sean Goedecke(GitHub 工程师)这篇短文要反驳的是一个流行观点:既然大家用的都是同一批模型,那么「会提示的人」和第一次接触 LLM 的人得到的结果应该差不多,所以使用 LLM 根本不存在什么技能可言。他的论断相反且非常明确——提示(prompting)中最重要的技能,是你所提示的那个领域里的专业能力。

他先承认前提的一半是对的:在 2010 年代,如果你有技术盲区(比如不会写 CSS),你要么依赖一位有本事的同事,要么祈祷互联网上恰好有人问过你这个具体问题。今天,任何人都能通过委派给 LLM 写出「凑合能用」的 CSS。LLM 把所有人都变成了通才(generalist)。

但接着他用 Terence Tao 与 ChatGPT 讨论雅可比猜想(Jacobian Conjecture)新发现反例的那段对话作为反例。作者的评价是:这根本不是我在用的那个 ChatGPT——即便给他无限 token,他也到不了 Tao 到达的地方。他从这段对话里提炼出几点观察:Tao 的消息非常短、直击要点,他不逐条回应模型,只回应要旨;模型的输出也比作者自己跟 GPT-5.6 Sol 谈数学时简洁得多——通过释放「专家信号」,Tao 把模型推入了「对数学家说话」的模式,而不是「向外行解释」的模式;Tao 会在模型看起来不对时推回去,但不直接否定,而是说「这比我期望的要复杂」这类话;他自己做出多次跳跃与建议,几乎从不接受模型关于「下一步往哪走」的意见。

但作者随即强调:你不可能靠照抄这几条技巧就像 Tao 那样提示数学问题。他技术的关键是真的理解那些数学——能从模型多段回复里拎出那个相关的想法,能提出替代路径或替代表述,能识别出「哪里看起来怪怪的」。

作者把这个结论迁移到自己的领域:Terence Tao 作为数学家的水平,高于他作为程序员的水平,但「领域知识让你更会用 LLM」这件事他自己也经历过。如果你对某个代码库有一套好的心智模型(a good theory of your codebase),你就能把 LLM 推得比毫无熟悉度时远得多。因为你心里有个「好的解法大概长什么样」的判断,你才能说出「不对,我觉得这里可以更简单」「但我们不是已经有 X 了吗」「能不能用我们熟悉的这套术语来表达这个问题」。这呼应了他此前写过的一个观点:系统设计问题由具体的特定细节主导,而不是通用原则;他宁可要对代码库的熟悉,也不要对软件系统的深刻通用理解。

文章的落点是:领域知识的有用性意味着,即便模型变得更强,人类专业能力仍将持续有价值。对很多任务来说,瓶颈是人而不是模型——困难的部分在于向模型精确传达人想要的是哪一类解法。信息其实「已经在模型里」,但要把它拽出来需要一个非常聪明的人。文章后来加了一段编辑说明回应 HN 讨论:有人指出 OpenAI 的数学提示词其实很外行,所以专业能力并非必需;作者回应说 OpenAI 确实有一支专家数学家团队负责检查和过滤模型建议的发现,而这一步目前跳不过去。

HN 评论精华