软件工程基本功比以往更重要

查看原文 HN 讨论

文章摘要

作者 Joseph Heck(博客 Rhonabwy,2026 年 8 月 15 日)从一个很个人的切口写起:他今天的冒充者症候群表现为「当一个软件工程师到底意味着什么」。他的立场并不反 AI——他明确说在「harness + 模型」这个组合里找到了一件「真正的强力工具」,而且他观察到做出最惊人成果的人往往不是在社交媒体上高调宣告这个职业终结的那批人:他们找到了一根「大棍子」,正在摸索支点位置,像阿基米德那样撬动世界。他也不认为能力会消失——即便他不认可未经许可地取用全世界的知识,也不认可某些人正在搞的经济自我交易(他形容那是在给本已下沉的美国经济抹花生醬),而且他看过的所有报告都说大模型的经济模型不可行,但能力本身不会消失,反而在快速缩小:开放权重模型已经让(配置强悍的)个人电脑能做同样的事,效果稍差,但时间和能力上的差距不大。

他的核心论证链条是:「能不能做到」只是起点,远不是软件/系统工程师职业的主体。 他用自己二十几岁学电焊的经历作类比——他很快就造出了自己搬不动、甚至搬不出车间门的东西(幸好有乙炔割炬);那次学到的教训和这次是同一个,只是换了介质:东西是怎么组合起来的,才是决定性的差别。 如果你带点前瞻性地用 agentic harness 开发,你不只能得到「它能跑」,还能得到「它可测」(他重度依赖 “develop with red/green TDD” 这个提示词);但再往上就不太扎实了。接缝——你的代码怎么工作、它的「API」、它如何与其他软件契合——既是科学也是艺术,由一堆依赖你视角、经验和猜测的主观判断构成,既要看你现在解决什么,也要看你要与这份软件长期共存多久。让软件可调试、可维护、分层、可组合,这仍然是很难的把戏,需要大量深思熟虑的推理,而这正是今天的 LLM(哪怕是前沿模型的能力上限)力所不及之处。

接着他给出机制层面的解释:LLM 不「推理」,它预测,模型本质上是压缩过的成文人类知识;所以只要某段人类推理被编码进去了,它就能回响出来。对聚焦软件开发的 agent 而言,那些推理轨迹(reasoning traces)就是模型最宝贵的数据。他引了一篇他称为「相当好读」的论文 The Illusion of Thinking 来说明 LLM 的推理有多差,并给出他正在关注的另一个方向作为对照:包含「对行动结果的预测」的研究,也就是 JEPA 模型、LeWorld Model 和 Yann LeCun 近期的演讲——那和今天的编码 agent 是相当不同、也相当迷人的领域。

但他随即转向建设性的一面:与 LLM 协作仍有大量提升空间,很多红利甚至还没开始榨取。 他今天看到的大部分收益来自两件事:在正确的时机给它好的、精炼的数据;以及提供带自然语言反馈的确定性验证工具,让 LLM 能自我纠正。他说真正让他惊叹的不是模型能预测该写什么,而是它在工具调用和遵循指令上如此有效。而这种「指令遵循」也有其阴暗面,即 Simon Willison 命名的 lethal trifecta(致命三要素):模型无法分辨好建议与坏建议,从根本上不可能总是一致地防住 prompt injection;对齐工作、安全 harness 和沙箱都能挡掉最糟的情况,但存在根本性的缺口——「某个东西不知疲倦地遵循指令却又不具备良好推理,这在我看来是噩梦燃料」。

他的期望是近期能在模型训练上有进展,把「构建具备清晰接口、可调试、可维护的软件」的推理轨迹纳入后训练(RLHF)的关键评估目标。结论部分他重申了自己的价值判断:认真审阅、规划、修补软件(和系统)的接缝,是我们既能够、也必须运用的关键技能——有没有 agentic 助手都一样;而当他看到「哦,这个很容易实现」的浪潮和人们伸手去抓「clanker」(他对 AI 工具的戏称)来搞定它时,他认为这比以往任何时候都更重要。他强调从来没有单一答案、没有万灵药,永远是权衡取舍;核心是管理认知负荷,学会判断哪些部分需要稳定、哪些地方希望留出弯折的余地。文章末尾他还留了一句 2026 年特有的自证:「是的,那些破折号都是我自己写的。」

HN 评论精华

这条帖子 324 分、248 条评论。讨论主线有三条,而且都没怎么停留在作者的核心论点(接缝、可维护性)上:一是「你们说 agent 不好用,是不是姿势不对」的实战经验交换;二是一场关于「LLM 到底算不算推理」的漫长哲学缠斗;三是一位用户声称自己 150k 行代码、两个月不看一行代码全靠 agent 维护,引发了整场里最激烈的对峙。另有一条完全跑偏的支线在争论宜家家具能不能反复拆装。