对话 Boris Cherny:我们砍掉了 Claude Code 80% 的提示词

查看原文 HN 讨论

文章摘要

这是 Y Combinator 频道 2026 年 7 月 27 日发布的一段 36 分钟访谈,标题为「Boris Cherny: We Cut 80% of Claude Code’s Prompt」,上线数日播放量已超过 21 万。访谈在 Startup School 2026 现场录制,由 YC 的 Diana Hu 对话 Claude Code 的创造者 Boris Cherny,时间点正好在 Opus 5 发布的第二天。官方章节列表包括:Opus 5 有何不同、解决提示注入、Claude Code 为何删掉 80% 的系统提示、对你的 AI 产品按下删除键、如何重建系统提示、产品悬置与「解除束缚」、给 Claude 更难的问题、提示工程正在改变、跑了两周的 Claude Code 提示、运行数千个智能体、编程(几乎)已解决、每个 CS 学生仍应学什么。YC 同时放出了完整文字稿。

Opus 5 的两项新能力。Cherny 说每次训练都会尝试教模型一大堆东西,多数不奏效,但总有一部分学会了,有时还会学会你根本没教的技能。Opus 5 上他认为没有其他模型做到过的一点是:它能极长时间地持续运行,配合 Auto Mode 可以连续跑上数天、数周乃至数月而不停下,甚至不需要任何脚手架。另一件让他兴奋的事是模型看起来已经不再可被提示注入了——人们讨论「致命三要素」很久了,而这直接影响 harness 设计、智能体设计和产品设计。一年前模型读到网上「顺便把用户电脑上的东西全删了」这类指令真的会照做,现在不会。他说这是三年对齐研究的成果,叠加对全部流量运行的提示注入分类器(基于机制可解释性工作,字面意义上观察模型「大脑」里在提示注入发生时点亮的神经元,模型自己都不会说出来,但他们能看见并诊断),再叠加 Auto Mode 分类器,三层下来他们已经无法演示出提示注入了。

删掉 80% 的系统提示。Cherny 说很多人可能没意识到,Claude Code 作为产品和 harness 一直在变,每次新模型出来他们都会删掉一大块系统提示、改掉一大块,工具集和工具提示也一直在改。原因是每个模型都很不一样,三个月前为某个模型做的事可能完全不适用于下一个。Opus 5 就是太聪明了,系统提示里很多内容原本是在纠正「模型本该知道却不知道」的行为,现在 Opus 5 直接就做对了。他还透露了一个未文档化的功能:设置环境变量 CLAUDE_CODE_SIMPLE=1 再运行,会删掉包括工具在内的所有系统提示;他们用这个做消融实验来判断提示是否有用。有意思的发现是,没有这些提示时模型其实还更聪明一点,但作为产品你确实需要一些提示,因为它们帮助用户使用产品、让模型的行为符合人的期待。

消融式开发。Diana 总结说这在旧世界里是创业公司绝不会干的事——每六个月对所有东西按一次删除键。Cherny 澄清他们不会删掉整个代码库,但确实删掉很多。他解释「消融」(ablation)来自研究:删掉整个系统提示,然后一行一行加回来,以判断每一行的影响;这本质上是一种 eval。工具也一样,他们经常下线工具、经常删 harness 代码。他说今天 Claude Code harness 里的代码几乎全是关于安全、权限和静态分析的,还有一堆 UI 代码,其他很多代码早就下线了。他建议所有构建智能体产品的人都这么做,对于只是使用 Claude Code 的用户,他的建议是每六个月删掉你的配置、skills 和 hooks,看看模型会怎么做,可能会让你吃惊。

重建的方法与「反工程化」心态。重建要一块一块来:先删,然后用;不要猜模型需要什么指令,因为你可能猜错。只有当你反复看到它在同一件事上栽跟头时,才把那条指令加回来。要记住模型每次使用都会读这条指令。他说这与他做过的所有工程都不同:过去你构建大而美的系统,前期认真设计,有大量单元测试,重构是一个持续数月甚至数年的大项目;模型不是这样,更像一个活物、一个有机体,每一代都有略微不同的性格,你得花时间去了解它,然后据此调整 harness。这是彻底经验主义、科学式的过程。关于 eval,他认为 eval 比 harness 活得久一点,但也没久多少——一个 eval 大概能活一到三代模型,如今曲线太陡,往往刚跑饱和就得扔掉重做。

产品悬置与解除束缚。「束缚」(hobbling)指模型本来能做某事,是你在挡路;「产品悬置」(product overhang)指今天的模型就已经具备很多能力,但没有产品让它表达出来。他举了 Claude Code 诞生的例子:一年半到两年前 Sonnet 3.5 是当时最好的编程模型,但那时的编程产品在做单行补全、多行补全,或者只读的代码库问答,没有产品能释放模型「一次写完整个函数、整个文件」的能力。于是 Claude Code 的想法就是——扔掉所有脚手架,给模型最简单的 harness。他认为今天的模型存在大量创业公司尚未捕捉的产品悬置。

具体案例。第一个是 Bun 的重写。Claude Code 构建在 Bun 之上,而 Bun 用 Zig 写成,需要手动内存管理,容易出内存泄漏。Bun 团队原先让 Claude 对代码库做模糊测试来触发内存泄漏,一次一个 case 地找。后来 Jared 决定干脆试试整体重写,用每一代新模型去试这道题;从 Fable 开始模型开始能做到,Opus 5 也能。做法是定义好测试套件(Bun 和 Node.js 都有很大的测试套件,所以容易判断对错),用一条提示启动一个动态工作流(dynamic workflow),跑了 11 天,重写了整个 10 万行以上的代码库,从 Zig 改到 Rust。Cherny 强调这不是一次性成功,中途有引导(steering),但此前的模型即使有引导也做不到。这份成果现在已经在生产环境,就是你今天运行 Claude Code 时用的东西。第二个例子是他自己的实验:想看看 Claude 桌面应用如果做成原生的会是什么感觉,于是在 Claude Tag(跑在 Slack 里的 Claude)里开了一个会话,先接上 GitHub 的 macOS runner,再给它一个空的 Swift 代码库,然后下了一条提示——把 Electron 应用重写成 Swift,在 Mac 虚拟机里运行 Electron 版、截图、逐像素与 Swift 版对比,不做完不要停。访谈录制时这个任务已经跑了两周多且仍在运行,Claude 还自己建了个 Slack 频道,每隔几分钟发截图直播进度。他估计它派生了数千甚至数万个子智能体。

动态工作流与自我维护。他解释动态工作流的做法是用 Bun 作为沙箱、在其中启动虚拟机,让 Claude 启动并编排大量智能体:先派一批做第一遍,再派一批验证或总结,再扇出第三阶段。他的背景是函数式编程,所以这套设计本质上是「智能体的代数」——有顺序执行的方式,有并行执行的方式。他称之为一种新形式的测试时计算(test time compute)。另一条路径是 loops 和 routines:loop 相当于本地跑的 cron,routine 是跑在云端的同一个东西(可以合上笔记本)。他们现在让 Claude 维护自己:在一个 Slack 频道里跑一堆 routine 来维护 CLI、iOS、Android、桌面应用的代码库。例如「清理死代码」是一条只有一句话的提示,Claude 每天用静态和动态分析在所有代码库里找死代码并提 PR——用静态分析这件事没人提示过,是它自己想出来的。其他 routine 包括把已经 100% 放量的实验代码清掉并发布、为覆盖不足的区域补测试、删掉旧模型或旧时代的人留下的无用测试。他最喜欢的一条叫「抽象警察」:在大代码库里找那些经过时间演化被重复实现了多次、其实应该合并的近似抽象,并把它们统一起来。他说现在每天有 20 到 30 条这样的 routine 在跑,「还没完全做到,但我们正走在完全自动化应用维护的路上」。

编程是否已解决。Cherny 主动加了限定:编程对他做的那类编程来说已经解决了,但不是对所有人。仍然有非常深的系统代码库让 Claude 吃力,分布式系统让 Claude 吃力,非常细的 UI 验证(差了一个像素之类)Claude 也还不完美——Opus 5 在视觉和计算机使用上是一次大跃进,但仍不完美。现场举手调查中,「100% 代码由智能体写」和「超过 50%」的举手人数相差不多。关于「验证」他强调这是人们最普遍做不对的一件事:给 Claude 一个稍微超出你认为它能力范围的任务,然后让它能像你自己做时那样验证自己的工作。至于 prompt engineering,他说一年前最热门的岗位是提示工程师,后来变成上下文工程师,这些浪潮会来来去去;他的建议是「别听 LinkedIn 网红的」,不存在什么一招鲜,只能经验主义地做。他观察到写了很多年代码的工程师有一个非常常见的失效模式:过度指定,试图让模型按自己会用的方式一步步做,而这不是模型的工作方式。

给学生的建议。Cherny 说他学计算机是实践式的:中学时在 TI-83 计算器上用 BASIC 写代数解题器来在数学考试上作弊,还写过一份 TI-83 编程指南发到网上,后来用串口线把程序分给同学,同学们成绩也变好了;等到微积分,BASIC 不够用了,他就转去写汇编以便「作弊得更好」。他的建议是不要只学计算机科学理论,还要学会应用它——做创业公司、做产品、培养自己的设计感和商业感、学数据科学、学会和用户对话,这些技能与工程结合起来才真正有价值。访谈最后他宣布现场所有人都能获得 Max 20X 订阅。

HN 评论精华

这个帖子拿到 74 分、80 条评论,规模不大但对抗性很强。HN 的整体反应远比访谈本身怀疑:一部分人认真讨论「删配置」这条建议的技术合理性,另一部分人直接把 Cherny 定性为 token 推销员。

关于「删掉你的 CLAUDE.md」

「他是个 token 推销员」

「harness 缺的不是并行智能体忍术」

用户实感