Pi 的极简主义正是它的优势

查看原文 HN 讨论

文章摘要

这是 Earendil(Pi 背后的公司)发布的一篇立场文章,核心论点用一句话概括就是:在 AI 让代码变廉价之后,行业普遍的做法是往编码 harness 里堆更多东西——更大的提示词、更多编排、更多层次、更多复杂度——而 Pi 走了完全相反的路,并且有外部证据表明这条路不仅更干净,还更便宜、更高性能。

Pi 的具体形态是:开箱只有 4 个工具,系统提示词加上工具定义总共不到 1000 token。它的理念是大部分工作用基础能力就能完成,需要更多就自己造。文章用两个外部案例来论证。

案例一:Databricks 的「每任务成本」研究。

Databricks 发布了一份名为《在 Databricks 数百万行代码库上对编码智能体做基准测试》的研究。为了避免外部基准过饱和带来的偏差,他们基于自家工程师日常执行的真实任务自建了基准。结论用他们自己的话说是:「模型被调用时所处的 harness,会极大影响成本和质量」,以及「在很多情况下,像 Pi 这样简单的 harness 在我们的工作负载上表现最好」。文章指出,在搭配 Opus 4.8(xhigh)时,Pi 拿到了最高的整体通过率,同时成本显著低于 Claude Code 和 Codex

这份研究之所以有说服力,是因为它把模型和 harness 分离开来测量。Databricks 报告说,当他们用相同的思考强度、把同一个模型跑在不同 harness 里时,「每任务成本差异显著(某些情况超过 2 倍),而质量保持不变」。Earendil 把这个特性称为 Pi 的「上下文纪律(context discipline)」,并引用了 Databricks 的具体测量:「Pi 每轮发送的上下文少了约 3 倍。它对上下文的管理更好,保持了更紧凑的工作集,并用更少的运行次数完成任务。

文章顺势提出了一个更一般的观点:必须考虑端到端的工程经济学,而不只是每 token 的价格——这在模型层面同样成立。他们观察到,跑复杂工作流时用 Haiku 4.5 往往比用 Sonnet 4.6 更贵,尤其是涉及代码执行时,因为智能体需要更多轮次才能成功完成任务。现在这个规律在 harness 层面同样出现了:更强、更贵的模型配上高效的 harness,可能比反过来的组合更便宜。

案例二:Shopify 用 Pi 造出 pi-autoresearch。

Shopify 工程博客中,David Cortés 描述了他如何把 pi-autoresearch 直接作为一个 Pi 扩展造出来——方法就是让 Pi「给 Autoresearch 写个扩展」,Pi 读自己的扩展文档,然后从那里开始搭建新工作流。Autoresearch 是一个用编码智能体做优化的自主循环:你要求一个改动,它跑实验找出什么有效、什么造成了回归;只要目标是可度量的,它就能扔掉回归并持续自我改进。Shopify 报告的成果包括单元测试跑得「快了 300 倍」、React 组件挂载「快了 20%」、多个项目的构建时间下降,甚至连 pnpm 的性能也有改进。

文章强调的重点是:Pi 并不内置这些工具中的任何一个,它只是让你极其容易地造出它们。「与其假定厂商懂你的工作流、试图把天底下所有工具都塞进去,不如 Pi 这样假定你最懂,然后把可扩展性交给你去挥舞和打造。」

为什么是现在?

文章承认,大约一年前还可以论证原生 harness(模型围绕它构建)具有结构性优势,但这个论点已经变弱了。前沿模型现在普遍很擅长理解终端(或类终端)编码环境并在其中行动——Anthropic 最近把 Claude Code 的系统提示词砍掉了 80%,就是一个明确信号。于是问题从「harness 有多原生」转向「它如何处理上下文以避免冗余,并用干净的原语行动」。

最后一个论点关于本地模型:Earendil 认为本地模型发展很快且很有前景,而 Pi 的上下文纪律在这里尤其是资产——本地模型上下文窗口通常更小,prefill 可能很慢,因此保持稳定的提示词前缀至关重要。上下文纪律意味着「除非用户明确要求,否则我们不改变上下文」,从而避免长达一分钟的重新 prefill。

HN 评论精华

这条帖子拿到 548 分、294 条评论,是本期讨论最激烈的一条。真实走向是:Pi 的用户群极其活跃且忠诚,但反对意见同样具体尖锐,而且争论焦点很快从「极简是否更好」漂移到了两个更实际的问题——沙箱安全,以及 XDG 目录规范。

「Pi 是 Emacs / Neovim」这个类比主导了整场讨论

「别折腾工具,去干活」派

沙箱与安全:本帖第一个真正的痛点

XDG 目录规范:本帖第二个、也是更情绪化的痛点

其他值得记录的具体经验

</content>