小模型时代已经到来

查看原文 HN 讨论

文章摘要

作者 Calvin French-Owen 是 Segment 的联合创始人,这篇短文发表于 2026 年 8 月 26 日。核心论点只有一句:大家一直盯着前沿模型看,结果错过了小模型这几个月的进步;而真正会改变商业格局的,是「快/便宜/够用」这一档。

起点是他自己的使用体验。 过去几周他一直在玩 gpt-5.6-luna,形容它「快得离谱、聪明得离谱」,稳定跑到 100 tokens/s 左右,能在他的代码库、邮箱和知识库里横冲直撞。但 luna 最大的看点是成本:他跑了一些相当复杂的研究任务,发现「想花出一笔大账单都很难」——哪怕让它检索几千封邮件,API 费用也只是几十美分。他还提到 GLM 5.3 的出现,让帕累托前沿上又多了一个选项。他坦承自己写代码时几乎总是伸手去拿最贵最强的模型(Fable 5、5.6 Sol),所以很容易错过小快模型的进展

第二段是这篇文章真正的论证:token 成本决定了消费级 AI 公司为什么还没大规模出现。 他说有几个投资人问过他「奇怪,怎么没看到更多消费级 AI 公司?」他的答案很直接——token 成本。AI 之前的消费级打法是一套成熟剧本:做一个运行成本很低的网站 → 用病毒传播拉一堆用户 → 融资、扩到更多用户 → 建广告市场。Google、Facebook、Snapchat 大体都是这条路(他在脚注里说 Amazon 和 Netflix 是显著例外)。但一旦你要在产品里加 AI,每一个请求都带上了真实的推理成本,所需资本量陡然上升。

他用自己的一个私人 eval 举例:让模型研究他本人在互联网上的信息、判断他会喜欢什么新闻、然后搜 HN / Reddit / Twitter 做一个当天的个性化微型新闻站。用上一代模型(Sonnet 那一档),跑一次要 ~$1——这意味着订阅要收 $30/月才撑得住,而对一个消费级应用来说这是站不住的:如果你收 WSJ 或《经济学人》的价,你最好能交付相当的价值。而换成 luna,结果相当不错,平均成本约 $0.10。他说「这就能谈了」。

第三段把视角转向企业。 他和 Segment 的联合创始人 Peter 徒步时对了笔记。Peter 把工作分成两类:一是「IQ 180」型的工作——某个疯狂科学家式的天才想出你从没想过的解法;二是「token 喷射器」型的工作——极度响应、在几十条战线上把球往前推。Peter 现在同时运营多家公司(Charm Industrial 融了 1 亿美元以上,Revoy 刚关掉 A 轮),是个极度有条理、时间效率极高的人,但他说自己 ~95% 的工作落在第二桶:接电话、推人、拦截和处理。作者特意澄清 Peter 的意思不是第一类不重要——没有 IQ 180 的技术头脑解决深层问题,他的公司今天早就死了;只是大部分工作量在第二桶

由此推出结论:前沿模型的需求会继续复利增长,尤其在需要新突破和发现的领域(工程、硬科学、模型训练);但「快/便宜/够用」的需求正要起飞。他的类比很有说服力:想想你每天打交道的人——同事、供应商、客户,十次里有九次你想要的是一个超级响应、能把事直接办掉的人;今天公司里绝大部分「人类 token」就是这么花掉的,招聘也严重偏向「快/便宜/够用」这个原型。他承认要让小模型在商业场景真正落地还有很多工作要做——新的 harness、prompt 注入的安全性、角色与权限——但他相信这些都会解决。文章结尾是一句邀请:如果你也在试着让小模型变得有用,请联系他。

HN 评论精华

这条帖子 786 分、343 条评论。讨论的主基调不是赞同,而是「这有什么新鲜的」——大量评论指出没有大额报销额度的人早就在用小模型干活了;第二条主线是相当激烈的「Luna 到底够不够用」的实战对线,包括一个很具体的场景:公司为省钱把团队从 Sol「降级」到 Luna 该不该;第三条主线是对「小模型」这个词本身的吐槽——文章通篇讲的其实是便宜的托管模型,而不是本地模型,”small” 从头到尾没被定义。