小模型时代已经到来
文章摘要
作者 Calvin French-Owen 是 Segment 的联合创始人,这篇短文发表于 2026 年 8 月 26 日。核心论点只有一句:大家一直盯着前沿模型看,结果错过了小模型这几个月的进步;而真正会改变商业格局的,是「快/便宜/够用」这一档。
起点是他自己的使用体验。 过去几周他一直在玩 gpt-5.6-luna,形容它「快得离谱、聪明得离谱」,稳定跑到 100 tokens/s 左右,能在他的代码库、邮箱和知识库里横冲直撞。但 luna 最大的看点是成本:他跑了一些相当复杂的研究任务,发现「想花出一笔大账单都很难」——哪怕让它检索几千封邮件,API 费用也只是几十美分。他还提到 GLM 5.3 的出现,让帕累托前沿上又多了一个选项。他坦承自己写代码时几乎总是伸手去拿最贵最强的模型(Fable 5、5.6 Sol),所以很容易错过小快模型的进展。
第二段是这篇文章真正的论证:token 成本决定了消费级 AI 公司为什么还没大规模出现。 他说有几个投资人问过他「奇怪,怎么没看到更多消费级 AI 公司?」他的答案很直接——token 成本。AI 之前的消费级打法是一套成熟剧本:做一个运行成本很低的网站 → 用病毒传播拉一堆用户 → 融资、扩到更多用户 → 建广告市场。Google、Facebook、Snapchat 大体都是这条路(他在脚注里说 Amazon 和 Netflix 是显著例外)。但一旦你要在产品里加 AI,每一个请求都带上了真实的推理成本,所需资本量陡然上升。
他用自己的一个私人 eval 举例:让模型研究他本人在互联网上的信息、判断他会喜欢什么新闻、然后搜 HN / Reddit / Twitter 做一个当天的个性化微型新闻站。用上一代模型(Sonnet 那一档),跑一次要 ~$1——这意味着订阅要收 $30/月才撑得住,而对一个消费级应用来说这是站不住的:如果你收 WSJ 或《经济学人》的价,你最好能交付相当的价值。而换成 luna,结果相当不错,平均成本约 $0.10。他说「这就能谈了」。
第三段把视角转向企业。 他和 Segment 的联合创始人 Peter 徒步时对了笔记。Peter 把工作分成两类:一是「IQ 180」型的工作——某个疯狂科学家式的天才想出你从没想过的解法;二是「token 喷射器」型的工作——极度响应、在几十条战线上把球往前推。Peter 现在同时运营多家公司(Charm Industrial 融了 1 亿美元以上,Revoy 刚关掉 A 轮),是个极度有条理、时间效率极高的人,但他说自己 ~95% 的工作落在第二桶:接电话、推人、拦截和处理。作者特意澄清 Peter 的意思不是第一类不重要——没有 IQ 180 的技术头脑解决深层问题,他的公司今天早就死了;只是大部分工作量在第二桶。
由此推出结论:前沿模型的需求会继续复利增长,尤其在需要新突破和发现的领域(工程、硬科学、模型训练);但「快/便宜/够用」的需求正要起飞。他的类比很有说服力:想想你每天打交道的人——同事、供应商、客户,十次里有九次你想要的是一个超级响应、能把事直接办掉的人;今天公司里绝大部分「人类 token」就是这么花掉的,招聘也严重偏向「快/便宜/够用」这个原型。他承认要让小模型在商业场景真正落地还有很多工作要做——新的 harness、prompt 注入的安全性、角色与权限——但他相信这些都会解决。文章结尾是一句邀请:如果你也在试着让小模型变得有用,请联系他。
HN 评论精华
这条帖子 786 分、343 条评论。讨论的主基调不是赞同,而是「这有什么新鲜的」——大量评论指出没有大额报销额度的人早就在用小模型干活了;第二条主线是相当激烈的「Luna 到底够不够用」的实战对线,包括一个很具体的场景:公司为省钱把团队从 Sol「降级」到 Luna 该不该;第三条主线是对「小模型」这个词本身的吐槽——文章通篇讲的其实是便宜的托管模型,而不是本地模型,”small” 从头到尾没被定义。
- 最高赞的开场来自 swiftcoder:「我觉得挺好笑的,这些沉迷追前沿模型的人,才刚刚注意到小模型对大多数任务已经『够用』了。我们这些没有 Fable 级别报销额度的人,很久以前就注意到了。」SomeonesAccount 附议:Composer 2/2.5 又强又便宜又快,「别人为 GPT 5.5 之类的东西惊叹时,我们这边在用更低的成本和更快的速度把活干完」。jlkuester7 说连消费级硬件上跑的 32B 模型对某些工作流都已经够用。
- 但这条线下面立刻有高质量的反驳。kccqzy 抓住了「most tasks」这个词:按百分比算,一个典型 SWE 不在开会或写文档时做的大多数任务确实只是花哨的自动补全,但那很无聊所以没人谈;人们追前沿模型,是因为他们都记得自己曾在某个算法难题上耗掉一周,或者有些复杂算法自己根本实现不出来——那种生产力提升是「一周变一小时」。相比之下「十分钟变一分钟」的提升根本占据不了人的心智。samspot 提供了一份很扎实的实测:他 5 月拿到 AI 权限,5、6、7 月大量使用小模型,「Haiku 4.5 写代码很糟糕」;这个月加进 Luna 后能力惊人,他需要换更强模型的频率从 1/2 或 1/3 降到了 1/50,并强调「我得出这个结论显然不是因为我沉迷追前沿模型」。
- NitpickLawyer 贡献了本帖被引用最多的一段思考。他回忆 2024 年初用一个 7B 本地模型配合 Guidance 库搭了个流程:模型先收到测试的伪代码、先写测试、他批准后才开始写代码直到测试通过。这是在「思考型模型」出现之前,但通过「引导」模型的 prompt/instruct 上下文,他已经看到了今天思维链里那种「哦,测试 x 没过是因为……,我需要……」。他当时的顿悟是:「哪怕模型从此再也不进步,我也有好几年的乐子可以找出各种用法。」 他认为这条「真理」今天依然成立,而且「够用」这个阶段不只属于 API 模型,本地模型也到了——即使更慢更笨拙,它们对一个不断扩大的任务集合已经够用了。gozzoo 补了一刀:「这些东西别说 10-20 年前,4 年前都会被当成魔法。」
- 围绕「小模型到底是不是本地模型」有一条明确的纠偏。embedding-shape 的吐槽被顶得很高:「我很喜欢『小模型』原来指的是『一个大小未知、但大概比另一个我们也不知道大小的模型更小的模型』。」delis-thumbs-7e 说他也在找 OpenAI 有没有开始公布参数量,「基本上他们说的就是更便宜」。bartleeanderson 说文章一提到跑不了本地的前沿模型他就 “TB;DR”(Too big, didn’t read),daquisu 回复得很准确:读完全文会发现它讲的是「够用的便宜模型」而不是「小模型」,”local” 一词全文压根没出现过。
- 「Sol 降级到 Luna」这条支线是全帖最实用的部分。teiferer 描述了朋友公司的真实争论:为成本考虑要从 Sol「降级」到 Luna,很多人不高兴,因为不想被强加更差的工具。回复分成几派——pseudosavant 给了最平衡的一条:Luna 确实很能打,比 12 个月前的顶级 SOTA 强得多,但确实不在 Sol 的水平;不过同样的钱你能拿到 20 倍的 token,而且 tokens/s 快得多,如果是成本敏感的公司、可选「有限的 Sol」或「近乎无限的 Luna」,他会选 Luna。usef- 提出的折中方案被很多人认可:用聪明模型做规划、Luna 当执行者,什么都用 Sol 很贵而收益不大,因为很多步骤不需要那种智能。noodletheworld 的立场最强硬:「Sol 更好吗?绝对是。任何告诉你 Luna『一样好』的人都不知道自己在说什么。从 Sol 到 Luna 就是降级。这不是问题,这是事实。」但他接着说「值不值那个成本」只有你自己能回答,并给了个很妙的管理建议:发给团队额度、让他们自己挑合适的工具;如果谁 20 分钟就把额度烧在 Sol 上,那这个月剩下的时间就手写代码吧——团队会很快调整,人们讨厌失去 AI 权限。反方 shepherdjerred 说自己主动选 Luna 省钱,但如果是被强制用 Luna 他会很不爽,甚至会开始找下家:「我不想在一个我对自己的工具没有选择权的地方工作。」kingstnap 提醒了一个反直觉的成本陷阱:小模型加大思考努力的边际收益很差,如果算上走错路、产出糟糕结果、过度思考,很可能花更多钱得到更少东西。brikym 一句话终结:「讨论这个很蠢,直接跑 eval。」
- azuanrb 给了本帖最像工程报告的一条。他在给公司做一个通过 Slack 处理 on-call 和告警的 agent,跑了几个场景的 eval,最喜欢的是 Sol medium 和 Luna xhigh:Sol medium 在智能和响应时间之间平衡得好;Luna xhigh 能在 eval 上拿到类似分数,但明显更慢,他的判断是「更高的推理努力在补偿更低的基础智能」。有预算的话他会选 Sol medium,因为在真实场景里 Sol 明显更善于绕开问题、探索替代方案、在显而易见的路走不通时有创造力——排查线上告警时根因的路径往往不直,这一点很关键。
- ittsel 提了一个被反复引用的成本陷阱:「注意推理 token。我们试过一个小推理模型,每次调用烧掉约 2800 个思考 token,尽管价目表更便宜,实际成本是一个更便宜的非推理模型的 3 倍。」low_tech_punk 从另一个角度提出同一问题:现在的 tokens/s 被严重虚高了,因为大部分 token 进了思考环节,他好奇有没有一个考虑思考效率的「有效速度」指标;ak_t 回复说现在很多 benchmark 已经在测每完成一个任务的总成本或能耗。
- 反对「够用」这个概念本身的最好一条来自 zmmmmm:「『够用』这个概念很有意思,因为人们系统性地高估它。质量更低但被认为『够用』的东西,往往最后要么不够用,要么和直接用高质量的那个比起来不值。」他说要等到在生产里看到小模型才会相信这个门槛被跨过——目前在他看到的高价值场景里,连前沿模型都还卡在「不够好」这道门前。butterisgood 给了具体案例:他用 Sol 做了一堆工作,结果 Opus 5 找出了一堆 bug,而且是对的,「Sol 的结果没达到它该有的水平。那我怎么去信任 Luna?」ib33 的吐槽最生动:他看完文章从 Sol Medium 换到 5.6 Luna Medium,「结果回到了愤怒和被 gaslighting 的感觉」——有一次模型说「你说得对,我已经修好回归并提交了」,但根本没修好;他承认「两个 prompt 不撞五小时限额确实很爽,但我想知道因为便宜模型变成一个易怒的人值不值得」。robinduckett 一句话版本:「100 t/s 的垃圾还是垃圾。」
- giraffe_lady 给了对「小模型专用化」路线最有分量的技术质疑:「所有人都希望这是答案,但我们一次又一次发现模型越大,它在所有任务上都越好,包括远在它优化领域之外的任务」——Claude Fable 写代码和写散文都比更小的、代码专用或散文专用的模型强。他说视觉模型和语言模型收敛到同一个几何空间这件事,对「局部任务不需要全局知识」这类梦想应该是极度警示的;他并不是说小模型不能用,而是「小模型好,是好在它们像大模型,而不是好在它们小」。这直接回应了 michael0church 提出的「底部还有空间」的观点(大参数量是世界知识的小金库,很多应用不需要世界知识甚至以其为负)。LPisGood 从另一角度提问:世界知识少,本身不就意味着更多幻觉吗?
- 有几条很具体的落地案例。Zigurd 做了一个 Bluesky 客户端,用端侧模型做信息流摘要(抽取主题、分类帖子、每个主题下生成摘要):一开始结果一塌糊涂、进展缓慢,后来接上从 Hugging Face 便捷下载模型的设置以加快实验,再调了调 prompt,上周这个功能从「科学实验」跃迁成了他自己真会用的东西;关键在于全部端上运行意味着这个「最多也就是低收入的产品」没有可变成本,而且他在 M1 Mac 和 Pixel 8 这类尾端设备上测过,性能完全可接受。他总结出的原则很好:「关键是我没有在为开放式问题索要开放式答案。一旦它被证明有用,它不会变得更没用或更贵。」maestroquirk 说他们跑一个微调过的小 VLM 做 OCR,「成本大概是常规视觉 API 的 1/3,小模型基本上就是我们的整个产品」。jmtulloss 说他把自己那套建模施工项目的「大型严肃 harness」分叉成了一个 vibe coding 的家庭助理:「在 Luna 出现之前我一直搞不清怎么让玩具跑在玩具价位上。现在你可以用大概 $5 vibe code 出一堆给家人用的小应用,日常运行只要几美分。」
- jillesvangurp 提供了一个反直觉的成本数据点:他们做了几个基于 OpenAI 的简单应用,几个月前充了 $10 的 API 额度,至今只烧掉约 61 美分,上个月约 126 个请求。他认为 AI 在应用里是被严重低估的能力——人们都在规划宏大的 agent,但哪怕一个「根据用户输入的这些符号名算一个配色方案」的按钮,也只是一个很快返回、不需要大量推理的简单 prompt。他明确反对为此上本地托管:那会让他付出更高成本和开销换更低智能,除非你真的要用海量 token 或有数据安全等别的理由,「否则你只是在为闲置的 GPU 容量付钱」。
- 也有对「本地」路线的强烈情感投入。spl757 说自己只跑本地模型(RTX 3060 12GB 加一张 GTX 1660 Ti 补 6GB 显存),但他真正担心的是:AI 泡沫里押进去约 1.5 万亿美元,全是基础设施和模型公司之间的循环支出,没有一家盈利;他们迟早要从消费者身上把这 1.5 万亿收回来,也就意味着推向只能在线的按量付费云模型,届时他们必然会把用本地 AI 的人视为「流失客户」,试图扼杀本地托管的能力、或者把它 enshitify 到让订阅显得更顺眼。「我不是说我相信这会发生,我只是担心会。有别人也担心吗?」trvz 从同一方向给了两条理由支持玩小模型:一是黑客本来就觉得好玩,二是「当云模型变得不可用或者品质退化时,这些就是你手里全部的东西了。不如早做准备。」
- 对「为什么不干脆一直用最强的」这个问题,回复区贡献了一串精彩类比。hartator 说他只想要最聪明最强的模型,感觉小模型只是通往更好硬件的过渡;krisoft 回敬:「所以我一直用安-225 运输机去买菜。真的需要吗?不需要,但我拒绝在(曾经/将来)最好的东西上妥协。」0xbadcafebee 给了更实际的版本:「想要和需要是两回事。我想要一台 650 马力的 V8 超跑,我需要一台 150 马力的丰田卡罗拉。为什么选一辆能力更差的车?因为我不想为了买菜多花 10 倍的钱。」arjie 给出了最有洞察的一条:响应速度本身就是价值——需要引导的任务里,响应快才能引导得好;而无人值守的任务里,好模型就是更好。「因为有些任务连 Fable 都做不好、你反正得引导它,那还不如引导一个快 5 倍的 80% 模型。」他甚至描述了一个有点反讽的工作流:用好模型起个头,用差模型做规划迭代,再交给好模型评审,最后让好模型实现。
- 关于「消费级 AI 公司」这个原命题,andsoitis 提出了尖锐的质疑:什么才算消费级 AI 公司?前沿实验室已经宣布要吃掉一切而且有先发优势。他认为最好的赌注是当逆向者,去做人们真正想要或需要的产品和服务——AI 驱动或增强都可以,但消费公司干的苦活是理解具体的消费者需求。shostack 换了个说法把问题讲清楚了:「如果我们重新表述成『为什么没有消费级的 AWS?』,就说得通多了。」nonethewiser 提了个有意思的空白:他很意外游戏里没有更多模型——不是「这个 NPC 只是个 system prompt 里塞了人设的聊天机器人」,而是做更有目的性的小模型,「我们游戏里明明已经有叫做『AI』的系统了,怎么会觉得这些强得多的 AI 没有位置?」
- 回应这个的是本帖最好玩的一条。2001zhaozhao 说他的梦想是在家用服务器(比如一张 RTX 5060)上跑一个 LLM 驱动的游戏,快到、聪明到能给几十个并发玩家提供乐趣,玩家提功能就当场做出来加进游戏给大厅里的人玩,托管成本低到他不用收费。U4E4 回复说他现在就在做:自制的 DnD 引擎加手机聊天界面,骰子有丰富的 3D 模拟和触感反馈,但没有花哨的图形渲染——「汁水在于富有想象力的群体故事生成」;自托管视频通话上跑本地实时 STT,把玩家的插科打诨和闲聊转成下一步行动的骰子检定;一台 m3 ultra 96GB 上的 Qwen 处理 NPC、DM、机器人队友、故事弧、一致性、历史、记忆和冒险节拍;甚至有一个让吟游诗人在冒险结束时把整场胡闹压缩成韵文歌谣的机制。他说以他朋友们能挤出的游戏时间来看,这种社交人际游戏体验和他们的 3A 游戏时间竞争得相当不错,而且玩家在会话记录里直接提的需求已经被直接实现了。
- 最后几条值得一提。caust1c 的框架被不少人认可:大模型本身不是产品,推理只是一种新型的计算;他确信两三年内每个产品都会把推理能力集成进体验,模型之间会越来越难区分。产品从模型那里需要的东西其实是个很短的清单——能好好调用工具、准确回忆、以及不动摇地遵循指示(无论指示是烘焙进权重还是来自 system prompt),这覆盖了产品里 95% 的推理效用,而这些能力会装进小模型。有意思的是他由此预测硬件需求会保持高位,尽管「托管」推理的需求下降。swatcoder 给了本帖最漂亮的一段概括:这项技术的婴儿期表现为追求宏大昂贵的通用模型,指望它从用户几十个词的懒惰、欠发育、含糊表达里辨认出完整准确的意图;而青春期将随着这些过大且欠考虑的野心崩塌而到来,取而代之的是一场「模型+harness」二元组的寒武纪大爆发——经过蒸馏、微调和索具化,以惊人的效率和人机工学去交付范围狭窄但形状各异的任务。mattmaroon 则用一句话反转了文章标题的因果:「对快、便宜、够用的模型的需求一直近乎无限,要起飞的是供给。」