谁在害怕中国模型?
文章摘要
Ben Thompson 在这篇 Stratechery 文章中提出一个反直觉的论断:围绕 Kimi K3 等中国开放权重模型的恐慌,从纯经济学角度看是被严重高估的。真正值得担心的不是中国模型的能力本身,而是美国的政策反应——它一方面制造了网络安全上的漏洞,另一方面又不必要地削弱了西方开源开发者的竞争力。
他首先破除”开放权重就等于免费”的迷思。开放权重模型依然要承担可观的推理成本(COGS),Kimi K3 的官方定价就是每百万输入 token 3 美元、输出 15 美元。更关键的是,经济上真正有意义的单位是”智能”而不是原始 token 数量——不同模型为了得出同一个正确答案所需消耗的 token 量差异巨大,因此单纯比较 token 单价是没有意义的。
接着他把 AI 放进商品市场(commodity market)的框架里分析:在商品市场中,成本结构占优的供应商能持续获利,而边际供应商则面临破产压力。Thompson 预测 AI 智能终将商品化,这意味着未来决定胜负的是成本效率,而不是定价权。那么前沿实验室为什么会恐慌?他给出四条理由:历史上以训练成本为中心的思路必然要求高推理定价来摊销;收集智能使用数据能形成反馈飞轮;深度整合进客户体验才能形成差异化;以及意识形态层面对”排他性”的执着(他特别点名 Anthropic),这与开源替代品的存在存在根本冲突。
关于中国的战略动机,Thompson 引用了习近平近期关于”开放与共享”的讲话,认为这是一个有意图的战略:主动把 AI 商品化,从而强化本国在机器人和制造业上的优势——把利润从模型层挤走,让价值沉淀到中国更擅长的硬件与制造环节。
文章唯一承认的真实风险是网络安全。他举了一个尖锐的例子:当美国模型的安全护栏在事故响应中挡住了必要操作时,Hugging Face 的防御方转而使用了中国 Z.ai 实验室的开源 GLM 5.2 模型。以网络安全为名限制美国前沿模型,却让中国替代品趁机繁荣,这在安全逻辑上是完全倒置的。因此他的政策建议是:放宽美国前沿模型在网络安全场景下的限制;同时通过更新版权政策,明确”为训练模型收集数据属于合理使用”,并禁止服务条款禁止蒸馏(distillation),让西方开源开发者获得公平的训练数据入口。
HN 评论精华
-
aavaa:直接引用了文章中关于蒸馏的那段质问——大语言模型本身不就是前沿实验室从公开互联网上抓取并蒸馏出来的知识吗,那到底谁被冤枉了?他的态度是”以剑立身,以剑亡身”(live by the sword, die by the sword),完全赞同这条立法建议。ronsor 附和:”立刻被说服了,对不住了 OpenAI 和 Anthropic。”matheusmoreira 用一句黑色幽默总结禁止蒸馏的本质:”重罪级的蔑视商业模式罪。”
-
llm_nerd 给出了最锋利的技术反驳:把中国模型的成功归因于蒸馏是典型的美国例外论(而且所谓”美国”其实是一群在美工作的中国人、加拿大人、欧洲人和印度人)。他认为这同时也是一种股价防御性话术——假装自己有超级护城河,只是别人一直在里面游泳,所以要多放几条鳄鱼。他强调:任何做过大模型的人都知道,”一个接近 Fable 水准的模型是靠蒸馏训出来的”这个前提荒谬到不值一驳;理论上并非不可能,但那需要花几百亿美元打 API 调用。
-
qurren 提出法律层面的技术性质疑:政府无法”禁止”服务条款,因为 ToS 不是法律,它只是使用私人服务的前置条件。政府最多只能声明自己不予强制执行,OpenAI 和 Anthropic 仍可以通过封号封 IP 自行执行。eli 也认为前半条(训练数据合理使用)说得通——如果 LLM 能用受版权保护的数据训练,那它们也应该能用不受版权保护的 LLM 输出;但禁止 ToS 限制蒸馏很难成立:”OpenAI 难道无权决定自己想要什么样的客户?”
-
bluegatty 提出了一个更微妙的区分:从原始数据造模型是”价值增值”,而蒸馏是”价值抽取”,两者是有差别的。他承认这个区分很软、也不知道答案该是什么,但主张先承认这个差别再往下讨论——互联网可以算公共品、甚至可以为此征税,但那和蒸馏是两回事。grim_io 则反驳说,禁止蒸馏就像禁止用编译器去造另一个(可能更好更高效的)编译器。
-
关于”harness 是否构成护城河”的争论最为激烈。OleksandrC 说他自己写了很久 agent harness,可以有信心地说 harness 几乎不重要,AI 的全部魔法都在模型本身;像 mini-swe-agent 那样近乎裸奔的 harness,模型照样能把任务做好。dansquizsoft 用一个周末就写出了自己的自我改进 harness,覆盖 90% 的 Claude Code / Codex 使用场景。bze12 则替 Thompson 辩护:他说的 harness 指的是整个终端用户产品体验,不是 harness 代码本身——自己之所以留在 Codex,是因为它的 Mac 应用更好、习惯了在里面跑自动化。
-
wxw 用亲身经历反驳”粘性”论:他冬春几乎只用 Claude Code,入夏换到 Codex,切换毫不费力,此前从 Cursor 换过来也是一样。bushbaba 提供了一个惊人的企业级数据点:他所在的 F500 公司在 30 天内把 5000 多名工程师从 Claude Code 全部迁到 Copilot,连所有 agent 都从 Claude SDK 换成了 Copilot SDK,是他见过最快的迁移。但 nl 反驳道:你帮非程序员配过 AI 工作流吗?装 MCP 连接器、配特定 skills、绕开模型与 harness 的怪癖、设安全边界——这是一大堆活,大多数人一旦跑通就再也不想动了。philstephenson 一句话点明:”作为 HN 用户和评论者,你不是他说的那类用户。”
-
NooneAtAll3 质疑文章开头的前提:凭什么跑服务器算零成本,跑 AI 推理就不算?throwawayffffas 给出了量化回答:一台 1 万到 3 万美元的典型服务器,在 2-4 kW 功耗下能为 Facebook 这类传统 Web 应用每秒服务成百上千个请求,单个请求的边际成本实际为零;而 Kimi K3 的一次响应需要前期投入 50 万到 100 万美元、功耗超过 20 kW 的硬件,每个请求的成本至少占到收费的 5% 到 10%。
-
throwa356262 贴出 OpenAI 自家政策研究员 Dean Ball 的推文,说明连 OpenAI 内部也不完全买”蒸馏论”这套说法。但推文里的其他论点引发了更强的嘲讽:titanomachy 查完对方推特历史后发现,所谓”开放权重模型本质上是减速主义”的论证其实就是”如果把成本压下来,OpenAI 就没钱投研发,于是整体 AI 进展变慢”,他评价这暴露了一种”压倒性的愚蠢例外论”。an0malous 则指出这条推文的逻辑自相矛盾:一边说开放权重会导致”AI 共产主义”和”反乌托邦地狱”,下一段就提议美国成立一个联邦机构来阻止使用中国开放权重模型,”动机性推理达到了不真实的程度”。
-
fellowniusmonk 从制度层面收尾:美国的”高管阶层”过度沉迷于探索/利用循环里的”利用”部分,明显在过早关闭前进空间——宁要现在自己的一点钱和权力,也不要将来国家和人类的大量钱和权力。他认为美国”赢下这场竞赛”的机会相当渺茫,就像那些把等级制内化为”好东西”的社群,一群屎山小国王以越来越高的代价争夺越来越少的东西。