开源权重 LLM 与闭源 LLM 之间的差距还有多大
文章摘要
这篇来自 Doubleword 的文章试图量化「开源权重(open weights)LLM」与「闭源 LLM」之间的性能差距。作者的度量方法是:观察开源模型追平闭源前沿模型新能力所需的时间。若仅看 Artificial Analysis 的头条「智能指数(Intelligence Index)」这一单一基准,外推可得出结论:开源模型将在 2026 年 12 月 3 日左右追平闭源前沿——距文章发表(2026 年 6 月)约六个月。
然而当作者把视野扩大到 18 个不同基准时,画面变得更复杂。跨全部指标的箱线图分析显示,平均差距在整个观察期内「几乎完全持平,稳定在略低于 5 个月」。不同领域的表现分化明显:编程(coding)基准进步最大,落后幅度从 15 个月骤降到 1-2 个月;而大多数其他基准上,滞后期只是温和增加。
文章的核心结论是:衡量 LLM 的「整体质量」本身就很困难。取决于你更看重哪个指标,预测结果可以从「即将实现平价」一直摇摆到「开源始终落后约 5 个月」。换言之,「差距」不是一个数字,而是高度依赖于你关心什么能力。
HN 评论精华
-
samat(高赞):一针见血地指出文章标题的用词错误——「开源模型(open source)」与「开源权重模型(open weights)」不是一回事。正文用词正确,但标题有误导性。这是评论区反复被强调的一点。
-
christina97:给出了对「中国开源模型难以反超美国前沿」的结构性分析。他认为美国实验室的领先源于用巨型「教师模型」生成海量高质量(多为合成)数据的巨大投入;而中国模型则靠极致的工程优化以及从美国前沿模型「蒸馏」数据来追赶。要想真正超越,这套等式必须翻转,中国实验室需从「收割前沿模型数据」转向自建数据生产体系。
-
jackconsidine:用「阿基里斯与乌龟」的芝诺悖论作比——通常这是谬误(阿基里斯终会超过乌龟),但在这里或许真的成立,因为开源模型正是靠闭源模型的蒸馏而变强,存在一个天然的「跟随」结构。
-
profsummergig、jacobgold、dabinat:担忧开源模型的可持续性。profsummergig 指出当下开源权重模型本质是某些私营机构(如 DeepSeek)的「慈善」,龙头随时可能被关掉;除非出现「社区共有的算力」,否则开源始终有被停更的风险。dabinat 进一步预测「开源盛宴终将结束」——可能因商业优势、地缘博弈,甚至因有人用开源模型作恶而遭封禁。
-
doctoboggan、gehsty:从地缘政治角度切入。前者推测:如果中国政府深度介入 LLM 战略,那么一旦其产出前沿模型,理应立即停止开源、转为限制访问——这或许正是美国政府急于切断技术流向的假设前提。
-
pdp:泼了盆冷水——对绝大多数实际用例而言,终端用户几乎感知不到智能差异。没人分得清一个落地页是 Fable 还是 GLM 生成的,「可感知的智能」达到某个点后就不再被在意,除了少数窄场景。