开源权重 LLM 与闭源 LLM 之间的差距还有多大

查看原文 HN 讨论

文章摘要

这篇来自 Doubleword 的文章试图量化「开源权重(open weights)LLM」与「闭源 LLM」之间的性能差距。作者的度量方法是:观察开源模型追平闭源前沿模型新能力所需的时间。若仅看 Artificial Analysis 的头条「智能指数(Intelligence Index)」这一单一基准,外推可得出结论:开源模型将在 2026 年 12 月 3 日左右追平闭源前沿——距文章发表(2026 年 6 月)约六个月。

然而当作者把视野扩大到 18 个不同基准时,画面变得更复杂。跨全部指标的箱线图分析显示,平均差距在整个观察期内「几乎完全持平,稳定在略低于 5 个月」。不同领域的表现分化明显:编程(coding)基准进步最大,落后幅度从 15 个月骤降到 1-2 个月;而大多数其他基准上,滞后期只是温和增加。

文章的核心结论是:衡量 LLM 的「整体质量」本身就很困难。取决于你更看重哪个指标,预测结果可以从「即将实现平价」一直摇摆到「开源始终落后约 5 个月」。换言之,「差距」不是一个数字,而是高度依赖于你关心什么能力。

HN 评论精华