开源大模型距离追上闭源还差多远?
编码能力的一条追赶曲线

2024 年夏天,一张基准测试图表开始在 AI 研究者中间流传。Artificial Analysis Intelligence Index 的数据显示,开源大模型与闭源大模型之间那道看似不可逾越的鸿沟,第一次出现了收窄的迹象。最引人注目的是编码能力的变化:开源模型在编程基准上的落后幅度,从一度高达 15 个月,急剧缩减到了如今仅 1 到 2 个月。这意味着,如果你是一名开发者,在两年前可能压根不会考虑用开源模型写生产代码,但今天这件事已经变得相当现实。
但编码只是众多能力维度中的一项。如果把目光从代码切换到数学推理、多语言理解、长文本处理,事情就远没有这么乐观了。
五个数字背后的十八张面孔

18 项不同的基准测试,构成了一个复杂的拼图。Artificial Analysis Intelligence Index 综合了这些测试的结果,给出了一个平均数字:开源模型整体落后闭源模型约 5 个月。这个数字看起来不算太糟,仅仅半年的差距,似乎再等一等就能追上。然而,平均值掩盖了一个关键事实——在某些维度上,差距非但没有缩小,反而在扩大。
有些基准测试中,开源模型已经从原来的追赶者变成了接近并跑的状态;但在另一些领域里,闭源模型的领先优势几乎纹丝不动。这就像观察一位学生各科成绩的平均分,一个好看的总分背后,可能是文科优秀而理科不及格的巨大偏差。大模型的能力评估从来不是一条单一的赛道,正因如此,“5 个月差距”这个说法本身,就隐藏着太多不确定性。
同一条数据,两种结局

同样一批基准数字,用不同的方式解读,会得出截然不同的预测。如果你采用线性外推的逻辑,将编码能力追赶的趋势套用到所有维度上,你会得到一个令人兴奋的结论:开源模型将在 2026 年圣诞节前后全面追平闭源。这个时间点恰好踩中了无数人的心理预期——似乎每个关于 AI 的重大转折,都发生在某个节日前夕。
但如果你换一种视角,不去看那条最乐观的曲线,而是盯着那些差距仍在拉大的基准,你会发现另一种可能性:开源模型始终落后闭源约 5 个月,而这个相对距离几乎没有缩短的趋势。更棘手的是,随着闭源厂商在特定能力上持续投入资源,这个 5 个月的差距在某些维度上甚至可能在拉大。5 个月,这个数字看起来像是追上了,又像是永远追不上。
一个测量难题的水下冰山

为什么不同基准之间的差异如此之大?答案出乎意料地朴素:我们其实还没有找到测量大模型能力的完美方法。现有的基准测试各有侧重,各有盲区。有的测试对训练数据泄露特别敏感,有的测试覆盖的场景过于狭窄,有的测试本身就在不断被更新的模型”刷榜”。一个人写代码的能力和解决数学问题的能力,本质上并不是同一件事,但我们常常用一个简单的总分来概括它们。
这带来一个根本性的困境:当我们说”开源追上了闭源”时,我们到底在说什么?是在某个特定测试上拿了高分,还是在真实应用中交付了同等的体验?这两个问题之间的差距,可能比开源和闭源之间的差距更大。
等待一个更诚实的答案

开源社区在过去两年里创造了惊人的速度。从无人问津到几乎追平编码能力,这本身就是一场值得记录的技术迁徙。但技术世界不喜欢模糊的答案,企业决策者需要明确的信号来决定百万美元的采购方向,开发者需要清晰的路线图来选择技术栈。
基准测试的困境不会很快消失,模型的评估方法可能永远追不上模型本身的发展速度。开源模型究竟何时能追上闭源?也许答案不在下一张排行榜上,而在某个没有被任何基准包含的真实场景里——当人们不再需要讨论这个问题的时候,追赶本身就结束了。
来源:Doubleword | Hacker News
