开源AI追上了闭源吗:一个即将到来的临界点
圣诞节前的倒计时:一个漂亮的预测

如果你只看一个基准——Artificial Analysis Intelligence Index——那么开源大语言模型与闭源之间的差距将在 2026 年 12 月 3 日归零。这个日期听起来像是一个完美的叙事节点:圣诞购物季之前,开源终于追上了闭源。图表上的两条曲线优雅地交汇,仿佛暗示着某种历史必然。自 2024 年中以来,这条差距线确实在稳步收窄,趋势清晰得令人信服。一个单一指标给出了一个漂亮的答案:快了,真的快了。
但漂亮不等于真实。
十八面镜子:当衡量本身成为发现

问题在于,衡量大语言模型质量这件事,本身就充满了陷阱。研究人员在 18 个不同的基准测试上持续追踪开源与闭源的差距,结果呈现出一幅远为复杂的图景。把这 18 条差距曲线叠在一起看,平均值是一条几乎水平的线,稳定在大约五个月的滞后——从 2024 年到今天,没有收窄,也没有扩大。那个朝着零冲刺的信号,只是一面镜子的反射。另外十七面镜子各自映照出不同的现实。
这不是一个测量误差的问题。这是一个”你测量什么”的问题。如果你的答案是”编码能力”,好消息是开源的追赶速度惊人——从落后 15 个月缩小到仅仅 1 到 2 个月。这个领域的技术社区贡献了最多的开源模型、最活跃的调优迭代,以及最激烈的竞争。编码基准上的每一分进步都来自真实世界的工程需求——这是开源模式天然擅长的领域。
数学、推理与看不见的裂缝

但编码以外的故事截然不同。在数学推理、复杂逻辑、多步骤规划这些基准上,开源与闭源的差距不仅没有缩小,反而呈现温和扩大的趋势。这些领域不依赖于大量公开可用的训练数据和社区贡献的微调策略。它们更依赖核心算法突破、大规模算力投入,以及——不妨直说——那些还没有被充分复现的技术秘密。
这意味着什么?开源社区在”用什么方式追赶”这件事上是有选择性的。那些可以被社区协作快速迭代的领域(编码、指令跟随、工具使用)进步神速;而那些依赖基础研究和算力堆叠的领域(数学推理、科学理解),闭源公司的先发优势不但没有消失,反而在缓慢扩大。两个阵营之间的竞争,正在从一场赛跑变成多场不同节奏的比赛。
技术的真相往往藏在追问里

单一基准给出确定性,多样基准给出复杂性。在 AI 领域,后者更接近真相。2026 年底的那个”临界点”——如果只关注编码能力——或许真的会成为现实。但技术从来不是一条曲线就能概括的。当你说”开源追上了闭源”的时候,你需要先回答一个更难的问题:你说的”追上”是针对什么?编码、推理、知识广度,还是某种综合能力的加权平均?
每一份激动人心的预测背后,都藏着它没有说出的前提。而找到这些前提,才是理解技术趋势真正的方式。差距也许在缩小,也许在稳定,也许——取决于你怎么看——它根本就不是一个单一的差距。2026 年的圣诞钟声敲响时,真正的故事不是开源是否追上了闭源,而是我们终于学会了用不止一把尺子去衡量进步。
