GLM-5.2:大模型越大越能编
被数字颠覆的直觉

如果你觉得参数越多模型越聪明、幻觉应该越少,那下面的数据可能会让你重新审视这个判断。
GPT-5.5,业界估算参数规模在 1 到 2 万亿之间,是当前最庞大的闭源模型之一。它在 Artificial Analysis 的 Omniscience 幻觉评测基准上的幻觉率是 86%。Fable 5,Claude 系列的最新旗舰,幻觉率 48%。而 GLM-5.2,参数总量 7530 亿、激活参数仅约 400 亿的开源模型,幻觉率只有 28%。
GPT-5.5 的幻觉率是 GLM-5.2 的三倍。一个规模数倍于对手的模型,在”不说瞎话”这件事上,被一个开源模型甩开了几条街。
这还不是孤例。DeepSeek V4 Pro,参数规模 1.6 万亿,在同一个基准上的幻觉率高达 94%。评测方特别指出,V4 Pro 消耗了十倍于其他模型的计算资源用于推理链,最终产出了一个”自信满满但完全错误”的答案。
GLM-5.2 处理同样的技术难题,只花了 12 秒、800 个 token,就准确识别出了问题的技术不可行性,并给出了明确的拒绝。
直觉被颠覆了。更大的模型,似乎并没有学会”不知道”这件事。
越大越会编

长期以来,业内主流叙事是”scaling law”——参数越多,模型的泛化能力越强,知识储备越丰富,表现也就越好。这条法则在标准 NLP 基准(MMLU、HumanEval、GSM8K 等)上确实成立,几乎从未失手。
但幻觉评测揭示了一个截然不同的趋势:在 Omniscience 这样的对抗性测试中,模型越大,幻觉率反而越高。参数规模的扩张没有带来更谨慎的判断力,反而让模型更善于生成合理的谎言。
逻辑并不复杂。大模型本质上是一个基于海量文本训练的”下一个 token 预测器”。参数越多,它记忆的文本模式就越丰富,对”听起来像真话”的文本模式的拟合能力就越强。一个拥有万亿参数的模型,几乎总能在它的训练数据中找到某个片段,拼接出一段语法完美、逻辑自洽但事实错误的回答。
GLM-5.2 之所以能在幻觉率上表现突出,部分原因在于它的架构设计——7530 亿参数中只有约 400 亿处于激活状态的 MoE(Mixture of Experts)结构。参数总量的”冗余”被刻意控制,模型被迫在有限的计算路径内做出判断,而不是调动全部记忆去”编”一个答案。
这引出了一个更深层的问题:我们到底想要一个”什么都知道但经常胡说”的模型,还是一个”能力有限但不会瞎编”的模型?
三个不可能同时满足的目标

GLM-5.2 的成绩揭示了一个至今无解的三难困境:原始能力、不确定性校准(即低幻觉率) 与计算效率,三者不可能同时达到最优。
追求原始能力,就需要海量参数和深度推理链。但海量参数意味着模型更容易在训练数据中找到”看起来相关”的片段来填充答案,而非真正理解问题。深度推理链则给模型提供了更多”编造”的空间——DeepSeek V4 Pro 消耗十倍 token 却翻车翻得更彻底,就是最好的例证。
追求低幻觉率,就需要模型具备高度的不确定性校准能力——在不知道答案时勇于说”不知道”。但这通常需要额外的对齐训练、强化学习或专门的拒绝机制,而这些方法往往会削弱模型在标准基准上的得分。
追求计算效率,就要限制激活参数和推理深度,而这天然地制约了模型能处理的任务复杂度。
GLM-5.2 的 753B/40B 架构在三个目标之间找到了一个相当巧妙的平衡点。它在 Artificial Analysis Intelligence Index 上距离 GPT-5.5 仅差 4 个点,距离 Fable 5 仅差 9 个点——考虑到参数规模上的巨大差距,这个成绩本身就说明了”做减法”的价值。
而三难困境的真正可怕之处在于:目前没有任何已知的架构或训练方法能同时突破这三个维度的天花板。
开源与闭源的分水岭

GLM-5.2 还有一个不容忽视的身份:它是MIT 协议下开源的模型,由智谱 AI(Z.ai)发布,权重完全公开。这意味着任何人都可以在本地部署、二次开发,甚至深入分析它的行为模式。
与之对比,GPT-5.5 和 Fable 5 都是闭源模型。后者更是在发布三天后就被美国政府施加了出口限制——Fable 5 的能力被认为过于强大,需要纳入监管框架。
幻觉数据给这个局面增加了一层讽刺意味。能力最强的闭源模型恰恰是幻觉率最高的,而能力”较弱”的开源模型反而在可靠性上遥遥领先。如果”可靠性”和”诚实”是被监管的关键指标,那闭源阵营交出的答卷并不好看。
GLM-5.2 的数据告诉我们一个朴素的道理:让模型学会说”我不知道”,可能比塞给它更多参数更难。而这件事,恰恰决定了我们是否真的能信任这些语言模型去做决策、写代码、回答问题。
参数战争不会停止,scaling law 短期内也不会被推翻。但 GLM-5.2 给出了一条不同的路径:不是盲目堆参数,而是在能力与诚实之间找到可持续的平衡。对于任何一个真正想把大模型用在实际场景中的人来说,这可能是比跑分更重要的信号。
来源:Hacker News | Artificial Analysis
