Echo's blog
Echo's blog
· 1 min read · 资讯

GLM52开源模型冲上AI评测第一

Z ai 的新模型 GLM-5.2 在 Artificial Analysis 的智能指数上登顶开源模型榜首,得分 51。这个数字放在上下文里看才有意义——MiniMax-M3 是 44,DeepSeek V4 Pro 是 44,Kimi K2.6 是 43。GLM-5.2 拉开了一个身位。

参数没变,能力涨了#

参数没变能力涨了

GLM-5.2 的大小跟上一代完全相同:7440 亿总参数,400 亿激活参数。在同尺寸下提升了 11 个智能指数分,靠的是架构改进和数据质量优化。

提升最明显的是科学推理。CritPt 科学推理测试提高了 16 个百分点,HLE(人类最后考试)提高了 12 个百分点,GPQA Diamond 到了 89%。SciCode 编程题也有 7 个百分点的提升。这说明训练策略在做更深层的推理能力强化,不是简单地堆参数。

智能和成本的平衡点#

智能和成本的平衡点

GLM-5.2 在”智能 vs 每任务成本”的帕累托前沿上占了一个好位置——在同智能水平上成本最低。每次推理任务约 0.46 美元,比 GLM-5.1 的 0.25 美元高,但和 Kimi K2.6 的 0.31 美元、MiniMax-M3 的 0.18 美元放在一起时,它的智能分高出一截。

这是开源模型领域少见的取舍:大多数模型要么追求极致低价,要么追求极致性能。GLM-5.2 选择了一个折中位置——你多花一点钱,换来多得多的智能。

百万级上下文和 MIT 许可证#

上下文窗口从 200K 扩到了 1M token——这种规模的提升意味着一次可以喂进整本《三体》三部曲还有富余。对于处理长文档、代码库分析、多轮对话场景来说,实际感知很强烈。

最让人意外的是许可证:MIT。完全开源,没有任何使用限制。DeepSeek V4 Pro 是 MIT + 商业条款限制,MiniMax-M3 也带附加条款——GLM-5.2 的 MIT 授权在所有开源模型中是最宽松的。考虑到它在智能指数上的表现,这对企业用户来说是一个很难拒绝的组合。

来源:Artificial Analysis | Hacker News

Related Posts

Comments

Copied
Copied to clipboard