Echo's blog
Echo's blog
· 1 min read · 资讯

GLM-5.2登上AMD芯片,每美元性能再翻倍

一次让所有人都能受益的突破#

glm52 illustration 0

如果你最近在用国产大模型,大概率已经感受过智谱 AI 的 GLM 系列带来的体验。而就在昨天,一个消息让整个 AI 圈为之一振——GLM-5.2,这个来自中国的开源大模型,正式登上 AMD MI355X 芯片,跑出了 2626 tokens/ 秒 / 节点的惊人吞吐。

这个数字本身已经够有冲击力了,但更有意思的是它背后的趋势:AI 推理的”每美元性能”,正在以肉眼可见的速度翻倍。 用更直白的话说就是——同等预算下,你能获得的智能服务越来越多、越来越快、越来越便宜。

Wafer.ai 联合 Vercel AI Gateway 和 OpenRouter 共同完成了这次部署。GLM-5.2 在 AMD MI355X 上的单流推理速度也达到了 213 tokens/ 秒,这意味着无论是高并发的 API 服务,还是单用户的实时对话体验,都已经到了完全可以商用的级别。更关键的是,GLM-5.2 的推理成本比市面上同类方案低了超过一倍。

为什么这件事值得关注?#

glm52 illustration 1

过去的两年里,大模型的”军备竞赛”主要集中在训练端——谁的参数多,谁用的 GPU 多,谁就能抢到最多的关注。但 2025 年以来,风向变了。推理部署的效率,才是决定一个模型能不能真正走进千行百业的关键。

GLM-5.2 跑在 AMD 芯片上这件事,意义不止于一个模型和一个硬件的组合。它传递了一个更重要的信号:非 NVIDIA 的硬件生态,正在成为国产开源模型的坚实后盾。

长期以来,AI 开发者最头疼的问题之一就是生态绑定——NVIDIA 的 CUDA 固然强大,但也在无形中筑起了一座高墙。AMD 的 ROCm 生态一直在追赶,而这次 GLM-5.2 在 MI355X 上的表现,证明这条路已经走通了。2626 tokens/ 秒的节点吞吐,不是”勉强能用”,而是”性能极佳”。

这对于企业和开发者意味着什么?更多硬件选择、更灵活的供应链、更低的部署成本。当你不必再被绑定在单一硬件平台上,“AI 落地”这件事的门槛就降低了一大截。

GLM-5.2 到底有什么特别?#

glm52 illustration 2

智谱 AI 是国内最早一批专注于大模型研发的团队,GLM 系列也一直是国产开源模型的中坚力量。GLM-5.2 在模型架构和训练策略上进行了多项优化,在大幅提升推理速度的同时,保持了非常高的回答质量。

而这次与 AMD、Wafer.ai、Vercel AI Gateway 和 OpenRouter 的合作,则是把模型能力”管道化”了——开发者不再需要自己折腾底层部署,通过标准的 API 网关就能直接调用 GLM-5.2 在 AMD 芯片上的推理能力。Vercel AI Gateway 提供了一层可靠的路由和缓存,OpenRouter 则让模型可以被多个应用无缝调用。整个链条从模型到用户,变得前所未有的顺畅。

换个视角看,这其实是一次”去中心化”的 AI 基础设施实践。模型可以跑在不同的芯片上,通过不同的网关被分发,最终以最低的成本为用户提供最佳体验。这正是行业走向成熟的标志。

开源的力量,正在重塑 AI 格局#

glm52 illustration 3

GLM-5.2 是开源的。这意味着任何人都可以下载、部署、商用。当这样一个高性能的模型还能以开源的方式向全世界开放,加上 AMD 硬件的低成本和广泛可用性,一个很有趣的局面出现了:原本被少数巨头垄断的 AI 能力,正在被开源社区一点点”平民化”。

还记得 GPT-4 刚出来时,一个 API 调用能吃掉多少利润空间吗?而现在,在同等甚至更好的效果下,推理成本一降再降。GLM-5.2 在 AMD MI355X 上的表现只是最新的一例,但绝不是最后一例。我们有理由相信,随着更多国产开源模型登上更多硬件平台,“每美元性能翻倍”将从一个新闻标题,变成行业运行的常态。

对于正在用 AI 做产品的团队来说,现在是最好的时代。硬件在竞争、模型在开源、成本在下降、生态在开放。你要做的,就是抓住这个机会,把技术变成真正有用的东西。


Source: Hacker News | wafer.ai

Related Posts

Comments

Copied
Copied to clipboard