Echo's blog
Echo's blog
· 1 min read · 资讯

744B参数模型跑在旧电脑上:一份GLM-5.2个人部署实录

GLM-5.2 是一个 744B 参数的 MoE(混合专家)模型。这个数字意味着什么?如果以常规方式加载,它需要将近 1.5TB 的显存——也就是大概 12 张 A100 拼在一起。但有人在这两天证明了一件事:你不需要那么多显卡。

一个叫 Colibri 的开源项目,让 GLM-5.2 在一台只有 25GB 内存的普通消费级电脑上成功运行。没有 A100,没有 H100,没有奇怪的硬件。就是一台你可能就放在家里的机器。

全 C 语言,零依赖#

插图

Colibri 的作者叫 JustVugg,他在 GitHub 上开了一个项目,核心思路非常直接:用纯 C 语言写推理代码,不做任何多余的抽象。

现代深度学习框架(PyTorch、TensorFlow)为了通用性牺牲了大量性能。一个简单的矩阵乘法,框架层要经过 Python→C→CUDA 好几层调用。Colibri 绕开了所有中间层,直接用 C 做内存管理和计算调度。

成果是:GLM-5.2 的 744B 参数被量化到 4-bit 之后,整模型可以塞进 25GB 内存。推理速度大约是每秒 6-8 个 token——比你平时用 ChatGPT 慢很多,但考虑到这是在一台没有独立显卡的机器上运行的 744B 参数模型,这个速度本身已经是一件值得停下来想一想的事情。

量化到什么程度了?#

插图

4-bit 量化听起来是个很大的压缩比——从原始的 16-bit 或 8-bit 压到 4-bit,精度损失应该很大才对。

但 MoE 架构在这一点上有天然优势。MoE 模型每次推理只激活一部分专家(比如 744B 里的 45B),所以量化带来的精度损失只影响被激活的那部分参数。大量不参与当前计算的专家参数虽然是低精度存储的,但它们本来就”不在场”,对结果没有直接影响。

这就是为什么 GLM-5.2 即使被压到 4-bit,在 Toot Books 的 VAT 测试中仍然能达到接近人类会计的准确率。量化损失存在,但 MoE 架构消化了大部分的负面影响。

个人部署的临界点#

插图

如果说 2024 年个人部署大模型还是极客玩票,那 2025 年这个事正在变成一个有实际意义的选项。

Colibri 证明了,一个 744B 参数的顶级开源模型,不再需要数据中心级的硬件才能跑。25GB 内存是什么概念?一台 32GB 内存的 Mac Mini M4,或者一台加了内存条的中端 PC,就够了。

门槛的降低带来了几个连锁反应。一是数据隐私:你的账本、你的代码、你的私人文档,不需要上传到任何 API 服务器。二是持续成本:跑一次 API 按 token 收费,但自己部署是一次性硬件投入。三是定制空间:你可以修改推理参数、调整量化策略、甚至微调模型。

当然,速度还是远不如云端 API。每秒 6-8 个 token 意味着生成一篇 1000 字的文章要等好几分钟。但对于批量处理、定时任务、数据清洗这类不需要实时响应的场景,这已经是一个可用的速度了。

来源:GitHub (JustVugg/colibri) | Hacker News

Related Posts

Comments

Copied
Copied to clipboard