744B参数的GLM-5.2,在一台普通电脑上跑起来了
你打开一个 GitHub 仓库,看到这么一行介绍:小引擎,巨大的模型。一只蜂鸟的图标旁边写着——“在 25GB 内存的消费级机器上运行 744B 参数的 GLM-5.2”。
一台普通电脑,跑一个比 GPT-4 还大的模型。
744B 参数是怎么塞进 25GB 的?

GLM-5.2 有 7440 亿个参数,是典型的 MoE(混合专家)架构。所谓 MoE,就是模型内部有很多”专家模块”,每次推理只激活其中一小部分。这就像一个超级大公司,虽然有几万名员工,但处理你的请求时只需要找那三五个相关的人就够了。
但即使只激活部分参数,完整加载这个模型需要的内存依然是天文数字。光是把所有权重从硬盘搬到内存里,就需要 1.5TB 的空间。25GB,连零头都不够。
Colibri 项目的核心技巧叫作”专家流式加载”(expert streaming)。它不像传统推理引擎那样把整个模型压在内存里,而是像放幻灯片一样:需要哪个专家模块,临时从磁盘读进来,用完就扔掉,换下一个。
这听起来简单,实际做起来有两大难点。一是磁盘 I/O 的速度远低于内存,如果你的硬盘不够快,模型推理速度会慢到让人崩溃。二是 GLM-5.2 的专家调度依赖复杂的路由机制,你没法预判下一步需要加载哪个专家。
Colibri 用纯 C 语言实现了这一切,零外部依赖。不是 Python、不是 CUDA,就是最底层的 C。作者说这么做的原因是——“C 是唯一一种你可以在任何机器上找到的运行环境”。
省钱哲学:硬件降级,模型不降级

部署大模型通常有两派思路:一派是”砸钱”,买 A100、H100,把最贵的硬件堆在一起跑最牛的模型;另一派是”压缩”,把模型量化、蒸馏、剪枝,变成一个小模型去适配你的破电脑。
Colibri 走的是第三条路:硬件降级,但模型不降级。
你不需要花几十万买企业级显卡。一台带 SSD 的普通 PC(32GB 内存起步),就能运行 744B 参数的顶级模型。代价是什么?速度。在 PCIe 4.0 的 NVMe 硬盘上,它的推理速度大约是每秒 2-3 个 token。比云端 API 慢了几百倍,但对于一个非实时场景来说,完全够用。
想象一下:你睡觉前把一批任务交给它,第二天早上起来看结果。不是实时对话,是”隔夜分析”。
这件事对普通人意味着什么

GLM-5.2 是目前智谱 AI 最强的模型之一,在多个基准测试中与 GPT-4 系列不相上下。但在这个项目之前,想用 GLM-5.2 只有两条路:要么调用智谱的云端 API(按 token 付费),要么自己买几块企业级显卡(花几万块)。
Colibri 撕开了第三条口子——你可以在自己的电脑上,离线运行一个世界级的模型,不依赖任何云服务商,不上传任何数据到别人的服务器。
对于隐私敏感的企业(比如律所、医院、金融机构),这意味着他们可以在本地部署顶级 AI 能力,数据完全不出门。对于个人开发者,这意味着你可以在没有 GPU 的笔记本上探索 744B 参数模型的行为——这在一年前是天方夜谭。
开源社区的力量

Colibri 发布后迅速在 Hacker News 上拿到了将近 900 票。评论区里工程师们最关心的不是”能不能跑”,而是”能跑多快”。有人用 Optane 持久内存实现了 8-10 tokens/ 秒,有人尝试把专家预加载到 RAM 磁盘上(虽然内存不够),还有人直接在树莓派上试了试——当然,速度感人。
这个项目的意义不在于”它跑得有多快”,而在于”它让很多人第一次意识到,顶级 AI 模型和普通电脑之间的距离,没有想象中那么大”。
来源:GitHub (JustVugg/colibri) | Hacker News
