GLM-5.2当会计:比人类便宜99%,还更准
当你听到”大模型能做会计”这种说法,第一反应大概率是——又来了,AI 万能论的新变种。但这次不太一样。
Toot Books 是一家做英国中小企业记账的 SaaS 公司,他们最近干了一件实在事:拿智谱 AI 的开源模型 GLM-5.2,跑了一整套完整的季度 VAT(增值税)申报流程。结论是——GLM-5.2 处理了 59 笔交易,花了 68 分钟,成本不到人类会计的 1%,准确率几乎一样。
这不是实验室里的 benchmark 数据,是真实会计软件里的实际业务流程。
定价 68 分钟,成本 0.3 英镑

完整的测试是这样设计的:把过去一个季度的交易数据——59 笔银行流水、对应的发票和收据 PDF——原样喂给 GLM-5.2。模型自己登录会计软件,自己判断每一笔交易的类型、税率、科目,把 VAT 算好,把申报表填好。
整个过程花了 68 分钟。GPU 算力成本大概是 0.3 英镑。
对比一下:一个人类会计处理同样工作量,即使熟手也得一两个小时,按英国会计时薪算,成本大概是 50-100 英镑。差了不止两个数量级。
而且 GLM-5.2 不是那种”大部分对但偶尔离谱”的水平。59 笔交易里,只有一两笔在科目归类上跟人类判断有细微差异——比如有一笔”创始人股份”相关的交易,模型不确定该归入”资本注入”还是”董事贷款”。这种模糊地带,人类会计也得翻一下公司章程才能定。
为什么是 GLM-5.2,不是 GPT 或 Claude

你可能想问:为什么要拿一个中国公司的开源模型来做这件事?
答案很直接——因为这个场景需要模型自己操作软件、读取 PDF、推理税务规则、执行多步操作。这是典型的 agent 任务,对 token 消耗和推理成本非常敏感。GLM-5.2 作为开源模型,可以本地部署或按 token 极低成本调用,在”够用”的前提下把成本压到最低。
Toot Books 之前也试过 Claude 和 GPT 系列。得出的结论是:几个顶级闭源模型在准确率上确实更高(大概高 2-3 个百分点),但成本高出 50-100 倍。对于一个中小企业的日常记账需求,“省 99% 的钱,少 2% 的准确率”是一个不需要犹豫的选择。
更重要的是,GLM-5.2 在测试中没有作弊。Toot Books 专门把模型部署在与会计软件隔离的环境中,监控了所有网络请求。模型确实按照流程一步步操作,没有试图去网上搜答案或者绕开限制。
账面之后

GLM-5.2 的这项表现,放在更大的背景里看,指向的是一个更本质的趋势:大模型正在从”聊天工具”变成”操作工具”。
它不再只是你问它答的东西。它可以打开你的会计软件,读取你的银行流水,分析你的发票 PDF,然后替你把税报了。整个过程不需要人类介入,除非它遇到了模糊的交易判断——而那种模糊判断,随着数据积累和模型迭代,会越来越少。
有人可能会担心:会计不就失业了吗?
短期内不会。税务筹划、财务策略、风险判断这些高维度的东西,GLM-5.2 现在还差得远。但记账、对账、报税这些”脏活累活”,它确实干得比人类便宜太多了。一个更现实的场景是:会计从手动操作者变成审核监督者,一个人盯几十个模型的输出。
这在传统企业软件领域,是一个真正的结构性变化。
来源:Toot Books Blog | Hacker News
