DeepSeek发布DSpark:推测解码让大模型推理速度翻倍
一场推理速度的军备竞赛

大模型的推理速度,一直是个让人又爱又恨的话题。爱的是模型能力越来越强,能写诗、能编程、能解数学题;恨的是每次问一个问题,屏幕上那个转圈的加载图标总要转上好几秒,甚至几十秒。对于部署模型的团队来说,这种感觉更直接:每一个 token 生成都是钱,每一秒延迟都是用户流失。
DeepSeek 最近在 GitHub 上开源的 DeepSpec 项目,就是想解决这个问题。核心是一篇名为 DSpark 的论文,讲的是如何用推测解码让大模型跑得更快。推测解码(Speculative Decoding)这个名字听起来很有科幻感,像是某种 CPU 分支预测的 AI 版本。事实上,这个类比确实不算太离谱。CPU 在执行指令时会猜测下一步要做什么,猜对了就省时间,猜错了就回滚重来。DSpark 做的,本质上是一样的事。
用一个小模型给大模型当”前锋”

传统的自回归生成,是一块砖一块砖地砌墙。大模型每生成一个词,都要从头计算一次,跑完整条网络,然后吐出一个 token。这个过程没法并行,计算资源用得不少,效率却不高。一块 GPU 在那里全速运转,结果每秒才生成几十个 token,想想都觉得奢侈。
DSpark 的思路很巧妙:既然大模型跑得慢,那能不能先让一个小模型去跑?小模型体量小、速度快,一口气生成十几个候选 token,然后把这些候选一股脑交给大模型去”审核”。大模型只需要跑一次前向传播,就能并行验证这些 token 对不对,对的留下,错的扔掉。这个过程就像一个工作流:实习生画草图,总编辑一次性审完整批稿子。审核通过的部分直接采用,不通过的部分从错误位置重新生成。实验结果显示,这种方案能让推理速度提升 2 到 3 倍,而且生成质量没有任何损失,因为最终的 token 选择权始终在大模型手里。
把猜词游戏玩到极致

DSpark 的另一个亮点,是它对猜测质量的优化。推测解码的效果,很大程度上取决于小模型能不能猜准大模型的意图。如果小模型猜得乱七八糟,大模型审核时发现全是错的,那不但没加速,反而赔掉了生成候选 token 的时间。这就像那个实习生交上来的稿子语法不通、逻辑混乱,总编辑全给打回去,比从零开始写还慢。
DeepSeek 在训练这个”前锋”小模型上下了不少功夫,让它能更好地模仿大模型的输出分布。他们还在解码策略上做了改进,让候选序列更长、正确率更高。这些优化叠加在一起,使得加速效果在更长的生成任务中尤其明显。写文章、写代码、做数学推理这些需要大量 token 的场景,收益最大。换句话说,越是大模型觉得”累”的长文本生成任务,DSpark 就越能派上用场。
开源社区的共鸣

DSpark 在技术社区引起的反响,某种程度上反映了这个方向的重要性。GitHub 上的 DeepSpec 仓库在短短几天内就获得了超过一千颗星,讨论区里挤满了来自全球的开发者。有人问实现细节,有人贴自己的测试数据,还有人已经开始尝试把 DSpark 集成到自己的推理框架里。
这种热情并不难理解。大模型的推理成本一直是行业痛点,而推测解码是目前极少数能在不牺牲质量的前提下实现显著加速的技术路线之一。DSpark 的出现,让这条路线变得更具体、更可落地。一个中国 AI 团队在这样一个关键方向上拿出了扎实的成果,也让更多人开始重新审视推理优化这条赛道的可能性。你说,当推理成本真的降到一个临界点的时候,那些因为”太慢太贵”而被搁置的应用场景,会迎来怎样的变化?
来源:GitHub | Hacker News
