Echo's blog
Echo's blog
· 1 min read · 资讯

DeepSeek开源DSpark:让大模型推理快两倍的草稿本

当大模型需要一个”草稿本”#

当大模型需要一个"草稿本"

想象一下,你身边有一位下笔如飞的助理,能在几秒内写出初稿,然后由一位严谨的主编逐行审校。助理写得快但可能犯错,主编确保最终质量——但主编不需要从头写起,只需要检查助理的工作。这正是投机性解码(Speculative Decoding)的核心思想:用一个小模型快速生成候选 token,再让大模型并行验证。结果是在不牺牲任何生成质量的前提下,推理速度提升 2 到 3 倍。

这个思路在学术圈并不新鲜,但难点在于如何训练出足够好的”草稿模型”。草稿模型不能太笨——猜得太离谱,大模型要反复驳回,反而更慢;也不能太聪明——逼近大模型本身,那就失去加速的意义了。训练一个恰到好处的”助手”,恰恰是 DeepSeek 最新开源项目 DSpark 要解决的问题。

DSpark 与 DeepSpec:一套完整的提案#

DSpark 与 DeepSpec:一套完整的提案

DeepSeek AI 开源了 DeepSpec 项目,这是一个面向投机性解码的端到端工具链,包含数据准备、训练代码、评估脚本以及已发布的模型权重。DSpark 是 DeepSpec 框架中的三种草稿模型算法之一,与 DFlash 和 Eagle3 并列。

DSpark 的核心贡献在于提出了更好的草稿模型训练算法。传统方法通常让草稿模型模仿大模型的行为分布,但 DSpark 在训练策略上做了优化,使小模型能更精准地预测大模型会接受哪些 token,从而提升”接受率”——这是投机性解码的关键效率指标。接受率越高,需要大模型重写的部分越少,加速效果就越明显。

DeepSpec 项目本身也体现了完整工程化的思路:从零开始准备数据、编写训练代码、提供评估脚本,再到在 Hugging Face 上发布经过充分训练的权重。目前支持的靶模型包括 Qwen3-4B/8B/14B 和 Gemma-4-12B-it,覆盖了当前主流的小到中等规模开源模型。

开源生态中的一环#

开源生态中的一环

DeepSpec 采用 MIT 许可协议发布,同时构建在多个开源项目之上,包括 SpecForge(Apache-2.0)、DFlash(MIT)、Qwen3 和 Gemma。这种层层堆叠的开放模式,降低了开发者上手投机性解码的门槛——不需要从论文复现实验,下载权重和代码即可开始推理加速。

项目由 Xin Cheng 创建,目前在 GitHub 上获得了超过 2100 颗星和 192 个 Fork,社区热度反映了业界对推理效率问题的迫切需求。对于部署大模型应用的团队来说,推理成本直接决定了服务能否落地。投机性解码不需要修改大模型本身的架构,也不需要额外的硬件——仅仅是加一个轻量草稿模型,就能在推理延迟上获得显著收益。

推理加速意味着什么#

推理加速意味着什么

DeepSeek 在开源社区一直以积极开放著称,从 DeepSeek-R1 到 DeepSeek-V3,每一次发布都推动着大模型技术朝着更普惠的方向发展。DSpark 和 DeepSpec 的发布,延续了这一路线:让已经很强的大模型跑得更快、更便宜。

对开发者而言,这意味着在同样硬件条件下可以支撑更高的并发请求;对用户而言,这意味着更短的等待时间、更流畅的交互体验。当一个模型的推理速度提升一倍,其实际可用性和商业可部署性都跨越了一个重要的门槛。这不仅是技术指标的优化,更是在让 AI 服务走向更多人桌面的道路上,迈出的扎实一步。

来源:https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

Related Posts

Comments

Copied
Copied to clipboard