每日热门技能分享
DeepSpec — 推理提速2-3倍
DeepSeek 开源的推测解码全栈工具库
3 大算法 + 9 个开箱即用 Checkpoint · 让 Qwen3 / Gemma 4 推理快 2-3 倍

大模型推理占 LLM 服务 80% 算力预算,自回归一次只能生成 1 个 token,GPU 利用率长期低于 20%。DeepSeek 把线上生产同款的推测解码全栈流水线(DSpark+DFlash+Eagle3)开源,直接给 Qwen3 / Gemma 4 等开源模型提速 2-3 倍

~6.7K
Stars
3
算法
9
预训练权重
85%
线上提速

💡 两种解码方式对比
😩 普通自回归
✗ 一次生成 1 个 token,下一个必须等
✗ GPU 算力利用率长期低于 20%
✗ 推理占 LLM 服务 80% 算力成本
✗ 用户响应延迟随输出长度线性增长
🚀 DeepSpec 推测解码
✓ 小模型 draft 7 个 token,大模型一次 verify
✓ 命中率 78-82%,端到端加速 2-3 倍
✓ 9 个预训练权重开箱即用,MIT 协议
✓ 高并发场景吞吐量暴涨 661%

✨ 三大算法一站集成
不用分别找三套仓库踩三套依赖
DSpark
DeepSeek 2026 自研,半自回归 + Confidence-Scheduled 调度 + Markov head。线上生产同款,高并发场景吞吐暴涨 661%。

🧊
DFlash
MIT z-lab 出品,并行块扩散(Block Diffusion)。单卡本地、低并发场景的首选,实现简单、显存友好。

🦅
Eagle3
SGLang 团队自回归 + 树状 attention 投机解码。多候选探索、灵活度优先,生态最成熟的方案。

📦 9 个开箱即用 Checkpoint
4 个目标模型 × 3 种算法,直接拉权重就能用
Qwen3-4B
Eagle3 · DFlash · DSpark
Qwen3-8B
Eagle3 · DFlash · DSpark
Qwen3-14B
Eagle3 · DFlash · DSpark
Gemma-4-12B-it
Eagle3 · DFlash · DSpark

🚀 5 分钟给 Qwen3 加速 2 倍
不用训练,直接拉现成 checkpoint 走 vLLM
STEP 1
拉取预训练 draft 模型
从 HuggingFace 拉 DSpark 适配 Qwen3-8B 的草稿权重,跳过训练直接用。
snapshot_download(repo_id=”deepseek-ai/dspark_qwen3_8b_block7″, local_dir=”./draft_model”)
STEP 2
跑评测看加速效果
9 个基准(gsm8k/math500/humaneval 等)给出接受率 + 加速比,比如 gsm8k 接受率 78% 加速 2.3x。
bash scripts/eval/eval.sh # 列出 9 个基准的接受率/加速比
STEP 3
接入 vLLM 上线服务
vLLM nightly build 已合并 DSpark 支持(PR #46995),一条命令启动加速服务。
vllm serve Qwen/Qwen3-8B –speculative-model deepseek-ai/dspark_qwen3_8b_block7 –num-speculative-tokens 5

📊 综合评级
基于工程价值、可复现性和生态成熟度评估
S
生产可信度
DSpark 已在 DeepSeek-V4 万卡集群线上跑通,不是 demo
S
开箱即用度
9 个 HF checkpoint + vLLM 一行命令接入,无需自己训练
A+
算法完整度
DSpark/DFlash/Eagle3 一站集成,不用分别踩三套依赖
B+
硬件门槛
默认配置要 8×A100/H100,小团队需减少 GPU 或直接拉 checkpoint

🎯 适合谁?
自托管大模型想压推理成本的企业/团队;想给 Qwen3 / Gemma 4 加速 2-3 倍的工程师;研究推测解码原理需要可复现 pipeline 的学生/研究员;以及所有在为”GPU 算力贵/响应慢”头疼的 LLM 服务方。

先把 GPU 算力打 5 折,再谈更大的模型
DSpark 已经在 DeepSeek 线上万卡集群跑通,不是 PPT 加速
github.com/deepseek-ai/DeepSpec

如果觉得有用,转发给被 GPU 账单刺痛的朋友
好的内容不该只停在浏览器标签页里,它应该走进一个人的行动。
⚠️ 技能来源于互联网,使用前请先核实其安全性
热门技能 Vol.045 · 作者:一枝值千金 · 2026-07-23

资源链接
GitHub: https://github.com/deepseek-ai/DeepSpec
协议: MIT