热门技能 Vol.045 | DeepSpec — 推理提速2-3倍
每日热门技能分享
DeepSpec — 推理提速2-3倍
DeepSeek 开源的推测解码全栈工具库
3 大算法 + 9 个开箱即用 Checkpoint · 让 Qwen3 / Gemma 4 推理快 2-3 倍
大模型推理占 LLM 服务 80% 算力预算,自回归一次只能生成 1 个 token,GPU 利用率长期低于 20%。DeepSeek 把线上生产同款的推测解码全栈流水线(DSpark+DFlash+Eagle3)开源,直接给 Qwen3 / Gemma 4 等开源模型提速 2-3 倍。
💡 两种解码方式对比
|
😩 普通自回归
✗ 一次生成 1 个 token,下一个必须等
✗ GPU 算力利用率长期低于 20% ✗ 推理占 LLM 服务 80% 算力成本 ✗ 用户响应延迟随输出长度线性增长 |
🚀 DeepSpec 推测解码
✓ 小模型 draft 7 个 token,大模型一次 verify
✓ 命中率 78-82%,端到端加速 2-3 倍 ✓ 9 个预训练权重开箱即用,MIT 协议 ✓ 高并发场景吞吐量暴涨 661% |
✨ 三大算法一站集成
不用分别找三套仓库踩三套依赖
|
⚡
DSpark
DeepSeek 2026 自研,半自回归 + Confidence-Scheduled 调度 + Markov head。线上生产同款,高并发场景吞吐暴涨 661%。
|
🧊
DFlash
MIT z-lab 出品,并行块扩散(Block Diffusion)。单卡本地、低并发场景的首选,实现简单、显存友好。
|
🦅
Eagle3
SGLang 团队自回归 + 树状 attention 投机解码。多候选探索、灵活度优先,生态最成熟的方案。
|
📦 9 个开箱即用 Checkpoint
4 个目标模型 × 3 种算法,直接拉权重就能用
🚀 5 分钟给 Qwen3 加速 2 倍
不用训练,直接拉现成 checkpoint 走 vLLM
|
||
|
||
|
📊 综合评级
基于工程价值、可复现性和生态成熟度评估
|
||
|
||
|
||
|
🎯 适合谁?
自托管大模型想压推理成本的企业/团队;想给 Qwen3 / Gemma 4 加速 2-3 倍的工程师;研究推测解码原理需要可复现 pipeline 的学生/研究员;以及所有在为”GPU 算力贵/响应慢”头疼的 LLM 服务方。
先把 GPU 算力打 5 折,再谈更大的模型
DSpark 已经在 DeepSeek 线上万卡集群跑通,不是 PPT 加速
github.com/deepseek-ai/DeepSpec
如果觉得有用,转发给被 GPU 账单刺痛的朋友
好的内容不该只停在浏览器标签页里,它应该走进一个人的行动。
⚠️ 技能来源于互联网,使用前请先核实其安全性
热门技能 Vol.045 · 作者:一枝值千金 · 2026-07-23
资源链接
GitHub: https://github.com/deepseek-ai/DeepSpec
协议: MIT