DeepSeek 开源 DSpark:推理速度提升 85% ,不靠堆 GPU

2026-06-28 10:27:40 0点赞 0收藏 0评论

6 月 27 日,DeepSeek 在 GitHub 上放出了一个叫 DSpark 的框架。

不是新模型。DSpark 的定位很明确——推理加速,而且是那种不影响输出质量的无损加速。官方数据很直接:在 DeepSeek-V4 线上服务中,每个用户的生成速度比之前快了 60% 到 85%。

怎么做到的?就是投机解码这条技术路线。但 DeepSeek 在里面加了几个自己的东西。

DeepSeek 开源 DSpark:推理速度提升 85% ,不靠堆 GPU

投机解码不是什么新概念

逻辑挺直观的。大模型生成 tokens 是一个字一个字往外蹦,每一步都要跑一遍完整的神经网络,很慢。投机解码的思路是:找一个小模型先快速写一段草稿,然后大模型一次性验证这段草稿对不对。验证通过的直接输出,不行的再重新生成。

因为验证用的是拒绝采样,输出分布和原始模型完全一致,没有质量损失。

这个思路不新鲜,Eagle、Eagle3、DFlash 都干过类似的事。DSpark 比它们好的地方在于几个设计:

半自回归生成。并行草稿骨干加一个极小的顺序头部,用来解决传统投机解码里"后缀衰减"的问题——草稿越长后面越不准,DSpark 用混合架构把这个问题压住了。

还有一个置信度头部,模型能判断自己写的草稿质量,而不是一律全部提交给大模型。质量不好就少写几个 token,少浪费算力。

负载感知调度也是一个小优化——GPU 空闲的时候多验证几个 token,忙的时候少验证几个。生产环境里效果很明显。

离线评测结果:DSpark 的接受长度比 Eagle3 高出 26%-31%,比 DFlash 高出 16%-18%。线上加速 60% 到 85%。

这次开源值得关注的不只是技术

DSpark 附带了一个叫 DeepSpec 的代码库,MIT 协议,完全开源。同时放出来的还有两个 checkpoint:DeepSeek-V4-Pro-DSpark 和 DeepSeek-V4-Flash-DSpark。都是 V4 的权重加上 draft 模块,没有重新训练模型。

但更有意思的是这背后的逻辑。

美国对先进 AI 芯片的出口限制一直没有放松。中国公司买不到足够的 H100 和 B200,那就只能在算法上找补。DSpark 就是这个环境下的产物——不堆 GPU,改堆算法效率。

当你能买的 GPU 有限,就得让现有的 GPU 跑出双倍的效果。DeepSeek 在 V4 上直接用 DSpark 做了线上部署,用户体感就是响应变快了,API 调用成本变低了。

推理加速意味着同样的硬件能服务更多用户,意味着 API 价格可以更低,意味着小公司也能跑起大模型服务。DeepSeek 这条路一旦跑通,其他厂商不可能不做跟进。

要不要担心 GPU 需求下降?

一个值得想的问题。如果推理效率全面提升,单位算力能支撑的 token 量大幅增加,那对 GPU 的总需求可能不但不会减少,反而会因为 AI 服务的普及而继续增长。Jevons 悖论在 AI 算力上可能会重演——效率提升反而刺激了更多需求。

但短期来看,DSpark 这种框架对中国的 AI 公司意义更大。GPU 受限的环境下,推理效率每提升一个百分点,就是实打实的成本节约和竞争筹码。

代码和论文都在 GitHub 上,搜 DeepSpec 就能找到。

说实话,2026 年至今,DeepSeek 的节奏一直没断过。大规模招聘、GW 级数据中心、Harness 团队做代码智能体、DSpark 推理加速。这不是在追风口,是在搭基础设施。DSpark 这种层面的优化,短期看起来没有新模型那么性感,但长期对生态的影响可能更大。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松