2026年6月27日,DeepSeek在GitHub上发布了代码库“DeepSpec”,以加速大型语言模型(LLM)的文本生成我做了。 DeepSpec 是一个旨在训练和评估“草稿模型”的实现,支持三种算法:DSpark、DFlash 和 Eagle3。 该仓库包含数据准备、模型草案实现、训练代码、评估脚本等功能。
这不是新型号,而是一种加速发电的技术
DSpark 本身并不是一个全新的大型语言模型。 在《DeepSeek-V4-Flash-DSpark》发布于Hugging Face的文章中,它被描述为“不是新型号,而是在同一检查点上添加的推测解码模块”。 换句话说,与其通过显著改变模型知识或能力的展示方式,不如将其视为一种提升等待时间和输出文本时计算效率的技术。
小型模型预约,大型模型确认
LLM通常逐字生成句子,更准确地说,是用称为“tokens”的单位。 高性能模型检查时间更长,因此生成长文本或代码时等待时间可能存在挑战。 推测解码是一种加快这一过程的技术。 小型“起草者”模型首先创建多个候选人,较大的主模型则集体检查所有候选人。 如果候选人有效,生成过程可以比逐个令牌推进更快。
从培训到评估发布代码
处理流程包括三个阶段:数据准备、训练和评估。 在数据准备过程中,检索提示词,重新生成目标模型的响应,并创建缓存。 然后,利用缓存目标模型的输出训练草稿模型,最后通过基准测试任务评估推测解码的接受率。 GitHub上还有一份名为“DSpark_paper.pdf”的DSpark技术文档。
还提供了DeepSeek-V4的检查点
DeepSeek 还在 Hugging Face 上发布了 DeepSeek-V4 与 DSpark 的检查点。 目标是“DeepSeek-V4-Flash-DSpark”和“DeepSeek-V4-Pro-DSpark”,这两个平台都以DeepSpec的仓库为参考。 关于 DeepSeek-V4 系列,公司在 2026 年 4 月 24 日发布的“DeepSeek V4 预览版”中解释,Pro 型号的总参数为 1.6T / 49B,而 Flash 型号的总参数为 284B 和 13B。 两种模型都支持100万个令牌的上下文长度。
在实现方面,Hugging Face 模型卡包含了一个示例配置,用于启用 DSpark 与 vLLM。 具体来说,启动 vLLM 时会添加推测解密设置,并将方法设置为“dspark”。 在本文中,它不是作为普通用户可以立即体验的新服务,而是通过将其组织为面向开发者和研究人员操作模型的推理优化技术来更容易理解。
关注响应速度和GPU成本降低
在生成式人工智能竞赛中,关注点往往集中在模型性能和参数数量上。 另一方面,在实际服务运营中,响应速度、并发处理次数和GPU成本也是主要挑战。 DSpark 不是为了创建更大的模型,而是为了提高现有模型的输出效率。 DeepSeek 将培训和评估代码发布为 DeepSpec,实现推测解码和进行比较验证变得更加容易。