DeepSeek 于 2026 年 7 月 31 日在 Hugging Face 上发布了 DeepSeek-V4-Flash-0731,并将官方 V4-Flash API 转入公开测试阶段。模型卡明确说明这是取代预览版的正式版本,且架构和规模均未改变。性能提升来自重新后训练,而非新设计。
该检查点附带 DSpark 投机解码模块,与 DeepSeek-V4-Flash-DSpark 的结构一致。Hugging Face 显示该仓库参数量为 304B,其中包含在 284B 基础模型之上叠加的草稿模块。
在 API 方面,deepseek-v4-flash 现已原生支持 Responses API 格式,并已适配 Codex。V4-Pro API 以及应用端和网页端模型均未更新。
它是否可部署?
可以,有两种截然不同的方式。
通过 API,几乎任何人都可以部署:DeepSeek 的定价页面显示,deepseek-v4-flash 在缓存未命中时为每 1M 输入 token 收费 $0.14,缓存命中时为 $0.0028,每 1M 输出 token 收费 $0.28,并发限制为 2,500。这大约是 deepseek-v4-pro 输出定价($0.87)的三分之一。种子轮初创公司、独立开发者和内部平台团队可以在无需 GPU 预算的情况下以这个价格运行智能体循环。
通过自托管,门槛则高得多:权重采用 MIT 许可证且无需审批即可获取,但每个专家都常驻内存,尽管每个 token 仅激活 13B 参数。DeepSeek 的 vLLM 示例在单个 4×GB300 节点上即可运行该模型。Unsloth 的动态 GGUF 格式将无损 8-bit 版本标为 162 GB,3-bit 版本为 103 GB,需要约 110 GB 的内存加显存合计。自托管适合拥有推理集群的中大型企业,或在激进量化条件下配备一台高规格工作站。
架构
根据 DeepSeek-V4 技术报告,V4-Flash 是一个 284B 参数的 MoE 模型,每个 token 激活 13B 参数,上下文窗口为 1M token。每个 MoE 层包含 1 个共享专家和 256 个路由专家,中间维度为 2048,每个 token 触发 6 个路由专家。前三个 MoE 层使用哈希路由。多 token 预测深度为 1。
注意力机制是混合式的,结合了压缩稀疏注意力(CSA)与重度压缩注意力(HCA)。流形约束超连接(mHC)取代了传统的残差连接,扩展因子为 4,并进行了 20 次 Sinkhorn-Knopp 迭代。预训练使用了超过 32T 的 token 和 Muon 优化器。论文中标题级的效率数据——在 1M 上下文下,单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%,KV cache 仅为 10%——是针对 V4-Pro 而非 Flash 版本给出的。
<!– 在此嵌入:将 wordpress-embed.html 粘贴到自定义 HTML 块中 –>
基准测试
以下所有数据均由 DeepSeek 报告,来源于 0731 模型卡。
| 基准测试 | V4-Flash-0731 | V4-Flash(预览版) | V4-Pro(预览版) | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
有两点需要注意:
- 代码智能体任务使用的是 DeepSeek Harness 的最小模式运行,该模式尚未发布。
- DSBench-FullStack (68.7) 和 DSBench-Hard (59.6) 是内部测试集。智能体得分对测试框架(harness)敏感,因此独立运行的结果可能存在差异。
服务部署
DSpark 可通过一个 vLLM 标志启用:--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'。DSpark 论文报告称,在匹配的聚合吞吐量下,与 MTP-1 基线相比,V4-Flash 的每用户生成速度提高了 60–85%。
没有 Jinja 聊天模板。DeepSeek 附带了一个 encoding/ 文件夹,其中包含 encode_messages 和 parse_message_from_completion_text 函数。reasoning_effort 可设置为 low、high 或 max。DeepSeek 建议在智能体场景下使用 temperature = 1.0、top_p = 0.95,其他场景下使用 1.0,在 high 和 max 模式下最多可输出 384K 个 token。
关键要点
- 与四月预览版相同的 284B/13B 架构:提升完全来自后训练阶段。
- 在 DeepSeek 发布的所有智能体基准测试中均优于 V4-Pro(预览版),而输出价格仅为后者的三分之一。
- 采用 MIT 许可证且无访问限制,因此本地商业部署不受阻碍。
- 自托管在 3-bit 量化下需要约 110 GB 内存,或使用 4×GB300 节点进行全精度服务。
- 所有基准测试数据均为供应商在未发布的测试框架上报告的结果——请先自行运行评估。
欢迎查看 Hugging Face 上的模型更新。同时,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 15 万+成员的机器学习 SubReddit,并订阅我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上找到我们了。