# DeepSeek 发布 DeepSeek-V4-Flash-0731，智能体与编程能力大幅提升

- 来源：MarkTechPost（RSS）
- 作者：Asif Razzaq
- 发布时间：2026-08-01 06:03
- AIHOT 分数：71
- AIHOT 链接：https://aihot.virxact.com/items/cms9ilrh70g6lro9k6cya98ik
- 原文链接：https://www.marktechpost.com/2026/07/31/deepseek-upgrades-deepseek-v4-flash-0731-with-major-agentic-and-coding-gains

## AI 摘要

DeepSeek 于 7 月 31 日发布 DeepSeek-V4-Flash-0731，并将 V4-Flash API 开放公测。该版本沿用 284B 参数 MoE 架构，通过重新后训练实现性能跃升，在智能体基准上全面超越 V4-Pro（预览版）。API 定价为缓存未命中时每百万输入 token $0.14，输出 token $0.28，权重采用 MIT 许可。

## 正文

DeepSeek 于 2026 年 7 月 31 日在 Hugging Face 上发布了 DeepSeek-V4-Flash-0731，并将官方 V4-Flash API 转入公开测试阶段。模型卡明确说明这是取代预览版的正式版本，且架构和规模均未改变。性能提升来自重新后训练，而非新设计。

该检查点附带 DSpark 投机解码模块，与 DeepSeek-V4-Flash-DSpark 的结构一致。Hugging Face 显示该仓库参数量为 304B，其中包含在 284B 基础模型之上叠加的草稿模块。

在 API 方面，deepseek-v4-flash 现已原生支持 Responses API 格式，并已适配 Codex。V4-Pro API 以及应用端和网页端模型均未更新。

它是否可部署？

可以，有两种截然不同的方式。

通过 API，几乎任何人都可以部署：DeepSeek 的定价页面显示，deepseek-v4-flash 在缓存未命中时为每 1M 输入 token 收费 $0.14，缓存命中时为 $0.0028，每 1M 输出 token 收费 $0.28，并发限制为 2,500。这大约是 deepseek-v4-pro 输出定价（$0.87）的三分之一。种子轮初创公司、独立开发者和内部平台团队可以在无需 GPU 预算的情况下以这个价格运行智能体循环。

通过自托管，门槛则高得多：权重采用 MIT 许可证且无需审批即可获取，但每个专家都常驻内存，尽管每个 token 仅激活 13B 参数。DeepSeek 的 vLLM 示例在单个 4×GB300 节点上即可运行该模型。Unsloth 的动态 GGUF 格式将无损 8-bit 版本标为 162 GB，3-bit 版本为 103 GB，需要约 110 GB 的内存加显存合计。自托管适合拥有推理集群的中大型企业，或在激进量化条件下配备一台高规格工作站。

架构

根据 DeepSeek-V4 技术报告，V4-Flash 是一个 284B 参数的 MoE 模型，每个 token 激活 13B 参数，上下文窗口为 1M token。每个 MoE 层包含 1 个共享专家和 256 个路由专家，中间维度为 2048，每个 token 触发 6 个路由专家。前三个 MoE 层使用哈希路由。多 token 预测深度为 1。

注意力机制是混合式的，结合了压缩稀疏注意力（CSA）与重度压缩注意力（HCA）。流形约束超连接（mHC）取代了传统的残差连接，扩展因子为 4，并进行了 20 次 Sinkhorn-Knopp 迭代。预训练使用了超过 32T 的 token 和 Muon 优化器。论文中标题级的效率数据——在 1M 上下文下，单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%，KV cache 仅为 10%——是针对 V4-Pro 而非 Flash 版本给出的。

<!– 在此嵌入：将 wordpress-embed.html 粘贴到自定义 HTML 块中 –>

基准测试

以下所有数据均由 DeepSeek 报告，来源于 0731 模型卡。

基准测试V4-Flash-0731V4-Flash（预览版）V4-Pro（预览版）GLM-5.2Opus-4.8

Terminal Bench 2.182.761.872.181.085.0

NL2Repo54.239.438.548.969.7

Cybergym76.738.752.7—83.1

DeepSWE54.47.312.846.258.0

Toolathlon-Verified70.349.755.959.976.2

Agents’ Last Exam25.215.816.523.825.7

AutomationBench Public25.110.812.812.927.2

有两点需要注意：

代码智能体任务使用的是 DeepSeek Harness 的最小模式运行，该模式尚未发布。

DSBench-FullStack (68.7) 和 DSBench-Hard (59.6) 是内部测试集。智能体得分对测试框架（harness）敏感，因此独立运行的结果可能存在差异。

服务部署

DSpark 可通过一个 vLLM 标志启用：--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'。DSpark 论文报告称，在匹配的聚合吞吐量下，与 MTP-1 基线相比，V4-Flash 的每用户生成速度提高了 60–85%。

没有 Jinja 聊天模板。DeepSeek 附带了一个 encoding/ 文件夹，其中包含 encode_messages 和 parse_message_from_completion_text 函数。reasoning_effort 可设置为 low、high 或 max。DeepSeek 建议在智能体场景下使用 temperature = 1.0、top_p = 0.95，其他场景下使用 1.0，在 high 和 max 模式下最多可输出 384K 个 token。

关键要点

与四月预览版相同的 284B/13B 架构：提升完全来自后训练阶段。

在 DeepSeek 发布的所有智能体基准测试中均优于 V4-Pro（预览版），而输出价格仅为后者的三分之一。

采用 MIT 许可证且无访问限制，因此本地商业部署不受阻碍。

自托管在 3-bit 量化下需要约 110 GB 内存，或使用 4×GB300 节点进行全精度服务。

所有基准测试数据均为供应商在未发布的测试框架上报告的结果——请先自行运行评估。

欢迎查看 Hugging Face 上的模型更新。同时，欢迎在 Twitter 上关注我们，别忘了加入我们拥有 15 万+成员的机器学习 SubReddit，并订阅我们的新闻通讯。等等！你在用 Telegram 吗？现在你也可以在 Telegram 上找到我们了。
