MarkTechPost(RSS)
精选
71AI 编辑部评分,满分 100

DeepSeek 发布 DeepSeek-V4-Flash-0731,智能体与编程能力大幅提升

2026-08-01 06:03· 28分钟前· Asif Razzaq
跳到正文
精选理由

同架构、纯靠后训练就把 agent 和 coding 分数拉过 V4-Pro,价格才三分之一,对预算有限的团队是从未有过的好信号。

AI 摘要

DeepSeek 于 7 月 31 日发布 DeepSeek-V4-Flash-0731,并将 V4-Flash API 开放公测。该版本沿用 284B 参数 MoE 架构,通过重新后训练实现性能跃升,在智能体基准上全面超越 V4-Pro(预览版)。API 定价为缓存未命中时每百万输入 token $0.14,输出 token $0.28,权重采用 MIT 许可。

正文 · AI 翻译

DeepSeek 于 2026 年 7 月 31 日在 Hugging Face 上发布了 DeepSeek-V4-Flash-0731,并将官方 V4-Flash API 转入公开测试阶段。模型卡明确说明这是取代预览版的正式版本,且架构和规模均未改变。性能提升来自重新后训练,而非新设计。

该检查点附带 DSpark 投机解码模块,与 DeepSeek-V4-Flash-DSpark 的结构一致。Hugging Face 显示该仓库参数量为 304B,其中包含在 284B 基础模型之上叠加的草稿模块。

在 API 方面,deepseek-v4-flash 现已原生支持 Responses API 格式,并已适配 Codex。V4-Pro API 以及应用端和网页端模型均未更新。

它是否可部署?

可以,有两种截然不同的方式。

通过 API,几乎任何人都可以部署:DeepSeek 的定价页面显示,deepseek-v4-flash 在缓存未命中时为每 1M 输入 token 收费 $0.14,缓存命中时为 $0.0028,每 1M 输出 token 收费 $0.28,并发限制为 2,500。这大约是 deepseek-v4-pro 输出定价($0.87)的三分之一。种子轮初创公司、独立开发者和内部平台团队可以在无需 GPU 预算的情况下以这个价格运行智能体循环。

通过自托管,门槛则高得多:权重采用 MIT 许可证且无需审批即可获取,但每个专家都常驻内存,尽管每个 token 仅激活 13B 参数。DeepSeek 的 vLLM 示例在单个 4×GB300 节点上即可运行该模型。Unsloth 的动态 GGUF 格式将无损 8-bit 版本标为 162 GB,3-bit 版本为 103 GB,需要约 110 GB 的内存加显存合计。自托管适合拥有推理集群的中大型企业,或在激进量化条件下配备一台高规格工作站。

架构

根据 DeepSeek-V4 技术报告,V4-Flash 是一个 284B 参数的 MoE 模型,每个 token 激活 13B 参数,上下文窗口为 1M token。每个 MoE 层包含 1 个共享专家和 256 个路由专家,中间维度为 2048,每个 token 触发 6 个路由专家。前三个 MoE 层使用哈希路由。多 token 预测深度为 1。

注意力机制是混合式的,结合了压缩稀疏注意力(CSA)与重度压缩注意力(HCA)。流形约束超连接(mHC)取代了传统的残差连接,扩展因子为 4,并进行了 20 次 Sinkhorn-Knopp 迭代。预训练使用了超过 32T 的 token 和 Muon 优化器。论文中标题级的效率数据——在 1M 上下文下,单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%,KV cache 仅为 10%——是针对 V4-Pro 而非 Flash 版本给出的。

<!– 在此嵌入:将 wordpress-embed.html 粘贴到自定义 HTML 块中 –>

基准测试

以下所有数据均由 DeepSeek 报告,来源于 0731 模型卡。

基准测试V4-Flash-0731V4-Flash(预览版)V4-Pro(预览版)GLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2

有两点需要注意:

  • 代码智能体任务使用的是 DeepSeek Harness 的最小模式运行,该模式尚未发布。
  • DSBench-FullStack (68.7) 和 DSBench-Hard (59.6) 是内部测试集。智能体得分对测试框架(harness)敏感,因此独立运行的结果可能存在差异。

服务部署

DSpark 可通过一个 vLLM 标志启用:--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'。DSpark 论文报告称,在匹配的聚合吞吐量下,与 MTP-1 基线相比,V4-Flash 的每用户生成速度提高了 60–85%。

没有 Jinja 聊天模板。DeepSeek 附带了一个 encoding/ 文件夹,其中包含 encode_messages 和 parse_message_from_completion_text 函数。reasoning_effort 可设置为 low、high 或 max。DeepSeek 建议在智能体场景下使用 temperature = 1.0、top_p = 0.95,其他场景下使用 1.0,在 high 和 max 模式下最多可输出 384K 个 token。

关键要点

  • 与四月预览版相同的 284B/13B 架构:提升完全来自后训练阶段。
  • 在 DeepSeek 发布的所有智能体基准测试中均优于 V4-Pro(预览版),而输出价格仅为后者的三分之一。
  • 采用 MIT 许可证且无访问限制,因此本地商业部署不受阻碍。
  • 自托管在 3-bit 量化下需要约 110 GB 内存,或使用 4×GB300 节点进行全精度服务。
  • 所有基准测试数据均为供应商在未发布的测试框架上报告的结果——请先自行运行评估。

欢迎查看 Hugging Face 上的模型更新。同时,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 15 万+成员的机器学习 SubReddit,并订阅我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上找到我们了。

DeepSeek 发布 DeepSeek-V4-Flash-0731,智能体与编程能力大幅提升

MarkTechPost(RSS)·2026-08-01 06:03·28分钟前·Asif Razzaq
阅读原文· marktechpost.com
精选理由

同架构、纯靠后训练就把 agent 和 coding 分数拉过 V4-Pro,价格才三分之一,对预算有限的团队是从未有过的好信号。

AI 摘要

DeepSeek 于 7 月 31 日发布 DeepSeek-V4-Flash-0731,并将 V4-Flash API 开放公测。该版本沿用 284B 参数 MoE 架构,通过重新后训练实现性能跃升,在智能体基准上全面超越 V4-Pro(预览版)。API 定价为缓存未命中时每百万输入 token $0.14,输出 token $0.28,权重采用 MIT 许可。

正文 · AI 翻译

DeepSeek 于 2026 年 7 月 31 日在 Hugging Face 上发布了 DeepSeek-V4-Flash-0731,并将官方 V4-Flash API 转入公开测试阶段。模型卡明确说明这是取代预览版的正式版本,且架构和规模均未改变。性能提升来自重新后训练,而非新设计。

该检查点附带 DSpark 投机解码模块,与 DeepSeek-V4-Flash-DSpark 的结构一致。Hugging Face 显示该仓库参数量为 304B,其中包含在 284B 基础模型之上叠加的草稿模块。

在 API 方面,deepseek-v4-flash 现已原生支持 Responses API 格式,并已适配 Codex。V4-Pro API 以及应用端和网页端模型均未更新。

它是否可部署?

可以,有两种截然不同的方式。

通过 API,几乎任何人都可以部署:DeepSeek 的定价页面显示,deepseek-v4-flash 在缓存未命中时为每 1M 输入 token 收费 $0.14,缓存命中时为 $0.0028,每 1M 输出 token 收费 $0.28,并发限制为 2,500。这大约是 deepseek-v4-pro 输出定价($0.87)的三分之一。种子轮初创公司、独立开发者和内部平台团队可以在无需 GPU 预算的情况下以这个价格运行智能体循环。

通过自托管,门槛则高得多:权重采用 MIT 许可证且无需审批即可获取,但每个专家都常驻内存,尽管每个 token 仅激活 13B 参数。DeepSeek 的 vLLM 示例在单个 4×GB300 节点上即可运行该模型。Unsloth 的动态 GGUF 格式将无损 8-bit 版本标为 162 GB,3-bit 版本为 103 GB,需要约 110 GB 的内存加显存合计。自托管适合拥有推理集群的中大型企业,或在激进量化条件下配备一台高规格工作站。

架构

根据 DeepSeek-V4 技术报告,V4-Flash 是一个 284B 参数的 MoE 模型,每个 token 激活 13B 参数,上下文窗口为 1M token。每个 MoE 层包含 1 个共享专家和 256 个路由专家,中间维度为 2048,每个 token 触发 6 个路由专家。前三个 MoE 层使用哈希路由。多 token 预测深度为 1。

注意力机制是混合式的,结合了压缩稀疏注意力(CSA)与重度压缩注意力(HCA)。流形约束超连接(mHC)取代了传统的残差连接,扩展因子为 4,并进行了 20 次 Sinkhorn-Knopp 迭代。预训练使用了超过 32T 的 token 和 Muon 优化器。论文中标题级的效率数据——在 1M 上下文下,单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%,KV cache 仅为 10%——是针对 V4-Pro 而非 Flash 版本给出的。

<!– 在此嵌入:将 wordpress-embed.html 粘贴到自定义 HTML 块中 –>

基准测试

以下所有数据均由 DeepSeek 报告,来源于 0731 模型卡。

基准测试V4-Flash-0731V4-Flash(预览版)V4-Pro(预览版)GLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2

有两点需要注意:

  • 代码智能体任务使用的是 DeepSeek Harness 的最小模式运行,该模式尚未发布。
  • DSBench-FullStack (68.7) 和 DSBench-Hard (59.6) 是内部测试集。智能体得分对测试框架(harness)敏感,因此独立运行的结果可能存在差异。

服务部署

DSpark 可通过一个 vLLM 标志启用:--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'。DSpark 论文报告称,在匹配的聚合吞吐量下,与 MTP-1 基线相比,V4-Flash 的每用户生成速度提高了 60–85%。

没有 Jinja 聊天模板。DeepSeek 附带了一个 encoding/ 文件夹,其中包含 encode_messages 和 parse_message_from_completion_text 函数。reasoning_effort 可设置为 low、high 或 max。DeepSeek 建议在智能体场景下使用 temperature = 1.0、top_p = 0.95,其他场景下使用 1.0,在 high 和 max 模式下最多可输出 384K 个 token。

关键要点

  • 与四月预览版相同的 284B/13B 架构:提升完全来自后训练阶段。
  • 在 DeepSeek 发布的所有智能体基准测试中均优于 V4-Pro(预览版),而输出价格仅为后者的三分之一。
  • 采用 MIT 许可证且无访问限制,因此本地商业部署不受阻碍。
  • 自托管在 3-bit 量化下需要约 110 GB 内存,或使用 4×GB300 节点进行全精度服务。
  • 所有基准测试数据均为供应商在未发布的测试框架上报告的结果——请先自行运行评估。

欢迎查看 Hugging Face 上的模型更新。同时,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 15 万+成员的机器学习 SubReddit,并订阅我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上找到我们了。

阅读原文marktechpost.com