Artificial Analysis@ArtificialAnlys
精选
76AI 编辑部评分,满分 100
2026-07-31 17:30· 29分钟前
跳到正文
精选理由

DeepSeek V4 Flash 0731 一下追平了 Gemini 3.6 Flash,成本却低到对手六成,加上几乎不要钱的缓存命中,做高并发 API 产品的可以直接切了。

AI 摘要

DeepSeek V4 Flash 0731 在 Artificial Analysis 智能指数上得 50 分,较 4 月版提升 10 分,领先 V4 Pro 6 分,并进入智能与成本帕累托前沿。

正文 · AI 翻译

DeepSeek V4 Flash 0731 在 Artificial Analysis 智能指数上取得 50 分,较 DeepSeek V4 Flash(2026 年 4 月发布)跃升 10 分,领先 DeepSeek V4 Pro 6 分。它与早前的 DeepSeek V4 Flash 共享完全相同的架构和定价,并进入我们智能 vs 单任务成本帕累托前沿。

@deepseek_ai 的 DeepSeek V4 Flash 0731 在智能指数上仅落后 GPT-5.6 Luna(max,51 分)1 分。即便 OpenAI 今日对 GPT-5.6 Luna 降价 80%,DeepSeek V4 Flash 0731 在 DeepSeek 官方 API 上的单任务成本仍比智能水平相当的 GPT-5.6 Luna(max)低约 60%。其中一个关键驱动因素是 DeepSeek 官方 API 约 98% 的缓存命中折扣,这一折扣力度显著高于业内多数厂商提供的 90% 缓存命中折扣。

新模型较上一代 DeepSeek V4 Flash(40 分)有显著提升,与 GLM-5.2(max,51 分)仅差 1 分。它仍落后由 Kimi K3(max,57 分)保持的开源权重前沿 7 分。作为补充参照,该模型与近期发布的 Gemini 3.6 Flash(50 分)持平,落后 Muse Spark 1.1(xhigh,51 分)1 分。DeepSeek 预计将在未来数周内发布该模型的完整权重。

DeepSeek V4 Flash 0731 保留了 1M token 的上下文窗口,模型规模与 DeepSeek V4 Flash 保持一致,总参数量 284B,推理时激活参数 13B。

关键结果:

➤ 智能体性能提升:DeepSeek V4 Flash 0731 在我们聚焦智能体真实工作任务的评测 GDPval-AA v2 上取得 1559 的 Elo 评分,较上一代 DeepSeek V4 Flash 的 1189 分大幅提升。权重发布后,这将是开源权重中第二高的得分,仅次于 Kimi K3(max,1687 分),领先于 GLM-5.2(max,1510 分)。Terminal-Bench 2.1 提升 17 个百分点至 79%,τ³-Bench Banking 提升 8 个百分点至 31%。

➤ 相较前代,token 使用量下降 12%:DeepSeek V4 Flash 0731 运行智能指数测试约消耗 2.06 亿输出 token,而上一代 DeepSeek V4 Flash 约为 2.34 亿。新版本 token 效率更高,以更少的输出 token 总量取得了更高的智能指数。

➤ DeepSeek V4 Flash 0731 在智能指数中的每一项评测上都优于前代:除智能体能力提升外,CritPt 提升 9 个百分点至 17%,SciCode 提升 5 个百分点至 50%,Humanity's Last Exam 提升 5 个百分点至 37%,AA-LCR 提升 3 个百分点至 66%,GPQA Diamond 提升 1 个百分点至 91%。

➤ AA-Omniscience 的改进主要源于模型幻觉的减少,而非准确率的提升:DeepSeek V4 Flash 0731 的 AA-Omniscience 指数为 -16,较前代提升了 7 个点。这一提升完全由幻觉率的下降驱动,整体准确率(正确百分比)保持不变。其 AA-Omniscience 幻觉率为 84%,较前代下降 12 个百分点,与 GPT-5.6 Terra(max,85%)和 Mistral Medium 3.5(82%)等模型相当。

更多模型详情:

➤ 上下文窗口:1M tokens(与 DeepSeek V4 Flash 相同)

➤ 规模:284B 总参数(13B 激活参数)

➤ 输入模态:仅支持文本输入和输出

➤ 可用性:可通过 DeepSeek 官方 API 使用

➤ 定价:每 1M 输入/输出 tokens 分别为 $0.14/$0.28,与 DeepSeek V4 Flash 保持一致。缓存命中价格为每 1M tokens $0.0028,折扣幅度达 98%

Artificial Analysis · @ArtificialAnlys · X·2026-07-31 17:30·29分钟前
在 X 看原推· x.com
精选理由

DeepSeek V4 Flash 0731 一下追平了 Gemini 3.6 Flash,成本却低到对手六成,加上几乎不要钱的缓存命中,做高并发 API 产品的可以直接切了。

AI 摘要

DeepSeek V4 Flash 0731 在 Artificial Analysis 智能指数上得 50 分,较 4 月版提升 10 分,领先 V4 Pro 6 分,并进入智能与成本帕累托前沿。

正文 · AI 翻译

DeepSeek V4 Flash 0731 在 Artificial Analysis 智能指数上取得 50 分,较 DeepSeek V4 Flash(2026 年 4 月发布)跃升 10 分,领先 DeepSeek V4 Pro 6 分。它与早前的 DeepSeek V4 Flash 共享完全相同的架构和定价,并进入我们智能 vs 单任务成本帕累托前沿。

@deepseek_ai 的 DeepSeek V4 Flash 0731 在智能指数上仅落后 GPT-5.6 Luna(max,51 分)1 分。即便 OpenAI 今日对 GPT-5.6 Luna 降价 80%,DeepSeek V4 Flash 0731 在 DeepSeek 官方 API 上的单任务成本仍比智能水平相当的 GPT-5.6 Luna(max)低约 60%。其中一个关键驱动因素是 DeepSeek 官方 API 约 98% 的缓存命中折扣,这一折扣力度显著高于业内多数厂商提供的 90% 缓存命中折扣。

新模型较上一代 DeepSeek V4 Flash(40 分)有显著提升,与 GLM-5.2(max,51 分)仅差 1 分。它仍落后由 Kimi K3(max,57 分)保持的开源权重前沿 7 分。作为补充参照,该模型与近期发布的 Gemini 3.6 Flash(50 分)持平,落后 Muse Spark 1.1(xhigh,51 分)1 分。DeepSeek 预计将在未来数周内发布该模型的完整权重。

DeepSeek V4 Flash 0731 保留了 1M token 的上下文窗口,模型规模与 DeepSeek V4 Flash 保持一致,总参数量 284B,推理时激活参数 13B。

关键结果:

➤ 智能体性能提升:DeepSeek V4 Flash 0731 在我们聚焦智能体真实工作任务的评测 GDPval-AA v2 上取得 1559 的 Elo 评分,较上一代 DeepSeek V4 Flash 的 1189 分大幅提升。权重发布后,这将是开源权重中第二高的得分,仅次于 Kimi K3(max,1687 分),领先于 GLM-5.2(max,1510 分)。Terminal-Bench 2.1 提升 17 个百分点至 79%,τ³-Bench Banking 提升 8 个百分点至 31%。

➤ 相较前代,token 使用量下降 12%:DeepSeek V4 Flash 0731 运行智能指数测试约消耗 2.06 亿输出 token,而上一代 DeepSeek V4 Flash 约为 2.34 亿。新版本 token 效率更高,以更少的输出 token 总量取得了更高的智能指数。

➤ DeepSeek V4 Flash 0731 在智能指数中的每一项评测上都优于前代:除智能体能力提升外,CritPt 提升 9 个百分点至 17%,SciCode 提升 5 个百分点至 50%,Humanity's Last Exam 提升 5 个百分点至 37%,AA-LCR 提升 3 个百分点至 66%,GPQA Diamond 提升 1 个百分点至 91%。

➤ AA-Omniscience 的改进主要源于模型幻觉的减少,而非准确率的提升:DeepSeek V4 Flash 0731 的 AA-Omniscience 指数为 -16,较前代提升了 7 个点。这一提升完全由幻觉率的下降驱动,整体准确率(正确百分比)保持不变。其 AA-Omniscience 幻觉率为 84%,较前代下降 12 个百分点,与 GPT-5.6 Terra(max,85%)和 Mistral Medium 3.5(82%)等模型相当。

更多模型详情:

➤ 上下文窗口:1M tokens(与 DeepSeek V4 Flash 相同)

➤ 规模:284B 总参数(13B 激活参数)

➤ 输入模态:仅支持文本输入和输出

➤ 可用性:可通过 DeepSeek 官方 API 使用

➤ 定价:每 1M 输入/输出 tokens 分别为 $0.14/$0.28,与 DeepSeek V4 Flash 保持一致。缓存命中价格为每 1M tokens $0.0028,折扣幅度达 98%

在 X 查看原推x.com