DeepSeek-V4-Flash 在 Cybergym 得分 76.7
DeepSeek-V4-Flash正式版API公测,Agent能力大幅提升,Cybergym得分76.7。
事件全貌
2026年7月31日,DeepSeek发布DeepSeek-V4-Flash正式版API并开放公测,模型在Agent能力上大幅提升,多项基准测试远超V4-Pro预览版。模型架构未变,仍为284B总参数、13B激活的MoE,支持1M上下文,通过后训练和Agent框架优化实现性能飞跃。
关键基准成绩:Terminal Bench 2.1得分82.7,Cybergym得分76.7,DeepSWE从7.3飙升至54.4,Toolathlon verified得分70.3,NL2Repo得分54.2。Artificial Analysis智能指数得分50,较4月版提升10分,领先V4 Pro 6分,位列开源模型前三。
API定价为每百万输入token ¥1(约$0.14)、输出token ¥2(约$0.28),缓存上下文输入低至¥0.02/百万token。模型原生支持Responses API格式并完全适配Codex,权重采用MIT许可。
各方评价积极,认为其Agent能力逼近Claude Opus 4.8,且高性价比可能改变昂贵任务路由策略。硅基流动已上线该模型,称其性能比肩GPT-5.6 Luna,价格远低于后者。
本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。
报道时间线
- DeepSeek V4-Flash-0731 公测:代码 Agent 能力大涨,价格不变
DeepSeek 正式公测 V4-Flash-0731,未加参数,纯靠后训练与 Agent 框架优化,将 DeepSWE 榜从 7.3 提升至 54.4,Cybergym 翻倍至 76.7,部分硬榜接近 Claude Opus 4.8。价格不变,原生支持 Responses API,老用户 API 自动切换新版。仅更新 Flash API,V4 Pro 正式版仍在开发中。
- DeepSeek V4 Flash 0731 上线硅基流动,性能比肩 GPT-5.6 Luna
DeepSeek V4 Flash 0731 已在硅基流动上线,激活参数更少,性能却几乎与 GPT-5.6 Luna 持平,价格远低于后者。每百万 token 输入 $0.14、输出 $0.28、缓存 $0.028。官方称其编码更强、工具调用与智能体能力更佳。
- DeepSeek-V4-Flash-0731 发布:304B 参数,智能体能力大幅增强
DeepSeek 发布 V4 系列最新模型 DeepSeek-V4-Flash-0731,拥有 3040 亿参数,智能体能力大幅增强。Artificial Analysis 评测显示其表现优于 428B 参数的 MiniMax M3。定价为每百万输入 token 0.14 美元、每百万输出 token 0.27 美元,可能是当前性价比最高的模型。
- DeepSeek 发布 DeepSeek-V4-Flash-0731,智能体与编程能力大幅提升
DeepSeek 于 7 月 31 日发布 DeepSeek-V4-Flash-0731,并将 V4-Flash API 开放公测。该版本沿用 284B 参数 MoE 架构,通过重新后训练实现性能跃升,在智能体基准上全面超越 V4-Pro(预览版)。API 定价为缓存未命中时每百万输入 token $0.14,输出 token $0.28,权重采用 MIT 许可。
- DeepSeek V4 Flash 0731 开源,登顶开源模型前三
DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。
- DeepSeek V4-Flash 公测,后训练性能碾压闭源
DeepSeek V4-Flash 正式版 API 今日公测,架构不变(284B 总参数、13B 激活的 MoE),仅靠后训练与 Agent 框架优化,DeepSWE 从 7.3 升至 54.4,Terminal Bench 达 82.7(Opus 为 85)。
- DeepSeek V4-Flash 公测,代码 Agent 能力暴涨 7 倍
DeepSeek 今日公测 V4-Flash-0731,参数未增(仍为 284B 总参、13B 激活 MoE、1M 上下文),纯靠后训练与 Agent 框架优化。
- DeepSeek 悄然发布 V4-Flash API,主打智能体能力
DeepSeek 悄然发布 V4-Flash API 版本,重点提升智能体能力,包括工具调用、软件环境操作和多步任务完成。该模型在多项智能体和编程基准上接近前沿水平,推理成本大幅降低,定价仅 ¥1/百万输入 token、¥2/百万输出 token,缓存上下文输入低至 ¥0.02/百万 token。
- DeepSeek-V4-Flash 发布,性能超 V4-Pro-Preview
DeepSeek-V4-Flash 官方 API 公开测试版上线,Agent 能力大幅升级,基准分数远超 V4-Pro-Preview,并原生支持 Responses API 格式、适配 Codex。
- DeepSeek V4 Flash 0731 发布,智能指数跃升 10 分
DeepSeek V4 Flash 0731 在 Artificial Analysis 智能指数上得 50 分,较 4 月版提升 10 分,领先 V4 Pro 6 分,并进入智能与成本帕累托前沿。
- DeepSeek V4-Flash 公测,后训练让 Agent 能力暴涨
DeepSeek V4-Flash-0731 正式版 API 今日公测,参数未变(284B 总参、13B 激活 MoE、1M 上下文),纯靠后训练与 Agent 框架优化,DeepSWE 从 7.3 飙至 54.4(涨 7.5 倍),Terminal Bench 达 82.7,逼近 Claude Opus 4.8 的 85。
- DeepSeek-V4-Flash 公测 API 上线,Agent 能力大幅升级
DeepSeek-V4-Flash 官方 API 现已公开测试上线,Agent 能力大幅升级,Terminal Bench 2.1 得分 82.7,超越更大的 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式并完全适配 Codex,配置详见官方 API 文档。主推文认为,将昂贵任务路由给更大模型的理由已不存在,长 Agent 循环正是费用堆积之处。
- DeepSeek V4-Flash 公测,代码 Agent 能力暴涨 7 倍
DeepSeek 正式公测 V4-Flash-0731,纯靠后训练与 Agent 框架优化(参数不变,仍为 284B 总参、13B 激活 MoE、1M 上下文),将代码 Agent 能力大幅提升:DeepSWE 榜从 7.3 飙至 54.4,Cybergym 翻倍至 76.7,Terminal Bench 达 82.7,部分指标已接近 Claude Opus 4.8。
- DeepSeek-V4-Flash 官方 API 上线,Agent 能力逼近 Opus 4.8
DeepSeek-V4-Flash 官方 API 公开测试版上线,Agent 能力大幅升级,基准测试远超 V4-Pro-Preview。其 DeepSWE 得分 54.4%、TerminalBench 得分 82.7%,均逼近 Opus 4.8 并超越 GLM-5.2。
- DeepSeek V4 Flash 正式版在九项 Agent 测试中全部超过 V4 Pro Preview
DeepSeek V4 Flash 正式版在九项 Agent 测试中全部超过 V4 Pro Preview,其中 DeepSWE 长周期功能开发得分提升 7.5 倍。模型结构和尺寸未变,仅重新后训练,价格不变。官方还预告了 Agent 框架 DeepSeek Harness,并计划在 8 号支持接入 codex,提供一键配置脚本,保留 MCP 及项目信任等级。
- DeepSeek-V4-Flash API公测上线,Agent能力大幅升级
🚀 DeepSeek-V4-Flash 官方 API 现已上线公测! 🔷 我们大幅升级了其 Agent 能力——基准测试分数现已远超 V4-Pro-Preview。查看下方巨大的性能飞跃!👇 🔷 官方 V4-Flash 现已原生支持 Responses API 格式,并已完全适配 Codex! 查看我们官方 API 文档中的配置详情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
- DeepSeek V4 Flash 正式版发布:后训练重做,九项 Agent 测试全面超越 V4 Pro Preview
DeepSeek V4 Flash 正式版发布,模型结构和参数规模不变,仅重做后训练,Terminal Bench 2.1 从 61.8 涨至 82.7,DeepSWE 从 7.3 涨至 54.4。
- DeepSeek-V4-Flash 正式版 API 上线公测,Agent 能力基准测试远超 V4-Pro 预览版
DeepSeek 今日宣布 DeepSeek-V4-Flash 正式版 API 上线公测,Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon verified 70.3,多项基准远超 V4-Pro-Preview。