AYi@AYi_AInotes
55AI 编辑部评分,满分 100
2026-07-31 15:47· 42分钟前
跳到正文
AI 摘要

DeepSeek 正式公测 V4-Flash-0731,纯靠后训练与 Agent 框架优化(参数不变,仍为 284B 总参、13B 激活 MoE、1M 上下文),将代码 Agent 能力大幅提升:DeepSWE 榜从 7.3 飙至 54.4,Cybergym 翻倍至 76.7,Terminal Bench 达 82.7,部分指标已接近 Claude Opus 4.8。

我去,DeepSeek这波是真杀疯了,还是那个13B激活的便宜Flash模型,参数半毛钱没加,纯靠后训练就直接把代码Agent能力干涨7倍,

价格还是地板价, 都快摸到Opus的边了!!!

今天正式开公测的V4-Flash-0731,看完成绩单我直接傻了: ▫️ DeepSWE榜从7.3直接飙到54.4,翻了快7.5倍,之前的V4 Pro预览版才12.8,现在Flash直接把老Pro按在地上打 ▫️ Cybergym从38.7干到76.7直接翻倍,Terminal Bench冲到82.7,比GLM-5.2还高1.7分 ▫️ 工具调用、全栈开发、终端操作这些Agent核心场景,大部分指标都追平甚至超过了贵好几倍的中大型模型,部分硬榜已经摸到Claude Opus 4.8的尾巴

最狠的是,这次半毛钱没加参数:还是284B总参、13B激活的MoE,1M上下文窗口没变,纯靠后训练和Agent框架优化就出了这效果。

模型ID都不用改,老用户API直接自动切新版,一行代码都不用动。

开发者最爽的点全给你安排明白了: 1️⃣原生支持Responses API格式,直接适配Codex,之前接OpenAI、2️⃣Anthropic格式的代码无缝迁移,思考模式照常能用。 3️⃣价格还是那熟悉的白菜价:输入$0.14/百万token,缓存命中才$0.0028,输出$0.28/百万,跑高频Agent、批量改代码、工具调用根本不心疼。

另外提个醒:这次更的只有Flash API,V4 Pro正式版还在赶,App和网页端暂时没更;

跑分用的是官方即将开源的Harness,第三方框架跑出来可能有点差异,但这提升幅度,做执行层模型、跑自动化代码任务的,现在就可以开测了。

之前大家都觉得模型能力涨就得堆参数、烧算力,DeepSeek这波直接给行业打了个样:把后训练和Agent对齐磨到位,小激活模型照样能干旗舰的活,还卖白菜价。

我觉得这波之后,其他家的执行层模型,价格怕是又要往下掉咯

#DeepSeek #AI编程 #Agent #大模型

DeepSeek🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We've massively upgraded its Agent capabilities-benchmark scores are now far surpassing the V4-...
AYi · @AYi_AInotes · X·2026-07-31 15:47·42分钟前
在 X 看原推· x.com
AI 摘要

DeepSeek 正式公测 V4-Flash-0731,纯靠后训练与 Agent 框架优化(参数不变,仍为 284B 总参、13B 激活 MoE、1M 上下文),将代码 Agent 能力大幅提升:DeepSWE 榜从 7.3 飙至 54.4,Cybergym 翻倍至 76.7,Terminal Bench 达 82.7,部分指标已接近 Claude Opus 4.8。

我去,DeepSeek这波是真杀疯了,还是那个13B激活的便宜Flash模型,参数半毛钱没加,纯靠后训练就直接把代码Agent能力干涨7倍,

价格还是地板价, 都快摸到Opus的边了!!!

今天正式开公测的V4-Flash-0731,看完成绩单我直接傻了: ▫️ DeepSWE榜从7.3直接飙到54.4,翻了快7.5倍,之前的V4 Pro预览版才12.8,现在Flash直接把老Pro按在地上打 ▫️ Cybergym从38.7干到76.7直接翻倍,Terminal Bench冲到82.7,比GLM-5.2还高1.7分 ▫️ 工具调用、全栈开发、终端操作这些Agent核心场景,大部分指标都追平甚至超过了贵好几倍的中大型模型,部分硬榜已经摸到Claude Opus 4.8的尾巴

最狠的是,这次半毛钱没加参数:还是284B总参、13B激活的MoE,1M上下文窗口没变,纯靠后训练和Agent框架优化就出了这效果。

模型ID都不用改,老用户API直接自动切新版,一行代码都不用动。

开发者最爽的点全给你安排明白了: 1️⃣原生支持Responses API格式,直接适配Codex,之前接OpenAI、2️⃣Anthropic格式的代码无缝迁移,思考模式照常能用。 3️⃣价格还是那熟悉的白菜价:输入$0.14/百万token,缓存命中才$0.0028,输出$0.28/百万,跑高频Agent、批量改代码、工具调用根本不心疼。

另外提个醒:这次更的只有Flash API,V4 Pro正式版还在赶,App和网页端暂时没更;

跑分用的是官方即将开源的Harness,第三方框架跑出来可能有点差异,但这提升幅度,做执行层模型、跑自动化代码任务的,现在就可以开测了。

之前大家都觉得模型能力涨就得堆参数、烧算力,DeepSeek这波直接给行业打了个样:把后训练和Agent对齐磨到位,小激活模型照样能干旗舰的活,还卖白菜价。

我觉得这波之后,其他家的执行层模型,价格怕是又要往下掉咯

#DeepSeek #AI编程 #Agent #大模型

DeepSeek🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We've massively upgraded its Agent capabilities-benchmark scores are now far surpassing the V4-...
在 X 查看原推x.com