数字生命卡兹克@Khazix0918
51AI 编辑部评分,满分 100
2026-07-31 15:50· 18分钟前
跳到正文
AI 摘要

DeepSeek-V4-Flash 正式版 API 上线公测,模型结构和参数规模不变,仅重做后训练,Agent 能力大幅提升,九项测试全部超过 V4 Pro Preview。该版本原生支持 Responses API,并针对 Codex 适配。作者认为其智能中上、价格极低,适合处理海量日常任务,是“智能平权”的关键。

等了好久,DeepSeek V4的正式版终于来了。 可惜,来的还是DeepSeek-V4-Flash,V4 Pro正式版还得继续等。

但我看到消息的第一反应,还有很开心的。 因为V4 Flash对我现在的生活,反而比V4 Pro还要重要。

这次,DeepSeek V4 Flash它的模型结构和参数规模完全没变,只重新做了后训练,但是强了特别多。 Terminal Bench 2.1从61.8涨到了82.7。 DeepSWE从7.3涨到了54.4。 DSBench-FullStack从37.0涨到了68.7。

官方列出的九项Agent测试里,它已经全部超过了V4 Pro Preview。 同时还原生支持Responses API,专门针对Codex进行了适配。

讲真,DeepSeek这次在后训练上,应该是憋了个大的。 但如果让我非常坦率地评价,DeepSeek V4 Flash在最顶级的Coding和Agent任务里,跟GPT-5.6 Sol、Claude Opus 5、Kimi K3这些最强模型,依然会有巨大的差距。

复杂项目的架构设计、长时间自主执行、充满意外的多步任务,我大概率还是会优先把最强的模型挂上去。 这没什么可避讳的。

但模型真正进入生产环境以后,能力上限只是一部分。 还有一个经常被低估到离谱的指标: 你到底用不用得起。 这也是我为什么反而更期待Flash。

我自己的AIHOT,现在每天差不多要抓一万条新闻。 这些新闻进来以后,要做结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并等等,还有一大堆后续判断。 最后才回到真正的精选打分环节那一步。

这里面绝大多数环节,都需要AI介入。 有些流程复杂到甚至需要Agent自己调用工具、检查结果、决定下一步。

一万条新闻,乘上一大串处理链路,最后就是一个极其恐怖的调用量。

按照我现在的调用规模,每个月大概API的消耗量在1000多人民币,你要是换成我常用的那些顶级模型,成本至少得翻十倍以上。

但DeepSeek V4 Flash就很适合干这个。 智能水平在中上等,却又便宜得离谱。

WorkBuddy里也是一样。 真正难到天上的任务,大家可以接K3。 可绝大多数日常任务,DeepSeek V4 Flash已经完全能处理,而且单次只消耗0.06积分。

行业当然需要那些一次跑通世界级难题的顶级模型。 可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。

当智能贵得像奢侈品时,大家只能偶尔体验。 当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线和每一个普通人的生活里。 所以我很多时候,真的挺感谢DeepSeek。

这才是真正的,智能平权。

DeepSeek🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We've massively upgraded its Agent capabilities-benchmark scores are now far surpassing the V4-...
数字生命卡兹克 · @Khazix0918 · X·2026-07-31 15:50·18分钟前
在 X 看原推· x.com
AI 摘要

DeepSeek-V4-Flash 正式版 API 上线公测,模型结构和参数规模不变,仅重做后训练,Agent 能力大幅提升,九项测试全部超过 V4 Pro Preview。该版本原生支持 Responses API,并针对 Codex 适配。作者认为其智能中上、价格极低,适合处理海量日常任务,是“智能平权”的关键。

等了好久,DeepSeek V4的正式版终于来了。 可惜,来的还是DeepSeek-V4-Flash,V4 Pro正式版还得继续等。

但我看到消息的第一反应,还有很开心的。 因为V4 Flash对我现在的生活,反而比V4 Pro还要重要。

这次,DeepSeek V4 Flash它的模型结构和参数规模完全没变,只重新做了后训练,但是强了特别多。 Terminal Bench 2.1从61.8涨到了82.7。 DeepSWE从7.3涨到了54.4。 DSBench-FullStack从37.0涨到了68.7。

官方列出的九项Agent测试里,它已经全部超过了V4 Pro Preview。 同时还原生支持Responses API,专门针对Codex进行了适配。

讲真,DeepSeek这次在后训练上,应该是憋了个大的。 但如果让我非常坦率地评价,DeepSeek V4 Flash在最顶级的Coding和Agent任务里,跟GPT-5.6 Sol、Claude Opus 5、Kimi K3这些最强模型,依然会有巨大的差距。

复杂项目的架构设计、长时间自主执行、充满意外的多步任务,我大概率还是会优先把最强的模型挂上去。 这没什么可避讳的。

但模型真正进入生产环境以后,能力上限只是一部分。 还有一个经常被低估到离谱的指标: 你到底用不用得起。 这也是我为什么反而更期待Flash。

我自己的AIHOT,现在每天差不多要抓一万条新闻。 这些新闻进来以后,要做结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并等等,还有一大堆后续判断。 最后才回到真正的精选打分环节那一步。

这里面绝大多数环节,都需要AI介入。 有些流程复杂到甚至需要Agent自己调用工具、检查结果、决定下一步。

一万条新闻,乘上一大串处理链路,最后就是一个极其恐怖的调用量。

按照我现在的调用规模,每个月大概API的消耗量在1000多人民币,你要是换成我常用的那些顶级模型,成本至少得翻十倍以上。

但DeepSeek V4 Flash就很适合干这个。 智能水平在中上等,却又便宜得离谱。

WorkBuddy里也是一样。 真正难到天上的任务,大家可以接K3。 可绝大多数日常任务,DeepSeek V4 Flash已经完全能处理,而且单次只消耗0.06积分。

行业当然需要那些一次跑通世界级难题的顶级模型。 可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。

当智能贵得像奢侈品时,大家只能偶尔体验。 当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线和每一个普通人的生活里。 所以我很多时候,真的挺感谢DeepSeek。

这才是真正的,智能平权。

DeepSeek🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We've massively upgraded its Agent capabilities-benchmark scores are now far surpassing the V4-...
在 X 查看原推x.com