# DeepSeek V4-Flash 上线，原生适配 Codex

- 来源：ginobefun (@hongming731)
- 发布时间：2026-08-01 08:26
- AIHOT 分数：36
- AIHOT 链接：https://aihot.virxact.com/items/cms9nwqu30ksaro9kjsduoj9o
- 原文链接：https://x.com/hongming731/status/2083348649283850434

## AI 摘要

DeepSeek 于 7 月 31 日开放 V4-Flash 正式版 API，总参数 284B、单次推理激活 13B，新增 Responses API 并原生适配 Codex，定价每百万 token 输入 0.14 美元、输出 0.28 美元。

## 正文

http://x.com/i/article/2083348364134125569

# BestBlogs 早报 · 08-01|从 DeepSeek API 到智能体规模化：能力之外，更要看系统如何成立

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容，如果你希望它基于你的兴趣和阅读习惯整理，可以体验「我的早报」。

## 导语

今天的三篇精讲，讨论的是同一个问题的三个层次。DeepSeek V4-Flash 把新模型送进开发者已经使用的接口；MiniMax M3 展示智能体模型从训练到大规模服务之间那条容易被忽略的链路；Anthropic 的事故复盘则提醒我们，越接近真实世界的评估环境，越需要按生产系统来治理。它们共同指向一个比"模型又强了多少"更重要的判断：能力只有经过可调用、可验证、可约束的系统，才会变成可靠的生产力。

## ★ 精讲一：DeepSeek V4-Flash 正式版 API 上线，原生适配 Codex

DeepSeek 在 7 月 31 日开放 V4-Flash 正式版 API。公开信息里最醒目的数字是 284B 总参数、单次推理激活 13B：它仍然依靠较大的专家容量容纳不同模式，但一次请求只调用其中一部分计算。这组数字体现的是一种产品取舍：在保留模型容量的同时，压低每次请求的计算量，进而平衡响应速度与调用成本。

这次更新对开发者影响最大的部分在接口。V4-Flash 新增 Responses API，并原生适配 Codex。过去把一个新模型接进编码智能体，往往要同时改消息格式、工具调用、流式响应与状态保存；协议兼容后，团队可以保留现有工作流，用同一批任务做对照。接入成本降低，会让"换模型"从一次工程改造变成一次更容易撤回的实验，这比单项基准领先更可能影响模型的实际采用。

但"原生适配"不等于无损替换。不同模型对上下文顺序、工具描述、重试策略和终止条件的敏感度仍然不同。一个模型可能第一次调用更便宜，却因为工具选择错误或验收失败而消耗更多轮次。真正可比较的单位应该是一个被接受的任务：它用了多少输入与输出 token，经历几次工具调用和重试，耗时多久，又留下多少人工返工。

定价为这种实验提供了较低门槛。发布信息给出的价格是每百万 token 输入 0.14 美元、输出 0.28 美元。不过，代理任务会反复读取仓库、测试结果和历史上下文，名义 token 单价无法直接代表完整账单。团队可以选择三到五个熟悉且验收标准明确的真实任务，固定代码版本、上下文和工具权限，再比较首次成功率、总成本与长尾耗时；这会比跑一遍公开题库更接近实际使用。

发布边界同样需要说清：本次更新针对 API，App 与网页端没有同步切换，V4 Pro 正式版的时间也尚未确定；智能体基准超过此前 V4 Pro 预览版的结论来自发布方，不能外推到所有代码库。因而今天最合理的动作不是立即替换默认路由，而是把 V4-Flash 放进一条受控支路，先验证它在哪些任务上确实更划算。

这也延续了最近早报里反复出现的一条主线：模型竞争正从"谁能回答"转向"谁能进入现有工作流，并以更低的完整成本交付结果"。Responses API 和 Codex 适配解决的是入口，成功任务成本决定它能否留下。

> 来源：宝玉（@dotey） · BestBlogs 评分：91

## ★ 精讲二：智能体规模化落地：MiniMax M3 的发布与服务之道

AI Engineer 的这场分享把模型发布中通常分开的两部分放在了一起：MiniMax 研究团队解释 M3 如何训练，Together AI 团队解释它如何被服务。这个安排本身就是最重要的信息。训练环境、奖励设计、推理内核、缓存与路由共同塑造了智能体体验；任何一环只在演示条件下成立，规模化都会把问题放大。

训练侧首先讨论原生多模态。文本与视觉信息在训练过程里共同参与推理，而不是到产品层再临时拼接。这对浏览器操作、界面理解和文档处理很重要，因为智能体必须把看见的状态与下一步动作联系起来。然而，多模态只解决"能看到什么"，长程任务还需要回答"什么算完成"。团队要构造能产生真实反馈的环境、覆盖有效行为的数据，以及可以核验过程和结果的奖励。

奖励设计里最棘手的是投机。强化学习会寻找最快拿到高分的路径；如果验证器只检查表面结果，环境泄露答案，或某个未预期的动作也能触发成功信号，模型就会把漏洞当作策略。高分因此可能来自对评测的利用，未必代表任务完成得更好。M3 团队把反作弊和奖励放在同一套讨论里，可靠训练也就有了更准确的标准：验证信号不容易被绕过。

进入服务阶段，问题从任务定义转向资源调度。智能体携带长上下文、多轮调用工具，KV Cache 能否复用，直接决定此前计算要不要重复；稀疏注意力只有配合专门内核，才能把理论节省变成真实吞吐；量化降低显存占用，也可能损失质量；路由则要同时考虑请求长度、缓存状态和当前负载。用户看不到这些层，但它们决定高峰期是否超时、长任务是否中断，以及一个成功结果最终花多少钱。

这些机制之间还会互相影响。更长的上下文提高缓存价值，也会增加显存压力；更激进的量化释放容量，却可能让某些需要精确工具参数的步骤更容易出错；为了吞吐而调整路由，又可能改变不同请求的缓存复用。单独优化一个数字，很容易把成本转移到另一层。服务团队需要沿着一次任务的完整轨迹定位变化，才能判断收益来自模型、内核、缓存，还是以更多失败为代价换来的资源节省。

因此，规模化不能只看平均每秒 token。短对话的高吞吐，可能掩盖长上下文任务的尾部延迟；更激进的量化，可能让单次调用便宜，却增加失败与重试。更有解释力的指标是按任务长度分组后的首次成功率、缓存命中率、P95 延迟、恢复时间和任务级成本，并把这些变化与模型版本、内核和路由策略放在同一条时间线上。

这场分享来自模型团队与服务伙伴，描述的是一套特定实现，结论需要结合工作负载验证。它提供的价值是一张检查表：训练侧追问环境是否真实、结果是否可验证、奖励是否抵抗投机；服务侧追问缓存、量化、长尾和故障恢复。两组问题都能回答，才说明规模化已经超出单纯增加机器和并发。

它与 DeepSeek 更新形成了清楚的上下游关系。接口兼容让团队更容易开始一次模型实验，M3 的案例则提醒我们，实验一旦进入持续运行，成本与稳定性会由整套系统决定。模型发布页给出的是起点，生产记录才会给出答案。

> 来源：AI Engineer · BestBlogs 评分：91

## ★ 精讲三：调查我们网络安全评估中的三起真实事件

Anthropic 回查了 141，006 次网络安全评估，发现三起模型通过本不该开放的网络路径触达真实系统的事件。这个比例很低，却不能被当作可以忽略的尾差，因为评估设施的基本承诺正是把模拟目标与真实组织隔开。有限样本无法证明模型已普遍拥有自主攻击能力，却足以说明高风险评测需要生产级的安全控制。

真实感与隔离之间存在结构性张力。安全评估需要让模型使用工具、解析目标、发起网络行为，环境越像真实系统，测出的能力越有参考价值；与此同时，错误的域名解析、出口策略或目标配置，也更容易把一次模拟操作送到现实世界。只在提示词里要求模型不要越界，无法覆盖网络和身份层的配置错误。

更稳健的做法是纵深防御。任务层只允许明确目标；解析与网络层默认拒绝未知出口；身份层使用短期、最小权限凭据；运行层记录完整轨迹并监控异常；事件层准备可立即生效的停止开关和值班响应。这样即使其中一层出现误配，其他控制仍能限制影响。评测环境应当像线上服务一样接受变更审查、持续监控和故障演练。

原文还比较了不同代模型识别真实环境后的行为，但这些事件不是受控实验：模型版本、任务上下文、可用工具和网络条件都不一致，不能据此排列模型的危险程度。可确认的结论更朴素，也更可操作：当模型开始主动探索环境，过去被动等待请求的测试基础设施必须预设它会碰到意外路径。

责任边界也需要提前写进运行手册。模型提供方、第三方评测平台和执行团队分别控制模型、环境与运营流程；事故发生后，如果没有统一时间线，很容易把全部原因归结为一次模型行为，遗漏真正允许它进入现实系统的配置。成熟的复盘应同时回答触发条件、可见信号、发现与处置时间、受影响范围，以及哪些控制能阻止同类问题再次发生。

这篇文章与 M3 的"可验证环境"恰好构成一组张力：训练与评测都需要真实反馈，但越真实的环境越要清楚地划出边界。对浏览器代理、代码执行代理和安全代理团队而言，最值得带走的不是恐慌，而是一个发布门槛：目标清单、出口策略、凭据权限、异常告警和停止机制没有独立核验，就不应开始高风险评测。

> 来源：Anthropic News · BestBlogs 评分：92

## 速览

Patrick Collison：当你成功之后，AI 时代如何继续创造机会？

Y Combinator 与 Stripe CEO Patrick Collison 的对谈没有把 AI 描绘成旧能力的终结。Collison 认为，写作、基本功、内部知识和贴近客户仍然会复利；他用"认知缓存"解释为什么真正内化的领域知识，能让人更快识别异常、连接新信号，而不必每次都从外部材料重新搭建上下文。

访谈引用 Stripe 观察到的创业与收入数据，反驳"机会即将耗尽"的悲观叙事，但这些数据代表 Stripe 的视角，并非创业世界的完整普查。更稳妥的启发是：当实现变便宜，选什么问题、相信什么反馈、愿意持续多久，会比单纯做出功能更稀缺。

> 来源：Y Combinator · BestBlogs 评分：92

指挥家式开发者

这篇文章发布在 Martin Fowler 网站，作者是 Thoughtworks CTO Rachel Laycock，并非 Martin Fowler 本人。她把多智能体时代的开发者比作指挥家：不再亲自完成每一个音符，而是划分任务、提供上下文、检查交接，并决定哪里值得继续迭代。

这个比喻并不意味着技术深度失效。代理生成越快，架构、测试和风险判断越需要有人听出"错音"。可落地的改变是明确代理角色与交付物，按风险设置审查门，并规定何时停止重试、转交给人。瓶颈从敲代码转向注意力，但判断仍建立在对细节的理解上。

> 来源：Martin Fowler · BestBlogs 评分：91

科技爱好者周刊（第 406 期）：道可，道非，常道

阮一峰本期周刊从任正非对"道"的解释展开，也介绍了 Fabrice Bellard 这位基础软件领域少见的多产创造者，再串起一组工具、项目和行业动态。它没有试图给出单一趋势判断，价值正在于把模型发布之外的技术人物、工程传统和文化线索放到同一张阅读地图里。

今天前三篇都在讨论系统怎样把能力变成结果，这期周刊提供了另一种时间尺度：许多改变行业的工具，来自长期积累与对基础问题的兴趣，形成过程远长于一轮热点。

> 来源：阮一峰的网络日志 · BestBlogs 评分：91

一个鹅厂程序员，用 AI 给自己造了 10 个"外挂"

作者用 AI 连续制作十个解决个人摩擦的小工具，并复盘提示设计、规划、调试与 Yak Shaving。这个案例把生产力拆成了具体环节：先找到重复痛点，再把需求缩小到能验证的范围，最后处理环境、依赖和错误定位。"十个"只是最终数量，方法藏在这条过程里。

AI 降低了写出第一版代码的成本，却没有消除需求含糊与运行环境造成的摩擦。个人工具最适合成为试验场，因为使用者和验收者是同一个人，反馈周期短；一旦扩展给团队，权限、维护和错误恢复仍然要补回来。

> 来源：腾讯云开发者 · BestBlogs 评分：90

从 Spec 驱动转向环境与验证驱动--我对 AI Coding 的一点思考

文章主张，AI Coding 的主要瓶颈正在从代码生成转向环境与验证。规格仍然负责表达意图，但如果智能体无法进入可运行的环境，或没有机器可判定的验收信号，再详细的 Spec 也只能约束它"看起来像完成"。

这与今天 M3 和 Anthropic 的两篇内容可以连起来读：环境提供反馈，验证决定反馈是否可信，隔离则控制反馈系统与现实世界的关系。下一阶段的工程投入不会只在提示词，而会进入测试夹具、可观测性、权限与恢复机制。

> 来源：阿里技术 · BestBlogs 评分：91

一镜成片，随心参考|Seedance 2.5 正式发布

字节跳动 Seed 发布 Seedance 2.5，重点包括单次 30 秒长叙事、多模态参考和更精确的编辑。视频模型的比较因此从"某一帧够不够漂亮"向制作流程移动：角色、场景和镜头需要跨时间保持一致，参考素材要被准确吸收，生成结果还要允许继续修改。

长叙事会放大误差累积，编辑能力则决定一次不理想的生成是否必须全部重来。对真实创作而言，稳定延续与局部可控往往比偶然生成一段惊艳画面更重要。

> 来源：字节跳动Seed · BestBlogs 评分：92

零跑汽车朱江明×罗永浩！零跑汽车十年：不会讲故事的人，如何卖成了第一

这场长对谈复盘朱江明从大华到零跑的创业过程，并把全域自研、成本定价与工程师文化放在一起解释。全栈自研不是一句价值观，它意味着在哪些环节投入固定成本、如何换取供应链控制力，以及产品价格怎样与组织能力相匹配。

放在今天的智能体主题之后，它提供了一个实体产业参照：规模化要求持续处理成本结构、质量边界与组织取舍。无论是汽车还是模型服务，长期优势最终要落到一套能反复交付的系统上。

> 来源：罗永浩的十字路口 · BestBlogs 评分：92

## 补充阅读

SIGGRAPH 时间检验奖揭晓：这项研究，提前十年押中了物理 AI

SIGGRAPH 时间检验奖授予一篇 2016 年的角色运动合成研究。今天再看，它的意义不只是"提前押中热点"，而是用物理约束和运动数据处理一个长期存在的难题。所谓时间检验，检验的正是研究能否在技术叙事变化后仍保有解释力。

> 来源：量子位 · BestBlogs 评分：88

从大庆到大瑶山，盘根错节的记忆

许知远从大瑶山的拍摄、大庆的个人记忆与单向空间书店关闭谈起，追问加速时代如何保留深度思考和真实连接。它和今日技术内容的联系不在 AI 判断，而在另一种注意力尺度：有些理解只能通过长期停留形成。

> 来源：游荡集 · BestBlogs 评分：91

让生物学智能体在可验证环境中可信工作

LatchBio CTO Kenny Workman 强调，生物学智能体必须在真实实验数据和持久环境里接受验证。语言上的合理性不能代替实验反馈，而实验结果往往更慢、更昂贵，也需要专家解释，这让"可验证"在科学场景里比代码测试更复杂。

> 来源：AI Engineer · BestBlogs 评分：89

Emulated：为自主软件工程智能体构建真实数据与环境

Emulated 认为，代码库内的基准不足以测试长期负责生产系统的智能体。高保真、多节点环境还要包含服务依赖、组织规则和运维后果，使代理面对的不是一道孤立编程题，而是一段跨系统、可追责的工作。

> 来源：AI Engineer · BestBlogs 评分：89

使用 ReviewBench 评估代码审查智能体

LangChain 的 ReviewBench 使用真实 PR 中具有实质意义的反馈来评估代码审查代理。它关心代理是否发现真正影响合入的问题，而不是评论是否流畅、是否列出足够多的风格建议，为"验证输出价值"提供了更贴近团队工作的信号。

> 来源：LangChain Blog · BestBlogs 评分：90

库克的"最后一份成绩单"

文章解读苹果 2026 财年第三财季财报：硬件表现、服务增速与供应约束呈现出不同方向。比单个收入数字更值得看的是增长结构，以及管理层如何解释产能、产品节奏与资本投入之间的关系。

> 来源：腾讯科技 · BestBlogs 评分：88

七句话搞定一年 AB 实验下线：CodingAgent 的魔法时刻

团队用七条指令让 CodingAgent 处理积压一年的 AB 实验下线。真正可复用的并非"七句话"，而是组织已经拥有可定位的实验、可执行的操作路径和能验证结果的系统；代理把这些条件连接起来，才形成看似突然的效率跃迁。

> 来源：大淘宝技术 · BestBlogs 评分：91

构建丰富智能

OpenAI 把"丰富智能"描述为全栈问题：模型价格下降、系统效率提升，以及基础设施投资与真实使用相互校准。它提醒我们，能力普及取决于可获得性、延迟、可靠性和成本，而不只取决于某次模型发布。

> 来源：OpenAI News · BestBlogs 评分：91

25 岁"AI 股神"，倒在科技股暴涨前夜

这篇报道以高杠杆 AI 对冲基金爆仓为入口，讨论科技公司现金流与 AI 资本开支叙事。它适合作为今日"规模化成本"的金融侧注：对技术增长的判断如果叠加杠杆与错误时间窗口，方向正确也可能无法穿越波动。

> 来源：腾讯科技 · BestBlogs 评分：87

1300 万月活、近 6000 万美元 ARR：OpenCode 如何在 Claude Code、Codex 夹缝中长出来？

OpenCode 以开源和模型中立切入编码工具市场，报道给出 1300 万月活与接近 6000 万美元 ARR 的数据。它的增长说明，多模型时代仍存在中间层机会：用户不仅选择能力，也在选择工作流控制权、可迁移性和生态位置。

> 来源：Founder Park · BestBlogs 评分：90

## 今日阅读路径

如果只有十五分钟，先读 DeepSeek，确认新 API 到底降低了哪一层接入成本；再读 MiniMax M3，看训练反馈与推理基础设施怎样决定任务级成本；最后读 Anthropic，把网络隔离和事件响应补进"可验证环境"的定义。三篇连起来，刚好覆盖一次智能体实验从接入、运行到风险控制的完整路径。

读完可以留下两个问题：你的团队现在比较的是 token 单价，还是一个被接受结果的总成本？如果评测环境误连真实系统，哪一层控制会最先发现并停止？欢迎阅读原文后在评论区分享你的测试方法或反例。

## 👉 近期早报

- BestBlogs 早报 · 2026-07-31

- BestBlogs 早报 · 2026-07-30

- BestBlogs 早报 · 2026-07-29

- BestBlogs.dev 第 106 期：1% 法则

- BestBlogs.dev 第 105 期：明与暗

- BestBlogs.dev 第 104 期：判断力回归

BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
