http://x.com/i/article/2090955894477774848
BestBlogs 早报 · 08-22|Anthropic 重构 SDLC,DeepSeek 开放视觉 API,Hallmark 编码设计品味
在线阅读本期早报
BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。
导语
当 Agent 能在几小时内写完过去数周的代码,计划、评审与部署如果仍按旧节奏运转,团队得到的可能不是更快交付,而是更长的等待队列。Anthropic 今天给出一份覆盖六阶段的 AI 原生 SDLC 手册,把注意力从「再加一个编码工具」移向整条交付链路。
另外两篇精讲解决更具体的问题。DeepSeek 把实验性的视觉模型开放为 API,同时交代图像 token、输入格式与文件复用;Together AI 的 Hassan El Mghari 则把难以言传的设计品味拆成负面约束、视觉参考、偏好记忆和短迭代。
它们无需被包装成同一项技术突破:一篇讨论组织流程,一篇是产品接入更新,一篇提供界面实践。共同的阅读价值在于,模型能力只有变成可传递的工件、清晰的调用契约或可复用的上下文,才会稳定进入工程系统。
★ 精讲一:Anthropic AI 原生软件交付生命周期手册
来源:Claude Blog · BestBlogs 评分:94
Anthropic Applied AI 团队的出发点很直接:代码生成速度已经大幅提升,围绕代码的审批、交接与政策却没有同步变化。构建阶段缩短后,瓶颈转移到左侧的计划,以及右侧的测试、评审和部署;安全团队若仍按人工产出规模配置,只会在积压与审查不足之间被迫选择。
手册没有删除传统 SDLC 的控制目标,而是把 Plan、Design、Build、Test、Deploy、Maintain 六个阶段改造成可循环的流程。每个阶段都要提交下一阶段能读取的版本化工件:从 intent.md、spec.md、plan.md,到代码与测试、PR 审查发现和事故记录。提交链既是自动触发器,也是审计轨迹。
计划阶段先让想法提出者用自己的语言形成 intent.md,再由产品负责人修正和接受;设计阶段让 Agent 在品牌、安全、合规与 UX Skills 的约束下生成 spec.md。这减少了多角色转述造成的信息损失,但人仍负责确认问题是否被正确理解、冲突政策如何处理,以及工作是否应继续进入实现。
到了构建阶段,工程师先在 plan mode 中审查文件范围、实施顺序、风险与证明方式,再允许 Agent 修改代码。CLAUDE.md 保存仓库约定,Skills 承载需要一致执行的组织知识,Hooks 则为必须成立的规则提供确定性阻断。手册特别区分了建议性控制与强制控制,避免把一份提示词误当成安全边界。
测试与部署也被提前拉进内循环:Agent 应持续获得测试、构建或截图差异这样的反馈,配置变化由 eval 套件检查,PR 同时接受自动审查与代码所有者批准。生产门仍由人类授权,Agent 可以准备发布、诊断失败或提出回滚,但不能自行跨过组织定义的生产关口。
维护阶段再把环闭合:监控脚本以确定性阈值发现异常,随后调用 Agent 诊断,并把结果写回新的 intent.md。这份手册最可复用的不是照搬所有 Claude 组件,而是逐段检查工件、依赖、审批者和指标:如果下一阶段仍靠口头交接,或质量信号要到几天后才出现,编码提速就很难转化为端到端收益。
它仍是 Anthropic 基于自身与客户实践整理的一手方法,而不是跨组织对照实验。团队更适合先选一个无前置依赖的环节试行,再观察从意图到工件的耗时、首次 CI 成功率、返工次数与事故复发率,确认控制质量没有随吞吐量下降后再扩展。
★ 精讲二:V4-Flash-Vision-Exp 上线,开启多模态 API 服务
来源:DeepSeek · BestBlogs 评分:93
DeepSeek 已将实验模型 deepseek-v4-flash-vision-exp 上线 API 平台。此次更新把视觉理解放进现有 V4-Flash 调用体系:官方称其纯文本 Agent、推理和世界知识能力与 V4-Flash 正式版持平,在需要视觉理解的 Agent Benchmark 上则有明显提升,并接近 Opus-4.8。
这些比较来自 DeepSeek 自己披露的测试设置。Code Agent 文本任务使用 DeepSeek Harness 极简模式、max 档位、temperature=1.0 与 top_p=0.95;ApexBench 和 Agents' Last Exam 的文本模型会忽略多模态元素。读者可以把它当作接入前的方向信号,但仍需用自己的图片类型、工具链和成功标准复测。
发布给出的演示覆盖三类场景:生成高端西藏自驾游 PPT、用黑蓝深海与玻璃 UI 重做开发者网站,以及制作黏土怪物舞池的前端动态 Demo。它们说明模型不只做图片问答,也被放入能够规划、生成内容和修改界面的 Agent 框架;演示效果本身并不等于生产任务的稳定通过率。
API 契约比演示更适合开发者立即评估。服务支持 Chat Completions、Messages、Responses 三种格式,图文混合输入可通过 base64、外部 URL 或 Files API 传入。图片会转换为 token 计费,单张最多占 384 tokens,价格与 V4-Flash 相同。
新开放的 Files API 不收费,图片上传后可用 file_id 在多个请求中复用,减少重复传输的带宽。对于同一张商品图、设计稿或页面截图要经过多轮分析的工作流,这会改变调用结构:文件生命周期、访问权限和缓存命中需要与模型请求一起设计,而不是每轮重新塞入 base64。
接入顺序可以很务实:先用真实样本比较纯文本与视觉任务,再记录单图和多图请求的 token、延迟与失败模式,最后验证三种接口格式在现有 Agent 框架里的工具兼容性。由于模型仍标注为 Exp,生产决策还要等待版本稳定性、限流和后续文档;当前最明确的增量,是视觉输入已经有了可直接测试的 API 与成本边界。
★ 精讲三:缺失的一层:如何让智能体学会设计品味|Hassan El Mghari,Together AI
来源:AI Engineer · BestBlogs 评分:91
Together AI 开发者体验负责人 Hassan El Mghari 讨论的不是如何让 Agent 一次生成完美页面,而是非设计师怎样把审美判断变成可执行上下文。他过去五年大约每年发布十个应用,并把部分产品获得用户的原因归于设计与体验;这次演讲提炼的是他的个人工作流,而非一套通用设计评测。
第一步是能说清「AI 味」来自哪里。紫色渐变、斜体大标题、夸张字距的全大写胶囊、随机装饰、过多 emoji,以及不一致的间距,都会让页面显得像未经整理的一次生成。只有把模糊的不喜欢拆成具体模式,模型才知道下一轮该禁止什么、保留什么。
Hallmark Skill 因此包含两类信息:一组阻止常见套路的「AI slop gates」,以及一组可供借鉴的视觉主题。负面约束负责清除默认答案,正向参考为模型提供方向。Hassan 表示 Hallmark 发布约一个半月后有超过一万人试用,但他也把生成结果定位为更好的起点,而不是完成态设计。
演讲还比较了快速小模型与昂贵模型的迭代体验。他用 GLM 5.2 和 Opus 4.8 生成页面,让现场观众辨认来源,只有少数人选对;他称后者成本约高五倍、耗时更长。这个现场比较没有形成正式基准,却揭示一个实用取舍:界面质量往往来自多轮反馈,响应速度会直接影响愿意迭代多少次。
更稳定的做法是建立个人设计记忆。每当 logo、排版、动效或留白反复出错,就把偏好写入 Skill 或 AGENTS.md;遇到优秀网站则保存截图,形成灵感库。启动新产品时,不只说「做得高级」,而是提供多个具体参考,并交代用户、交互、文本框、图片上传和视觉目标。
详细提示与小步实现需要同时存在。初始提示可以用两三段描述完整愿景,但七项功能不应在一次请求中全部实现;先搭基础,再让每轮只处理一两项功能,并把截图和反馈持续送回模型。设计品味在这里不是神秘天赋,而是一套会积累、可版本化、能在反馈中修正的偏好系统。
对非设计师来说,最有用的起点不是复制 Hallmark 的每条禁令,而是回看自己最近三个 Agent 页面:列出重复出现的视觉失误,挑选两三个认可的参考,建立一份可持续更新的设计说明。若迭代后仍只得到风格模仿,还需引入真实用户任务和可用性检查,避免把「不像 AI 生成」误当成「设计有效」。
速览
Uber 的智能体 SDLC:从编码智能体到可治理的软件工厂
来源:AI Engineer · BestBlogs 评分:91
Uber 展示的目标不是给每位工程师装一个编码助手,而是用模型网关、MCP 网关、云端开发环境、托管 Skills、上下文图谱和 Cortana 助手,组成可治理的端到端软件工厂。
模型网关限制 PII 外流、控制护栏延迟并归属每次请求;MCP 网关统一接入内部 API 与 SaaS 工具。其上下文图谱包含 150 类节点和边、约四千万条记录,用来连接代码、设计文档、工单与事故信息,再由 Cortana 和云端编码 Agent 完成跨仓库工作。
这套案例说明,规模化 Agent 工程的成本会从模型调用转向身份、上下文、环境、可观测性与维护。演讲中的 World Cup 接送点功能是一条内部演示链路,读者应关注这些基础设施如何减少交接,而不把原型速度等同于生产收益。
深入 DeepWiki:Cognition 如何为 Devin 大规模构建代码 Wiki
来源:LangChain · BestBlogs 评分:90
__XPOSTER_u3rbm_IMAGE_5__
DeepWiki 从给 Devin 提供代码库宏观理解的内部工具,发展为公开文档和问答产品。Cognition 工程师称它已索引约 140 万个仓库、服务超过两千万次查询,并逐渐成为 Devin 的上下文层。
生成流程先用目录结构、符号图、Git 历史和可用的运行时数据为文件及关系评分,再构建代码图、聚类出关键系统、设计目录,最后并行生成页面。目录决定内容覆盖与页面关系,因此比逐页调用模型更早成为质量控制点。
DeepWiki v2 在量化图谱之上加入自适应 Agent,让它遇到异常仓库时按需拉取更多聚类或重新评分。这个组合比「把整个仓库塞进上下文」更可扩展,但规模数字来自 Cognition 自述,准确性与企业私有仓库效果仍需按代码库验证。
追逐 Batch-1 下限:Ling-3.0-flash 在 Blackwell 上的投机解码
来源:LMSYS Blog · BestBlogs 评分:91
RadixArk SGLang 与蚂蚁 Ling Infra 团队针对四块 NVIDIA Blackwell GPU 上的 Batch-1 解码做优化,因为单请求没有批量可摊薄启动开销,每个微秒都会直接进入用户等待时间。
NEXTN 路径把吞吐从 288 tok/s 提到 606 tok/s,平均 TPOT 从 3.33 ms 降到 1.53 ms;同机同命令的千请求对比中,DSpark 达到 1120 tok/s 和 0.78 ms,平均 TPOT 比 NEXTN 再低 1.9 倍。
文章的价值在于把收益拆回主机预运行、PDL 链式调用、内核与投机解码器,而非只报终点数字。结论适用于这套模型、硬件、命令与并发一口径,评估其他服务时仍要把首 token、尾延迟、接受长度和真实流量分布一起纳入。
浅谈 SKILL 研发的最佳实践——以百补详情助手为例
来源:大淘宝技术 · BestBlogs 评分:91
大淘宝技术以拥有 50 多次提交的百亿补贴详情助手为例,讨论 Skill 怎样持续研发,而不只怎样写一份 SKILL.md。团队把架构、研发效能、运行优化与呈现方式视为同一条迭代链路。
本地 Skill 通过决策树负责信息收集、商品查询和结果呈现,日志搜索、截图分析等内部能力则经 xiaomi.py 桥接远程 Agent。按需加载减少无关上下文,稳定协议让远程能力可以独立升级,代价是新增网络链路、契约漂移和跨环境排障。
这篇实践提醒 Skill 作者先划清稳定层与高频变化层,再决定是否拆分;同时把结构化结果优先做成可检索的 HTML,而非把所有信息挤进聊天回复。桥接并非默认最佳架构,只有远程能力的迭代收益大于链路脆弱性时才成立。
Vol.278|我们对 AI 感到恐惧,是因为自己太像一个低效的 AI|嘉宾:孟庆延
来源:东腔西调 · BestBlogs 评分:90
社会学者孟庆延从知识生产与教育谈 AI 恐惧:让人不安的未必是 AI 越来越像人,而是学校与工作长期把人训练成追求标准答案和高效输出的低效率机器。
节目把具身性理解为长期阅读、实践、情绪与身体经验形成的个人判断。信息处理可以加速,但一个人如何把知识连成自己的网络、形成审美与学术品味,仍依赖漫长且无法压缩成要点清单的过程。
他的判断不是要拒绝效率,而是重新分配人的位置:AI 更擅长从 1 扩展到 1 万,人应珍惜提出新可能、面对真实的人与情境的过程。具身性也不是天然免疫自动化的护身符,关键仍是经验是否形成了可辨别、可负责的判断。
科技爱好者周刊(第 409 期):程序员的职业未来
来源:阮一峰的网络日志 · BestBlogs 评分:91
阮一峰把程序员职业放进软件工业化的逻辑中:企业持续追求效率、成本、可靠性和稳定性,编码 Agent 因而不会只是一轮估值周期中的临时工具。
文中转述的预测包括模型更快更便宜、管理层推动 Agent 使用、手工编码受限,以及代码质量检测更自动化。程序员的工作会更多转向帮助 AI、审查生成代码、测试变更与降低错误,而不是只以手写代码量定义价值。
这是一组面向未来的行业判断,并非确定时间表。结合前面的 Anthropic 与 Uber 案例,更实际的问题是:团队能否把需求澄清、质量证明和风险判断做成新能力,而不是仅把旧产量指标施加到更快的工具上。
测量语音识别中的基准优化
来源:Hugging Face - Blog · BestBlogs 评分:91
Hugging Face 团队提出三种测试来量化 ASR 的「benchmaxxing」:模型可能学会公开基准的转录习惯,而非真正提升对新语音的通用识别能力。
研究评估 11 个开源 ASR 模型,发现部分高分系统在音频与参考文本冲突、词语被静音或两种拼写发音相同时,仍会复现基准答案。LibriSpeech 的遮蔽数字实验中,一些强模型仍在约 30%~40% 的样本里恢复已被移除的数字;新采集音频上的现象则减弱。
因此,选型不能只看单个公开数据集的词错误率,还要加入训练截止时间之后的 held-out 数据、参考错误测试和书写形式切换。论文给出的是识别基准拟合的方法,不意味着所有高分模型都在记答案。
补充阅读
靠这 10 个优化点,我们把 Multi-Agent 工作流成本降了 50%以上
来源:腾讯技术工程 · BestBlogs 评分:91
腾讯工程师用 AgentLens 度量 Multi-Agent 链路,并围绕「只让 AI 看到需要的上下文」等原则实施十项优化,预估全流程 token 成本下降 50%~65%。数字来自其具体工作流,方法更适合用同一任务的质量、返工与总成本复测。
王潜想要的具身大脑,数字世界根本给不了
来源:腾讯科技 · BestBlogs 评分:91
王潜主张具身智能需要平行于数字语料的「物理世界基础模型」,并把动作模态、端到端架构与工业化数据生产放在一起讨论。工厂产线案例支持其路线判断,但不同机器人、工位与 ROI 口径仍需分别核验。
宇树暴涨 629% 那天,GEN 1.5 发布!机器人的 ChatGPT 前夜终于来了?
来源:十字路口Crossing · BestBlogs 评分:90
Generalist 发布 GEN-1.5,展示通过一次人类演示在陌生任务上学习的 Physical Prompting;文章同时记录宇树上市首日股价大涨 629%。技术演示与资本市场表现是两类信号,不能互相证明机器人通用能力已经成熟。
将 Claude Mythos 5 的网络安全能力带给更多防御者 | Anthropic 的 Claude
来源:Claude Blog · BestBlogs 评分:87
Anthropic 计划通过合作伙伴集成、Claude Security 扫描、3500 万美元开源安全基金和扩展验证计划,让更多防御者使用 Claude Mythos 5。覆盖面扩大值得关注,真实防御效果仍取决于工具权限、环境数据与持续评估。
NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长程自主智能体的前沿级通用架构
来源:NVIDIA Technical Blog · BestBlogs 评分:86
NVIDIA 报告其 AVO 架构在 ARC-AGI-3 获得 100.00 RHAE,强调系统设计也能迁移到长程交互式推理。满分对应特定任务与评测设置,不能直接外推为开放环境中的通用自主性。
唐杰|关于缩放定律的思考:参数不是唯一旋钮
来源:青稞AI · BestBlogs 评分:91
唐杰把缩放定律从参数量扩展到数据、算力、后训练和部署条件,并以 GLM-5.3 实验讨论后训练的能力增量。它提供的是理解模型进步的多旋钮框架,具体实验效果仍应结合任务和训练口径阅读。
端到端论文生成系统:假结论检出率 92%,自动跑实验、画图、直出论文初稿
来源:机器之心 · BestBlogs 评分:90
Spark-to-Paper 用 13 项 Skills 串起实验、图表和论文初稿,报道的假结论检出率为 92%、引文准确率为 99.5%。这些指标说明科研 Agent 正从文本续写转向可执行流程,也需要关注测试集、人工复核和失败结论的处理方式。
AINews Poolside 获得 12 B 逆向执行雇佣至 NVIDIA;创始人持有 1 B,员工获得 6 B,Infraco 扩展至 7 GW 新云
来源:Latent.Space · BestBlogs 评分:86
Latent.Space 汇总 Poolside 与 NVIDIA 的 12 B 逆向执行雇佣安排,其中包括 6 B 许可与 1 B 投资,并把变化放进算力约束和新基础设施计划中。这是信息密集的行业综述,金额结构与后续执行应继续对照交易参与方披露。
探索 AI 与游戏研究的新前沿
来源:Google DeepMind News · BestBlogs 评分:91
Google DeepMind 回顾 DQN、AlphaGo 到 SIMA 的游戏研究路径,并宣布与 Fenris Creations 合作,在 EVE Online 的持久世界中研究持续学习、长程规划和复杂多智能体动态。合作开启研究场景,不等于这些开放问题已经解决。
这届机器人没有新故事,只有真问题
来源:腾讯科技 · BestBlogs 评分:85
腾讯科技从 2026 世界机器人大会现场与企业访谈梳理三项现实约束:应用场景、硬件成本与产业协同。若要判断机器人是否跨过演示阶段,这些落地条件比又一段动作视频更能改变结论。
延伸探索
想继续沿工程落地阅读,可以从智能体的 60 种模式、上下文前沿、MCP 与自定义 API、Agent 记忆反馈和百炼成本复盘展开;再把 Python + Neo4j 知识图谱、RAG 行级分块、128k 上下文「迷失在中间」与本地 AI、云 GPU、API 成本比较放进同一张系统设计图。Spring AI 2.0.1、Bedrock 跨区域推理、DeepSeek-V4-Pro 服务优化与 H20 调优则更接近基础设施层。
另一组内容关注能力如何被检验和使用:多语言海报评分、Tsubaki.3 图像编辑压力测试、Qwen-UI-Agent、AI Bug 修复员工与端到端 Prompt 实践提供产品侧入口;设计师成长、Rick Rubin 的创造力、人的判断在软件工厂中的位置,以及工作观念的历史,则把问题带回审美、责任和人的经验。机器人、金融聚类、财务 SLM 与游戏研究可作为行业场景对照。
今日阅读路径
如果只有十五分钟,先读 Anthropic 的 SDLC 手册,建立从工件、反馈到治理的全局框架;再看 DeepSeek 的多模态 API,确认今天可直接测试的接口与成本;最后读 Hassan 的设计品味方法,把抽象偏好转成一份能马上修改的 Agent 指令。
接着可以用 Uber 案例检查组织基础设施,再用 DeepWiki 和 ASR 研究提醒自己:规模与高分都需要拆回生成机制和评测条件。思考一下:你的团队当前最慢的是计划、验证还是部署?你会把哪些反复出现的界面判断写成可复用上下文?欢迎打开原文继续阅读,并留言评论你的实践与疑问。
👉 近期早报
• BestBlogs 早报 · 2026-08-21
• BestBlogs 早报 · 2026-08-20
• BestBlogs 早报 · 2026-08-19
• BestBlogs.dev 第 109 期:程序员的职业未来
• BestBlogs.dev 第 108 期:智能的执行层
• BestBlogs.dev 第 107 期:个人 AGI
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。