Claude Tag 如何成为 Anthropic CI/CD 故障的第一响应者

ginobefun · @hongming731 · X·2026-08-19 07:46·15小时前
AI 导读

Anthropic 的 Claude Tag 担任其 CI/CD 故障第一响应者,事故开启后中位 14 分钟发布首份有证据分析,最快 4 分钟指出根因。系统由记忆、独立服务账户访问、日程和 Markdown Skill 指令四部分构成,告警升级后编排 Agent 启动多个执行 Agent 并行调查并汇总态势报告。

ginobefun@hongming731
35AI 编辑部评分,满分 100

Claude Tag 如何成为 Anthropic CI/CD 故障的第一响应者

2026-08-19 07:46· 15小时前
AI 导读

Anthropic 的 Claude Tag 担任其 CI/CD 故障第一响应者,事故开启后中位 14 分钟发布首份有证据分析,最快 4 分钟指出根因。系统由记忆、独立服务账户访问、日程和 Markdown Skill 指令四部分构成,告警升级后编排 Agent 启动多个执行 Agent 并行调查并汇总态势报告。

https://x.com/i/article/2089860023287734272

BestBlogs 早报 · 08-19|Claude Tag 进入值班,上下文实验检验 Agent 成本,AI Coding 四阶段重划分工

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

一个值班 Agent 到底要具备什么,才能从回答问题走到处理真实事故?Anthropic 的答案不是再写一段更长的提示词,而是把记忆、权限、工具、调查流程和人类审批一起接进 CI/CD 现场。今天第一条精讲从这份一手复盘出发,看 Claude Tag 如何形成首份态势报告,又在哪些环节仍然依赖工程师。

另外两条精讲分别处理成本与分工。腾讯云开发者用多组实验检验 CodeGraph 和 RTK,发现单次输出缩短不等于整条工作流更省;京东技术则用四阶段框架讨论 AI Coding 从补全走向流程编排后,人应如何保留验证、取舍和责任。

昨天的早报谈到语义层如何为 Agent 提供可追溯的业务上下文。今天更靠近运行现场:上下文进入哪个角色、保留多久、能否回到原始证据,会直接改变成本和可靠性。

★ 精讲一:Claude Tag 如何成为 Anthropic CI/CD 故障的第一响应者

来源:Claude Blog · BestBlogs 评分:93

Anthropic 工程师从一个晚上十点的告警讲起:新服务约有 44 个测试突然不再运行。Claude 查到测试消失与当天启用的 feature flag 有关,也判断回滚是安全的。工程师让同事回滚后,Claude 在 3 分钟后再次确认跳过规则已移除,错误率回到基线。

这不是一次临时调用。过去几个月,Claude Tag 一直担任 Anthropic CI/CD 故障的第一响应者。团队给出的口径是,它在事故开启后中位 14 分钟发布首份有证据的分析;最快的案例在 4 分钟内指出根因。近期那些形成了态势报告的事故,第一份报告都由 Claude 撰写。

系统的基础可以拆成四部分。记忆让 Claude 保留频道里的事故进展;连接与访问让独立服务账户读取监控、日志、代码仓库和集群;日程让它按约定时间复查和交接;指令则以 Markdown Skill 的形式进入 GitHub,和代码一样接受版本管理。

告警升级后,编排 Agent 会启动多个执行 Agent,分别追查监控、日志、PagerDuty、GitHub、Kubernetes 和事故频道里的线索,再汇总成态势报告。每类错误有对应调查 Skill,已经解决的事故写入 lessons.md。当同一种模式反复出现,团队再把经验提升为正式调查流程。

调查之外,Claude 还承担验证与沟通。修复完成后,它使用相同的连接器检查错误率和发布状态,把事后记录补进 lessons.md。团队另设 ci-weather Agent,汇总多个事故频道、构建指标、合并队列和发布延迟,用公开报告回答当前 CI 是否健康、合并是否需要暂停。这里的难点不只在数据连接,也在报告是否符合团队真实的沟通习惯。

这里有一个很重要的分层:告警判断保留确定性规则,智能体负责在规则触发后并行调查。修复也没有完全交给 Claude。它更常见的输出是缓解建议或 PR,由值班人员审查、合并和部署。文章明确承认,Claude 第一次并不总能判断正确,人类直觉仍会改变调查方向。

Anthropic 同时开源了 oncall-kit,用团队自己的事故历史生成分诊流程,并从只读 Claude 开始。对准备尝试的团队,合理顺序是先限制权限、要求判断附带证据,再观察首报质量、误报、平均修复时间和人工介入成本。

★ 精讲二:Agent 的命门是上下文:关键不在少给,而在给对

来源:腾讯云开发者 · BestBlogs 评分:90

作者给一套多 Agent 开发流程接入两个看似合理的优化。CodeGraph 像代码地图,先圈出调用者和影响范围;RTK 像终端摘要器,压缩搜索、测试和日志。结果,一个涉及十几个文件的中等需求消耗约 2480 万 Token,成本约 202 元,比改造前还多 40 多元。

这笔账单促使作者把省 Token 分成三层:工具的局部输出是否变短,Agent 的搜索与测试路径是否缩短,以及从开始到结束的整体成本是否下降。这个拆法很有用,因为很多优化只报告第一层,却把后续补偿性搜索、会话历史和角色交接留在统计之外。

CodeGraph 的结果高度依赖任务形态。问题围绕明确符号时,两条结构查询可以替代多轮文本搜索,总 Token 下降 80.0%。到了完整调用链任务,图查询只负责导航,业务分支和 fallback 语义仍要回源码确认,总 Token 反而上升 95.8%。需要给出精确 path:line 时,Agent 运行图查询后还要逐点读取源码,总 Token 上升 152.9%。

RTK 也给出类似的反直觉结果。在 12 个真实编码任务、24 组对照中,模型看到的终端字符减少 40.19%,原始总 Token 却增加 4.23%。压缩后的输出可能漏掉定位问题所需的线索,Agent 随后多搜文件、多改代码、多跑测试。作者又对一个坏案例重复实验,RTK 组平均只高 1.24%,并没有坐实它必然增费。

改造方向因此从少给内容转向安排信息流。完整方案、源码证据和测试结果进入 Artifact,角色交接只发送短 Handoff 与材料路径。CodeGraph 只在前段建立结构,后续角色复用定位结果;RTK 按场景启用,结果异常为空、出现截断或缺少预期线索时立即回到原生命令。状态迁移、路由、去重和固定汇总交给程序。

作者还为搜索设置熔断:第一次压缩搜索没有出现预期线索,就用原生命令复核;若后面还需要第二次宽泛搜索,后续搜索和文件读取全部切回原始输出。最终代码审查与验收也始终保留完整信息。这个设计承认压缩会损失细节,因此把可回退性本身当成优化的一部分。

综合改造后,GLM 流程平均每步 Token 从约 10.68 万降到 6.70 万,Claude 组总 Token 下降 23.34%。但交接、工具策略和调度方式同时发生变化,不能把降幅归功于单一组件。更可迁移的结论是:先问信息何时进入窗口、交给谁判断、保留多久,再用端到端结果决定工具是否默认开启。

★ 精讲三:AI Coding 的共生与替代:一场分阶段的演进

来源:京东技术 · BestBlogs 评分:90

京东技术作者把 AI Coding 的演进分成工具、副驾、协作者和共生体四个阶段。这不是行业统一成熟度模型,而是一套观察分工变化的框架:AI 每接管一层可形式化劳动,人机协作的界面就向判断、约束和责任上移一层。

工具阶段处理补全、API 用法和样板代码,人仍逐行决定要写什么。副驾阶段可以实现边界清晰的函数、组件或修复,人从实现者转向任务描述者与审阅者。协作者阶段开始读文件、调用工具并执行多步流程,人则负责设计流程、设置关口和处理例外。共生体仍偏向展望,关注跨任务记忆、规则沉淀和多流程协同。

贯穿四阶段的一把尺是验证成本。如果检查 AI 产出的成本低于自己完成,协作划算;任务边界含糊、错误代价又高时,验证可能比执行更贵。这也解释了为什么补全工具容易建立信任,而跨系统设计不能只看生成速度。

文章用团队工作流展示这一判断。AI 可以生成项目文档和调用链,把 PRD 转成技术设计,拆分任务、生成代码并做提交前验证。写公共组件前先搜索已有实现,涉及资金的方案必须经过专门审查,最终推送则在展示完整变更后等待人的明确确认。

更进一步的需求分治 Agent 会读取仓库路由表和架构图,判断一个需求影响哪些系统,再为各系统生成技术设计。低置信的系统归属、多个合理方案和知识库里的信息缺口仍交回给人。若最早的归属判断错了,后续步骤可能一路自洽却整体走偏,因此基础资料的准确性直接限制这套方法的可靠程度。

进入共生体阶段后,作者特别区分两类记忆。某字段来自哪个系统这类稳定事实,可以跨需求沉淀;某次选择双写方案这类依赖背景的取舍,不能自动复用到下一次需求。组织记忆的价值不只是越积越多,还在于知道哪些内容能够验证,哪些决定必须重新审视。否则,历史经验也可能成为被自动继承的错误前提。

作者最后归纳出五条原则:用验证成本决定分工,给目标时也给红线,按置信度与阻断程度安排确认,审查流畅却无依据的输出,把稳定事实与失败经验沉淀为知识。事实型结论可以跨需求复用,情境化方案不能自动照搬。至于岗位收缩的幅度和速度,文章没有就业数据;对读者更有帮助的,是先划清哪些结果能被规则验证,哪些决定必须由具体的人承担。

速览

通过智能体源代码审查保持对对抗性 AI 的领先

来源:Google Cloud Blog · BestBlogs 评分:90

Google Cloud 介绍一套智能体漏洞发现框架,用多个 Agent 扩展大规模源代码审查,寻找关键漏洞。

系统先用代码库、资产清单、架构文档和威胁情报建立环境,再让专门 Agent 处理认证、授权、路由等领域,汇总成威胁模型后继续寻找入口点与潜在利用路径。

这类框架适合承担重复检索和路径探索,把安全工程师的时间留给可利用性判断与修复优先级。文章没有提供统一的漏洞数量或提升比例,不能据此推断人工审计已经可以被替代。

Claude Code 推出 /design 技能,用于 UI 画板

来源:ClaudeDevs(@ClaudeDevs) · BestBlogs 评分:91

Claude Code 在研究预览中加入 /design 技能,把用于 UI 设计与实现的画板工作流带进 CLI 和桌面环境。

这条短讯确认了技能名称、研究预览状态和两个入口,但没有交代完整功能范围、开放对象或正式发布日期。

设计探索和代码实现靠近同一工作区,可能减少设计与前端之间的来回翻译;真实效率、稳定性和协作边界还需要在项目中观察。

LangSmith 推出可调优的自动评估器

来源:LangChain Blog · BestBlogs 评分:90

LangSmith 推出 Tuned Evaluators,这是一种托管的低成本 AI 评判器,用来评分生产环境 Agent 轨迹中的感知错误。

它把真实用户轨迹作为输入,尝试从大量交互里持续发现不良行为,再把反馈变成可监控、可迭代的质量信号。

评判器可以扩大检查范围,但团队仍需定义什么算错误、维护反馈样本,并抽查评判偏差。自动评估是质量闭环的一部分,不等同于把质量标准本身交给模型。

使用 Google Agent Development Kit 构建零信任 AI 智能体

来源:Google Developers Blog · BestBlogs 评分:91

Google Developers Blog 给出一套基于 Agent Development Kit 的零信任架构,用于防范提示注入和未经授权的状态变更。

方案以加密签名确认请求身份,以内核级隔离限制动态代码的网络与资源,再用确定性语义网关检查模型输入、工具调用和数据库写入是否符合规则。

当 Agent 能调用外部工具并写入真实状态,安全问题已经超出文本输出。每一步重新验证比默认信任内部 Agent 更稳妥,但这套设计降低的是风险,并不意味着提示注入已经被彻底解决。

对话前 DeepMind 曹原:AI for Science 爆发,一个新时代到来了

来源:硅谷101 · BestBlogs 评分:89

前 DeepMind 研究科学家曹原在访谈中讨论 AI for Science 的进展、挑战和未来路径,强调验证瓶颈与模型创新性。

他的判断是,科学任务不能停在生成假设。模型能否提出新的方向,以及结果能否经实验或严格计算确认,决定了系统是否真正进入科研闭环。

这是一位研究者的具名观点,不是学界共识。它提供的判断框架,是区分会给答案的模型与能参与知识创造的系统,并重新看待人在验证和选择问题上的角色。

对比与生成:抖音 SOTA 多模态表征模型 DME

来源:字节跳动技术团队 · BestBlogs 评分:91

抖音搜索团队发布多模态表征模型 DME,用两阶段训练连接大规模对比学习和语义充分性学习。

模型引入隐式推理与交叉条件重建。团队报告它在 MMEB-v2 的 2B 和 9B 两种规模上达到同规模领先结果,部署只增加亚毫秒级延迟,并在抖音线上观察到 LT 收益 0.1%。

这条进展的价值在于同时报告训练机制、部署代价和业务指标。数字来自团队自己的基准与线上实验,0.1% 不应外推到其他搜索系统。

主要前沿模型提供商采用水印技术以符合欧盟法规

来源:InfoQ · BestBlogs 评分:88

主要前沿模型提供商开始部署统计水印,以符合欧盟 AI 法案 Article 50 对生成内容透明度的要求。

与此同时,开源移除工具和相关研究指出,水印在编辑、压缩或主动规避后可能失效,鲁棒性仍是现实限制。

法规正在推动内容标识成为基础设施,但采用水印不等于所有生成内容都能稳定识别。治理效果取决于检测工具能否在常见修改后继续工作。

补充阅读

任何错误只犯一次:TencentDB Agent Memory 的团队记忆实践

来源:腾讯技术工程 · BestBlogs 评分:92

TencentDB Agent Memory 把团队经验拆成 Chat Memory、Wiki、CodeGraph 和 Skill 四类资产,再按任务相关性装配上下文。在团队的 SWE-bench 相关任务中,完成率从 60% 提升到 80%,这一结果属于其自身任务口径。

10 不是 100

来源:Towards Data Science · BestBlogs 评分:91

现有 RAG 幻觉检测器可能漏掉 10 与 100 这类数字错误。文章提出无需训练的 groundlens,用 token 级依据校验寻找不匹配,让数字是否忠于来源成为独立检查对象。

它提醒读者,语义相近不代表事实一致,数字、单位和比较对象需要更细粒度的依据检查。

从晶圆厂到 Token:市场现状

来源:InfoQ · BestBlogs 评分:90

InfoQ 从台积电晶圆产能、数据中心网络和推理设施梳理 Token 成本链。模型价格背后仍受芯片供给、互连效率与长期数据中心投资约束。

模型调用成本因此不只是厂商定价问题,也成为判断供给与基础设施周期的入口。

前沿模型成本和开放权重模型的流行正在推动模型路由的需求

来源:Latent.Space · BestBlogs 评分:90

前沿模型成本上升与开放权重模型增多正在推动企业采用模型路由。文章以 Glean 为案例,讨论如何让不同任务在质量、延迟和价格之间选择模型。

您的智能体实际上需要多少内存?

来源:Hugging Face - Blog · BestBlogs 评分:90

Hugging Face 的结论是记忆剂量应匹配模型能力:更强模型可以利用完整指南集,较弱模型反而更适合精选检索。记忆量增加并不自动带来更好的任务表现。

B 站 indexTTS 2.5 开源:五国语言零样本配音,推理提速 2.28 倍

来源:魔搭ModelScope社区 · BestBlogs 评分:89

B 站 IndexTTS 2.5 已开源,支持中、英、日、西、阿五种语言的零样本配音。团队报告推理提速 2.28 倍,跨语言情感迁移 MOS 达到 4.18/5。

对配音应用而言,多语覆盖、速度和情感保持需要一起看,单一速度数字不足以代表最终体验。

Agent 基建不是设计出来的,是被 Kimi K3 和一堆应用公司卷出来的

来源:Founder Park · BestBlogs 评分:88

TiDB 团队从 Kimi K3 与应用公司的需求反推 Agent 基建,尝试以统一存储层承接数据库、内存和文件状态,为持久化与弹性执行提供底座。

关注点从单次推理转向长任务里的状态保存、恢复与扩缩容,这也是数据库团队切入 Agent 工程的理由。

Netflix 开源用于因果推断的 Agentic 工作流

来源:InfoQ · BestBlogs 评分:89

Netflix 开源一套因果推断 Agentic 工作流,通过带人工监督的 actor-critic 循环让 Agent 提出分析、接受批评并迭代结果。

人工监督仍在循环中,说明因果推断场景更重视可审查的分析过程,而不只是自动生成结论。

中国大模型的奥德修斯时刻

来源:晚点LatePost · BestBlogs 评分:90

晚点从能力、成本、开源份额、资本和架构变化观察中国大模型竞争,认为开源扩张与算力效率正在改变全球格局。这是产业报道的综合判断,不是单一指标能够证明的结论。

黄仁勋、奥特曼、孙正义"抱团 20 年"

来源:腾讯科技 · BestBlogs 评分:89

腾讯科技梳理英伟达、OpenAI 与软银在美国大型数据中心上的长期合作,重点关注 AI 算力需求带来的巨额表外承诺与供应链风险。

这篇产业分析把合作愿景与资本承诺放在一起看,帮助读者理解算力扩张对资产负担和供应链的长期影响。

延伸探索

如果你在搭建 Agent 工程链,可以继续看 Claude Science、AgentCore Payments、Cloudflare WriteGuard、Stacked Pull Requests、vLLM、MemoraX Code 和 DeepSeek Harness 桌面应用。这组内容分别覆盖垂直工作台、支付与预算、MCP 写权限、代码审查协作、推理扩展和长期记忆,适合按当前系统的缺口选择。

另一组围绕模型与创作基础设施:Krea 的大规模训练服务、NVIDIA 低精度优化、多模态 API 成本、Git 托管,以及实时视频、自然语言游戏工具、音乐交互和 3D 图像编辑。政策侧还有白宫 AI 战略与国家安全监督,方法侧则包括 RAG 过滤、LLM 分类和 boosting 调参。铁路扫描与 Vercel 图片迁移属于边缘工程探索,不必硬套进 AI 主题。

今日阅读路径

如果团队正准备把智能体接进生产流程,可以把前三篇当作一张连续的检查表:先确认权限边界和人工审批,再记录完整任务的成本、失败路径与恢复过程,最后判断哪些步骤能由规则验证、哪些决定仍须由人负责。只有当证据能够回源、上下文压缩可以回退、工具副作用可以阻断时,自动化才真正具备可运营性。反过来,如果系统只展示生成速度,却没有事故记录、端到端账单和明确责任人,再流畅的输出也不足以证明流程已经可靠。上线后的观察也应覆盖误报、返工、人工介入和恢复时间,而不只看调用量。

时间有限时,可以按手头问题选三篇。负责线上系统,先读 Claude Tag,重点看服务账户、调查 Skill 与人工授权如何配合;正在优化 Agent 成本,读上下文工程实验,检查局部压缩是否真的减少端到端步骤;负责团队流程或个人能力规划,再读 AI Coding 四阶段,用验证成本和责任边界重新划分工作。

读完后可以继续追问:你的 Agent 在哪一步拥有真实副作用,它的判断能否回到原始证据?你正在做的上下文优化,衡量的是单次输出,还是完整任务的质量与成本?欢迎沿着这条阅读顺序打开原文,也欢迎在评论区分享你的实际做法和反例。

👉 近期早报

• BestBlogs 早报 · 2026-08-18

• BestBlogs 早报 · 2026-08-17

• BestBlogs 早报 · 2026-08-16

• BestBlogs.dev 第 108 期:智能的执行层

• BestBlogs.dev 第 107 期:个人 AGI

• BestBlogs.dev 第 106 期:1% 法则

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

来源:ginobefun· x.com