Claude Tag 如何担任 Anthropic CI/CD 故障的一线响应者

Claude:Blog(网页)·2026-08-19 03:26·3分钟前
AI 导读

Anthropic 的 CI 工程师用 Claude Tag 构建了值班智能体,作为 CI/CD 故障的一线响应者。Claude 在事故发生后中位 14 分钟发布首份基于证据的分析,最快案例中 3 分钟内验证修复并确认错误率恢复基线。该方案通过 Slack 频道、Datadog 或 Grafana 工具访问及 GitHub 技能文件实现,Anthropic 已发布通用设置套件供其他团队部署。

Claude:Blog(网页)
精选
63AI 编辑部评分,满分 100

Claude Tag 如何担任 Anthropic CI/CD 故障的一线响应者

2026-08-19 03:26· 3分钟前
AI 导读

Anthropic 的 CI 工程师用 Claude Tag 构建了值班智能体,作为 CI/CD 故障的一线响应者。Claude 在事故发生后中位 14 分钟发布首份基于证据的分析,最快案例中 3 分钟内验证修复并确认错误率恢复基线。该方案通过 Slack 频道、Datadog 或 Grafana 工具访问及 GitHub 技能文件实现,Anthropic 已发布通用设置套件供其他团队部署。

推荐理由

文章把 AI on-call 从概念落成可复制的工程架构,用 markdown 技能文件和 lessons.md 实现自我迭代,并给出 14 分钟首报、最快 4 分钟定位等实测数据。

正文 · AI 翻译

我们持续集成团队的一位工程师,将带大家了解他构建的、为 Anthropic 的 CI 事件响应提供支持的智能体。

 Category Enterprise AI Agents Claude Code    
 Product Claude Tag    
 Date August 18, 2026  
 Reading time 5 min   
 Share Copy linkhttps://claude.com/blog/ai-ci-cd-on-call  
 Author(s) Sachin Malhotra     

使用我们的设置套件,搭建属于你自己的 Claude 值班助手。

几周前,我正值班,同事在晚上 10 点通过 Slack 给我发了条消息:一个新服务上大约 44 个测试没有触发。

过去,我会放下手头的事,抱着笔记本电脑坐下,疲惫地叹口气,然后开始长达一小时的排查修复流程。但现在,我的工作流程完全不同了:我拉上 @Claude,问它看到了什么。

这次,Claude 发现测试是在当天早上某个功能开关被打开时消失的,并且回滚该开关是安全的。我请同事回滚了开关。3 分钟后,Claude 在 Slack 上 ping 我,确认跳过规则确实已被移除,错误率也恢复到了基线水平。

过去几个月里,Claude Tag 一直是 Anthropic 内部 CI/CD 故障的值班第一响应者。这不仅改善了我们的社交生活,也让每一起 CI 事件都有了即时响应的第一人:在最近每一起有事件报告的故障中,Claude 都撰写了第一份情况报告,通常在 15 分钟内就发布其首次分析。

在本文中,我们将介绍我们构建了什么以及它是如何工作的,这样你就可以自己动手搭建,不再害怕轮到你值班。

我们的 Claude 值班设置

在深入事件响应流程的每个阶段之前,我先在这里做个总体概述,让你在了解细节前先有个整体概念。

值班智能体需要记忆,以便记住已完成的工作;需要连接和访问权限,以便进行调查、理解和采取行动;需要排班表,以便知道何时重新投入工作;还需要指令,以便知道该做什么。

Claude Tag 是我们值班智能体的核心支柱。Claude Tag 在我们的值班 Slack 频道中保存记忆,并提供界面,以便在事件期间提供逐轮指令。Claude 还会实时响应值班频道及其他频道中的事件。例行任务的调度,也就是 Claude 定期执行的操作,也在这个频道上通过自然语言提示词完成,例如“每周一上午 9:00(美东时间)运行 CI 交接”。

Claude Tag 拥有自己的服务账号,并能访问 Anthropic CI 工程师所需的工具,如 Datadog 或 Grafana。这是管理员为频道一次性配置好的(具体方法见这里)。

除了值班频道之外,我们还让 Claude 关注其他同样将 Claude Tag 设为成员的相关频道,这样它就能获取更多上下文,比如服务告警、配置变更或 PR 更新。

常驻指令以技能的形式存放在 markdown 文件中,并提交到 GitHub 仓库里。这样多个团队成员可以共同迭代这些指令,我们也能像管理代码一样管理变更。其中还包含路由指令、策略等关键信息,以及作为自我改进循环一部分的经验教训日志。

这套配置只花了我们几小时,而不是几天。我们在 GitHub 上创建了一个通用的值班配置工具包,可以帮助你快速上手搭建类似的智能体。它能将你们团队自身的故障历史转化为分诊手册,并在你的故障频道中留下一个只读的 Claude,负责诊断、升级和处理学习。你可以在大约十分钟内观看它针对一个虚构团队的历史记录运行。

用 TL;DR 的方式总结一下步骤:

你需要 Claude Team 或 Claude Enterprise 套餐。组织所有者需要通过 Claude Tag 将 Claude 添加到值班 Slack 频道中。组织所有者还需要帮助将值班 Slack 频道中的 Claude 连接到相应的连接器、GitHub 仓库,并设置好 Claude Code Remote。将 Claude 添加到你的故障频道,并指示它监控故障并立即进行分诊。

现在,让我们深入看看在故障处理的每个阶段,这种转变具体是什么样的。

检测

Claude 不仅改变了你响应故障的方式,更改变了你最初发现故障的方式。此前,故障检测存在两大主要失效模式。

人类很难总是有先见之明,设定出完美的规则和完美的阈值。尤其是在数据不足、无法分析流量模式的时候,这就更加困难了。

为了解决这个问题,我们让 Claude 在新服务上线后的头几天分析数据和收到的告警,以便建议补充规则,并对任何过宽或过窄的规则进行微调。

事件检测的第二个主要失败模式是告警疲劳:逐一检查和核实每条触发的告警非常繁琐。然而,Claude 不会像人类那样感到疲劳。

Claude 会监控每个告警频道中的每一条相关告警,并对照根目录下 oncall.md 文件中的标准进行判断,以确定某个问题是可以等到早上处理,还是需要立即呼叫值班人员。例如,在通过数据分析完成调优后,文件中的一条规则可能是:“如果错误率超过 2% 且持续时间超过 5 分钟,并且不属于已知的部署窗口,则呼叫值班人员,否则将其写入 lessons.md。”

Claude 值班告警流程还有另外两种触发方式:

CI 团队成员可以在值班频道中报告问题,就像开头示例中 44 个测试缺失的情况那样;或者公司内任何人可以通过内部页面开启一个事件。如果该事件被标记为 CI 基础设施事件,则会为该事件配置一个 Slack 频道,我们的值班 Claude 会接手处理。

这里的关键要点是:告警流程是确定性的,而值班升级流程则同时包含确定性和智能体两种路径。

分类排查

让 Claude 过滤告警噪音是一回事,但真正的成本节省来自调查环节。Claude 会在事件开启后中位时间 14 分钟内发布其首份基于证据的分析,而在最快的情况下,能在首份报告中于 4 分钟内指出根本原因。

当告警升级为事件时,Claude 通常已经准备好出现在我们的 Slack 频道中,并给出一个基于证据、可供我们审查的假设。Claude Tag 会启动一个动态工作流,其中包含一个编排智能体,该智能体会启动执行子智能体来调查每个依赖项和数据源。

对我们来说,这些数据源包括 Grafana、我们的日志存储、PagerDuty、GitHub、Kubernetes 和 Slack 事件频道——全部通过 MCP Connectors 连接起来。Claude 可以并行追踪多条线索,有助于缩短 MTTR(平均解决时间)。

执行智能体将调查结果反馈给编排智能体,后者将信息整合成一份条理清晰的态势报告(SITREP)并呈现出来。

编排智能体和执行智能体并非盲目搜索。它们由一项调查技能引导,该技能针对每类缺陷附有更详细的参考 Markdown 文件。

例如,一份针对影子分歧(shadow divergence)缺陷的 617 行调查技能文件,编码了我在典型调查过程中采取的每一个步骤。我是在某次事件处理期间,通过和 Claude 逐步排查问题构建出这份文件的,然后让它根据那次经验创建了该文件。

Lessons.md 也指导着 Claude 的故障排查。这份 Markdown 文件是我们解决过的每一起事件的持续日志:发生了什么、根本原因、修复方法,以及值得记住的坑。Claude 会自动向其中追加内容。每次新的调查都会从阅读这份文件开始,因此 Claude 的第一个假设总是从最近发生过的事情出发。

如果同样的模式反复出现足够多次,我们就会将其提升到调查技能本身中。我最喜欢的一条记录是 Claude 写关于我的。我当时在查看指标之前先根据配置文件做了假设,现在 lessons.md 文件里写着:“先查数据,再提理论。配置告诉你可能出什么问题;指标告诉你实际出了什么问题。”

即使有了这些工具和上下文,Claude 也并非总能一次就做对。人类的直觉和经验仍然重要。Claude Tag 让团队能够以多人协作模式排查事件。我们中的任何一方都可以实时引导调查方向或添加一个假设,共同协作。

问题解决

如果 Claude 能够升级处理并排查告警,那它也能修复这些问题吗?这个问题的答案会因团队而异,但下面是我们团队的做法。

我们团队内部的大多数部署都在功能开关(feature flag)后面进行。我在 Claude Code 中创建了一个独立的智能体,拥有我的权限,能够在每个功能开关后面进行渐进式部署。

我们发布流程的第一阶段通常涉及 Claude 管理金丝雀(canary)流量、监控问题,并自动调高或调低某个功能开关的流量比例。这本身完全可以单独写一篇文章,所以我在这里就不展开细说了。

其他 Claude Tag 能帮助我的团队解决的路径包括:

告知我们是否需要排空或隔离 Kubernetes 集群的某些部分;给出如何扩容部分基础设施以应对需求激增的指令(这种情况很少见,但当 Claude 给出我们具体可执行的缓解措施时非常有帮助);以及最频繁出现的——以 PR 形式给出的修复方案,值班人员可以审查、合并,然后部署以快速解决问题。

验证、沟通与交接

Claude 使用与调查阶段相同的许多 MCP Connectors 和工具来验证修复是否按预期生效。作为 oncall.md 中常设指令的一部分,它会将事后复盘写入 lessons.md,并为交接生成 SITREP 报告。

为了在多个事件之间传达完整情况,我们创建了一个名为 ci-weather 的智能体。它汇总来自每个事件 Slack 频道、构建指标、合并队列统计和部署延迟的信息,然后将新闻编辑室风格的报告发布到一个全公司任何人都可阅读的公共频道。现在,我们的工程师在判断是否应该暂缓合并,或试图回答“CI 出了什么问题?”时,可以直接参考该频道,而无需再联系我们。

一个坦诚的说明:我们不得不多次迭代报告格式。Claude 可以一次性生成一个生成状态报告的技能,但让它真正可读的是团队自身的偏好。这是人与人之间的沟通,不是管道工程。

最后,虽然 Claude 会在 lessons.md 中为自己保留日志,我们也希望每周一为人类生成交接报告。Claude 会生成每日和每周摘要,以便团队成员之间能够无缝接续工作。

从监控事件到监控事件响应系统

我们的软件工程师每季度交付的代码量平均是 2021 至 2025 年期间的 8 倍。虽然我们保持了高质量标准(每个 PR 都有明确的人类负责人,每项变更都需要批准才能合并,每项变更都经过同一套 CI 门禁),但要跟上智能体编程的步伐,唯一的方式就是智能体化的 CI。

Claude 已经接手了我工作中那些繁琐的部分——下班后的突发状况和事故通报,让我得以专注于真正能提升系统可靠性的中长期架构变革。

我们这套方案最棒的地方在于,它并不显得零散。我们的值班流程都在 Slack 里,而现在 Claude 也加入了频道。

如何开始:

你需要 Claude Team 或 Claude Enterprise 套餐。组织所有者需要通过 Claude Tag 将 Claude 添加到值班 Slack 频道中。组织所有者还需要帮助将值班 Slack 频道中的 Claude 连接到相应的连接器、GitHub 仓库,并设置 Claude Code Remote。将 Claude 添加到你的事故频道,并指示它监控事故并立即进行分诊。

使用我们的设置工具包,搭建你自己的 Claude 值班系统。

本文由 Anthropic 技术成员 Sachin Malhotra 撰写。

相关文章

Claude Science 产品指南

Claude Science 产品指南Claude Science 产品指南

Claude Science 产品指南Claude Science 产品指南

ABC Legal 如何借助 Claude Managed Agents 让每位员工都成为构建者

ABC Legal 如何借助 Claude Managed Agents 让每位员工都成为构建者ABC Legal 如何借助 Claude Managed Agents 让每位员工都成为构建者

ABC Legal 如何借助 Claude Managed Agents 让每位员工都成为构建者ABC Legal 如何借助 Claude Managed Agents 让每位员工都成为构建者

最大化你的 Claude Code 会话价值

Claude Code

最大化你的 Claude Code 会话价值最大化你的 Claude Code 会话价值

最大化你的 Claude Code 会话价值最大化你的 Claude Code 会话价值

守护前沿:JetBrains 如何评估和部署 Claude Fable 5

守护前沿:JetBrains 如何评估和部署 Claude Fable 5守护前沿:JetBrains 如何评估和部署 Claude Fable 5

守护前沿:JetBrains 如何评估和部署 Claude Fable 5守护前沿:JetBrains 如何评估和部署 Claude Fable 5

用 Claude 改变你组织的运作方式

Claude Tag

编码

来源:Claude:Blog(网页)· claude.com