Claude:Blog(网页)
精选
58AI 编辑部评分,满分 100

Anthropic 网络安全团队如何利用 Claude Code 构建威胁检测平台

2026-05-12 00:00· 83天前
跳到正文
精选理由

我一直好奇大模型公司自己怎么用 AI 做安全,这篇挖出了 Anthropic 内部 CLUE 平台的构建细节——从一天出原型到每周省下 234 人天,数据比很多 PR 稿扎实。

AI 摘要

Anthropic 检测平台工程团队技术负责人 Jackie Bow 运用 Claude Code 开发了 CLUE 威胁检测与响应平台。该平台通过自然语言界面连接内部系统,包含 CLUE Triage 自动初筛警报,整合上下文信息分配处置建议;以及 CLUE Investigate 支持分析师用自然语言查询日志,由 Claude 自动生成并执行查询,将数小时的人工分析缩短至几分钟。团队在一天内完成概念验证,一周内交付实现,显著提升了安全运营效率。

正文 · AI 翻译

杰克·鲍,Anthropic 检测平台工程团队的技术负责人,分享了她的团队如何利用 Claude Code 构建工具,实现告警分类自动化、加速调查流程,并彻底改变安全分析师的工作方式。

  • 分类
    Claude Code
  • 产品
    Claude Code
  • 日期
    2026年5月12日
  • 阅读时间
    5
    分钟
  • https://claude.com/blog/how-anthropic-uses-claude-cybersecurity

在杰克的整个职业生涯中,她一直梦想着能构建这样的工具:它们能够真正触及那些关键信息——不仅仅是日志和告警,还包括 Slack 对话、内部文档以及机构知识,这些信息能告诉你某个事件是真正的威胁还是虚惊一场——而无需人类承担手动梳理数据的重负。

当她加入 Anthropic 后,她终于有机会与 Claude 合作,将这些工具变为现实。杰克领导着 Anthropic 的检测平台工程团队,该团队专注于防御性网络安全:检测威胁并应对潜在入侵,而非主动寻找漏洞。他们的工作包括监控系统中的可疑活动、对安全告警进行分类,以及在异常事件演变为安全事故之前进行调查。

对于一家正在构建日益强大 AI 模型的公司而言,这项工作具有基础性意义。Anthropic 的《负责任扩展政策》将产品发布直接与安全承诺挂钩,这意味着鲍的团队在一定程度上决定了公司能够安全地发布哪些产品。

“我感觉这就像是安全工程师的黄金时代,”担任 Anthropic 检测平台工程团队技术负责人的鲍表示,“我终于可以构建那些我一直渴望拥有的工具了。”

问题:被数据和告警淹没

安全领导者对这种模式再熟悉不过了。

一条告警触发。分析师打开终端,开始熟悉的流程:在五六个不同的工具之间来回切换,每个工具都有自己独特的查询语言和思维模式。他们必须在多个平台上保持专业能力,同时不断在不同界面和查询语法之间进行上下文切换。

每一次调查都变成了一场数据考古,需要将散落在互不关联的系统中的碎片拼凑起来。对大多数团队来说,简单的调查就要耗费数小时,而复杂的调查则可能持续数天。

“一个人一天能处理的告警数量是有限的,超过这个限度,他们深入调查的细致程度就会开始下降,”Jackie 解释道。

她的团队决定改变这一现状。他们问自己:是什么在消耗我们的精力?哪些工作感觉重复?什么阻碍了我们去做有影响力的事情?

答案很明确。在分析师判断威胁是否真实之前,告警分类就可能耗费数小时。跨互不关联的系统进行手动关联拖慢了所有工作。而在不同查询语言和界面之间不断切换上下文,造成了认知负担,并且这种负担会随着一天的工作不断累积。

随着公司的发展,攻击面也在扩大,对安全团队的要求也随之增加。

“如果不借助像 Claude 这样的工具来增强能力,我们无法扩大规模以满足 Anthropic 的需求,”Jackie 说。

解决方案:Claude 证据查找系统(CLUE)

在几个月的时间里,Bow 的团队构建了 CLUE,这是一个检测与响应平台,它重新构想了安全团队调查威胁的方式。CLUE 并非在现有工具栈上增加另一个仪表盘,而是提供了一个由 Claude 驱动的自然语言界面,通过工具使用直接连接到 Anthropic 的内部系统。

使用 Claude Code 构建 CLUE 极大地缩短了传统的软件开发周期,使他们能够在处理日常工作的同时,还能构建这个系统。Bow 的团队在一天之内就运行了一个概念验证。设计文档、开发步骤和实现工作在一周内完成。

“我们构建的很多东西都是通过与 Claude Code 对话完成的,”Jackie 回忆道。“它既是设计伙伴,也是协作者。”

改变她看法的时刻,是她让 Claude Code 在 CLUE 界面中添加一个按钮的时候。她本以为会陷入 JavaScript 框架和 CSS 调试那种熟悉的苦战。而 Claude Code 立即实现了这个功能,并且做得比她本人还要好。

“那一刻我意识到,自己不再受限于技术能力了。只要我能想到的东西,我都能把它做出来。”她说道。

CLUE 分类

当告警信息涌入时,CLUE 分类会在人类分析师看到它们之前进行第一轮分类。Claude 会利用各类工具,从 Anthropic 的各个系统中(包括 Slack 消息、内部文档、代码仓库和数据仓库)为每条告警补充额外的上下文信息。它会分配处置结论:误报、真实告警、恶意行为或预期行为。每条告警都会收到一个置信度分数,以便分析师知道应该把注意力集中在哪里。

这个信息补充步骤解决了一个任何安全分析师都认识的问题:告警是以孤立信号的形式出现的。一次失败的登录尝试。一次异常的 API 调用。一次配置变更。如果没有上下文,这些事件就只是噪音。而有了上下文(用户是谁、他们当时在做什么、这是否符合其团队的行为模式),清晰的信号就会浮现出来。

“这些内部上下文正是缺失的关键一环,它确实能帮助告警在你的环境中得到上下文化的理解,”Jackie 解释道。

CLUE 调查

有了 CLUE,安全分析师现在可以使用自然语言查询所有安全关键日志。想知道“过去一天内该系统所有失败的登录尝试有哪些?”只需询问 CLUE,Claude 就会执行必要的 SQL 查询。

“Claude 在编写精确查询方面比人类强得多,”Jackie 说。该工具运行一个智能体循环:一个编排器向子智能体发出指令,这些子智能体并行执行查询、收集发现结果,并将结果综合成连贯的调查摘要。原本需要数小时手动关联分析的工作,现在只需三到四分钟就能完成。

数据也证实了这一点。在各项调查中,CLUE 每次会话平均进行 25 次工具调用和近 11 次查询——远超分析师能够合理手动执行的次数,并且精度更高。这些工具调用中的每一次,否则都需要打开一个单独的控制台或切换到不同的界面。

然而,真正的差异化因素在于内部上下文。CLUE 通过工具直接连接到 Anthropic 的内部系统,让 Claude 能够访问外部安全平台永远无法触及的机构知识。当警报触发时,Claude 可以查看 Slack,了解团队是否讨论过计划内维护。它可以查询数据仓库,理解基线行为。它还能检查代码仓库,了解某个服务的实际功能。

数据治理审查

团队用一个常见的数据治理场景演示了 CLUE 的能力:检查三名承包商在过去两个月内是否访问了任何不应访问的文档。

据 Bow 介绍,这类调查通常至少需要半天的人工操作,包括查询访问日志、交叉核对权限以及审查文档分类。而使用 CLUE 后,Claude 读取请求、制定计划,并生成冗长的查询语句来抽象化技术复杂性。调查在几分钟内即可完成,生成摘要和建议,并且每次查询的完整过程都透明可见。

衡量影响

团队在构建 CLUE 时,不仅想了解它是否感觉更快,更想确认能否量化其成果。

误报减少:在 CLUE 分类功能上线前,大约每三个警报中就有一个是误报。现在这一比例已降至 7%,意味着分析师可以将时间花在真正重要的信号上。*

覆盖范围更广:或许比速度更重要的是团队现在能够审查的内容。在 CLUE 之前,置信度较低的信号因时间不足而无人问津。现在,CLUE 分类功能会对每个传入的警报进行信息丰富化处理,而批处理功能则能处理数千个此前在仪表盘中只是噪音的信号。

大规模节省时间:基于 30 天的使用数据,CLUE 自动执行了约 12,000 次查询和 27,000 次工具调用——这些工作如果手动完成,预计需要 1,870 小时(234 人天)。这相当于相比手动分类节省了 5 到 10 倍的时间。*

他们仍在学习衡量的内容:准确性比速度更难量化。团队会审查 CLUE 的处置结果并追踪分歧,但他们仍在构建反馈闭环,以了解 Claude 捕捉到分析师可能遗漏的情况的频率——反之亦然。调查记录对此有所帮助:每项调查都可以被审计,精确查明 Claude 检查了哪些内容以及它是如何得出结论的。

我们的发展方向:让 Claude 像 Claude 一样进行调查

人工智能研究中有一个概念叫“苦涩的教训”——即把人类特定的推理方式编码到模型中,其效果始终不如赋予模型通用能力并让它们自行寻找方法。Bow 和她的团队一直在思考这对检测与响应意味着什么。

“在 CLUE 开发的早期阶段,团队曾就应在多大程度上约束 Claude 的调查路径进行过辩论,”Bow 说道。“SOAR 时代的本能反应是:构建剧本,定义每一步,让流程具有确定性。但我们不断注意到一些事情。当我们给 Claude 探索的自由度——提供工具和一个目标,而不是一套僵化的流程——它常常会走我们未曾预设的调查路径。有时这些路径会揭示出我们本可能遗漏的上下文信息。”

关键在于为 Claude 设定边界(它可以使用哪些工具,可以访问哪些数据),同时保持策略的开放性。这一洞见塑造了 CLUE 下一步的发展方向。

从被动响应到主动出击:目前,CLUE 响应警报。事件触发,Claude 进行调查。但该架构支持更具雄心的目标:持续探索。与其等待检测规则触发,Claude 智能体可以主动搜寻可疑模式——那些与团队已编写规则都不匹配的异常,那些单独看来正常但整体来看不寻常的行为。

自我学习:团队存储了每一次的调查记录。这个语料库正在成为一个知识库,Claude 可以从中查询过去调查展开的模式。随着时间的推移,CLUE 将发展出任何人类分析师都无法维持的组织记忆。

拥抱非确定性:传统安全工具将不一致视为缺陷。CLUE 则将其视为特性。同一个告警在不同日期可能会以不同方式被调查,这完全没问题——有时第二条路径能发现第一条遗漏的东西。该团队正在尝试并行运行多种调查策略并比较结果。

“安全运营的苦涩教训是什么?我们花了多年时间构建那些编码了人类调查方式的系统。下一代工具应该赋予模型调查能力,让它们找到比我们预设的更好的方法,”Bow 补充道。

请查阅我们关于如何为你的安全计划做好准备以应对 AI 加速攻击的最佳实践。

立即开始使用 Claude Code。敬请关注“Anthropic 如何使用 Claude”系列中的更多故事。

*这些结果由 Claude Sonnet 和 Opus 模型生成。

视频 · 前往原文观看

使用 Claude 改变你组织的运作方式。

Anthropic 网络安全团队如何利用 Claude Code 构建威胁检测平台

Claude:Blog(网页)·2026-05-12 00:00·83天前
阅读原文· claude.com
精选理由

我一直好奇大模型公司自己怎么用 AI 做安全,这篇挖出了 Anthropic 内部 CLUE 平台的构建细节——从一天出原型到每周省下 234 人天,数据比很多 PR 稿扎实。

AI 摘要

Anthropic 检测平台工程团队技术负责人 Jackie Bow 运用 Claude Code 开发了 CLUE 威胁检测与响应平台。该平台通过自然语言界面连接内部系统,包含 CLUE Triage 自动初筛警报,整合上下文信息分配处置建议;以及 CLUE Investigate 支持分析师用自然语言查询日志,由 Claude 自动生成并执行查询,将数小时的人工分析缩短至几分钟。团队在一天内完成概念验证,一周内交付实现,显著提升了安全运营效率。

正文 · AI 翻译

杰克·鲍,Anthropic 检测平台工程团队的技术负责人,分享了她的团队如何利用 Claude Code 构建工具,实现告警分类自动化、加速调查流程,并彻底改变安全分析师的工作方式。

  • 分类
    Claude Code
  • 产品
    Claude Code
  • 日期
    2026年5月12日
  • 阅读时间
    5
    分钟
  • https://claude.com/blog/how-anthropic-uses-claude-cybersecurity

在杰克的整个职业生涯中,她一直梦想着能构建这样的工具:它们能够真正触及那些关键信息——不仅仅是日志和告警,还包括 Slack 对话、内部文档以及机构知识,这些信息能告诉你某个事件是真正的威胁还是虚惊一场——而无需人类承担手动梳理数据的重负。

当她加入 Anthropic 后,她终于有机会与 Claude 合作,将这些工具变为现实。杰克领导着 Anthropic 的检测平台工程团队,该团队专注于防御性网络安全:检测威胁并应对潜在入侵,而非主动寻找漏洞。他们的工作包括监控系统中的可疑活动、对安全告警进行分类,以及在异常事件演变为安全事故之前进行调查。

对于一家正在构建日益强大 AI 模型的公司而言,这项工作具有基础性意义。Anthropic 的《负责任扩展政策》将产品发布直接与安全承诺挂钩,这意味着鲍的团队在一定程度上决定了公司能够安全地发布哪些产品。

“我感觉这就像是安全工程师的黄金时代,”担任 Anthropic 检测平台工程团队技术负责人的鲍表示,“我终于可以构建那些我一直渴望拥有的工具了。”

问题:被数据和告警淹没

安全领导者对这种模式再熟悉不过了。

一条告警触发。分析师打开终端,开始熟悉的流程:在五六个不同的工具之间来回切换,每个工具都有自己独特的查询语言和思维模式。他们必须在多个平台上保持专业能力,同时不断在不同界面和查询语法之间进行上下文切换。

每一次调查都变成了一场数据考古,需要将散落在互不关联的系统中的碎片拼凑起来。对大多数团队来说,简单的调查就要耗费数小时,而复杂的调查则可能持续数天。

“一个人一天能处理的告警数量是有限的,超过这个限度,他们深入调查的细致程度就会开始下降,”Jackie 解释道。

她的团队决定改变这一现状。他们问自己:是什么在消耗我们的精力?哪些工作感觉重复?什么阻碍了我们去做有影响力的事情?

答案很明确。在分析师判断威胁是否真实之前,告警分类就可能耗费数小时。跨互不关联的系统进行手动关联拖慢了所有工作。而在不同查询语言和界面之间不断切换上下文,造成了认知负担,并且这种负担会随着一天的工作不断累积。

随着公司的发展,攻击面也在扩大,对安全团队的要求也随之增加。

“如果不借助像 Claude 这样的工具来增强能力,我们无法扩大规模以满足 Anthropic 的需求,”Jackie 说。

解决方案:Claude 证据查找系统(CLUE)

在几个月的时间里,Bow 的团队构建了 CLUE,这是一个检测与响应平台,它重新构想了安全团队调查威胁的方式。CLUE 并非在现有工具栈上增加另一个仪表盘,而是提供了一个由 Claude 驱动的自然语言界面,通过工具使用直接连接到 Anthropic 的内部系统。

使用 Claude Code 构建 CLUE 极大地缩短了传统的软件开发周期,使他们能够在处理日常工作的同时,还能构建这个系统。Bow 的团队在一天之内就运行了一个概念验证。设计文档、开发步骤和实现工作在一周内完成。

“我们构建的很多东西都是通过与 Claude Code 对话完成的,”Jackie 回忆道。“它既是设计伙伴,也是协作者。”

改变她看法的时刻,是她让 Claude Code 在 CLUE 界面中添加一个按钮的时候。她本以为会陷入 JavaScript 框架和 CSS 调试那种熟悉的苦战。而 Claude Code 立即实现了这个功能,并且做得比她本人还要好。

“那一刻我意识到,自己不再受限于技术能力了。只要我能想到的东西,我都能把它做出来。”她说道。

CLUE 分类

当告警信息涌入时,CLUE 分类会在人类分析师看到它们之前进行第一轮分类。Claude 会利用各类工具,从 Anthropic 的各个系统中(包括 Slack 消息、内部文档、代码仓库和数据仓库)为每条告警补充额外的上下文信息。它会分配处置结论:误报、真实告警、恶意行为或预期行为。每条告警都会收到一个置信度分数,以便分析师知道应该把注意力集中在哪里。

这个信息补充步骤解决了一个任何安全分析师都认识的问题:告警是以孤立信号的形式出现的。一次失败的登录尝试。一次异常的 API 调用。一次配置变更。如果没有上下文,这些事件就只是噪音。而有了上下文(用户是谁、他们当时在做什么、这是否符合其团队的行为模式),清晰的信号就会浮现出来。

“这些内部上下文正是缺失的关键一环,它确实能帮助告警在你的环境中得到上下文化的理解,”Jackie 解释道。

CLUE 调查

有了 CLUE,安全分析师现在可以使用自然语言查询所有安全关键日志。想知道“过去一天内该系统所有失败的登录尝试有哪些?”只需询问 CLUE,Claude 就会执行必要的 SQL 查询。

“Claude 在编写精确查询方面比人类强得多,”Jackie 说。该工具运行一个智能体循环:一个编排器向子智能体发出指令,这些子智能体并行执行查询、收集发现结果,并将结果综合成连贯的调查摘要。原本需要数小时手动关联分析的工作,现在只需三到四分钟就能完成。

数据也证实了这一点。在各项调查中,CLUE 每次会话平均进行 25 次工具调用和近 11 次查询——远超分析师能够合理手动执行的次数,并且精度更高。这些工具调用中的每一次,否则都需要打开一个单独的控制台或切换到不同的界面。

然而,真正的差异化因素在于内部上下文。CLUE 通过工具直接连接到 Anthropic 的内部系统,让 Claude 能够访问外部安全平台永远无法触及的机构知识。当警报触发时,Claude 可以查看 Slack,了解团队是否讨论过计划内维护。它可以查询数据仓库,理解基线行为。它还能检查代码仓库,了解某个服务的实际功能。

数据治理审查

团队用一个常见的数据治理场景演示了 CLUE 的能力:检查三名承包商在过去两个月内是否访问了任何不应访问的文档。

据 Bow 介绍,这类调查通常至少需要半天的人工操作,包括查询访问日志、交叉核对权限以及审查文档分类。而使用 CLUE 后,Claude 读取请求、制定计划,并生成冗长的查询语句来抽象化技术复杂性。调查在几分钟内即可完成,生成摘要和建议,并且每次查询的完整过程都透明可见。

衡量影响

团队在构建 CLUE 时,不仅想了解它是否感觉更快,更想确认能否量化其成果。

误报减少:在 CLUE 分类功能上线前,大约每三个警报中就有一个是误报。现在这一比例已降至 7%,意味着分析师可以将时间花在真正重要的信号上。*

覆盖范围更广:或许比速度更重要的是团队现在能够审查的内容。在 CLUE 之前,置信度较低的信号因时间不足而无人问津。现在,CLUE 分类功能会对每个传入的警报进行信息丰富化处理,而批处理功能则能处理数千个此前在仪表盘中只是噪音的信号。

大规模节省时间:基于 30 天的使用数据,CLUE 自动执行了约 12,000 次查询和 27,000 次工具调用——这些工作如果手动完成,预计需要 1,870 小时(234 人天)。这相当于相比手动分类节省了 5 到 10 倍的时间。*

他们仍在学习衡量的内容:准确性比速度更难量化。团队会审查 CLUE 的处置结果并追踪分歧,但他们仍在构建反馈闭环,以了解 Claude 捕捉到分析师可能遗漏的情况的频率——反之亦然。调查记录对此有所帮助:每项调查都可以被审计,精确查明 Claude 检查了哪些内容以及它是如何得出结论的。

我们的发展方向:让 Claude 像 Claude 一样进行调查

人工智能研究中有一个概念叫“苦涩的教训”——即把人类特定的推理方式编码到模型中,其效果始终不如赋予模型通用能力并让它们自行寻找方法。Bow 和她的团队一直在思考这对检测与响应意味着什么。

“在 CLUE 开发的早期阶段,团队曾就应在多大程度上约束 Claude 的调查路径进行过辩论,”Bow 说道。“SOAR 时代的本能反应是:构建剧本,定义每一步,让流程具有确定性。但我们不断注意到一些事情。当我们给 Claude 探索的自由度——提供工具和一个目标,而不是一套僵化的流程——它常常会走我们未曾预设的调查路径。有时这些路径会揭示出我们本可能遗漏的上下文信息。”

关键在于为 Claude 设定边界(它可以使用哪些工具,可以访问哪些数据),同时保持策略的开放性。这一洞见塑造了 CLUE 下一步的发展方向。

从被动响应到主动出击:目前,CLUE 响应警报。事件触发,Claude 进行调查。但该架构支持更具雄心的目标:持续探索。与其等待检测规则触发,Claude 智能体可以主动搜寻可疑模式——那些与团队已编写规则都不匹配的异常,那些单独看来正常但整体来看不寻常的行为。

自我学习:团队存储了每一次的调查记录。这个语料库正在成为一个知识库,Claude 可以从中查询过去调查展开的模式。随着时间的推移,CLUE 将发展出任何人类分析师都无法维持的组织记忆。

拥抱非确定性:传统安全工具将不一致视为缺陷。CLUE 则将其视为特性。同一个告警在不同日期可能会以不同方式被调查,这完全没问题——有时第二条路径能发现第一条遗漏的东西。该团队正在尝试并行运行多种调查策略并比较结果。

“安全运营的苦涩教训是什么?我们花了多年时间构建那些编码了人类调查方式的系统。下一代工具应该赋予模型调查能力,让它们找到比我们预设的更好的方法,”Bow 补充道。

请查阅我们关于如何为你的安全计划做好准备以应对 AI 加速攻击的最佳实践。

立即开始使用 Claude Code。敬请关注“Anthropic 如何使用 Claude”系列中的更多故事。

*这些结果由 Claude Sonnet 和 Opus 模型生成。

视频 · 前往原文观看

使用 Claude 改变你组织的运作方式。

阅读原文claude.com