AI 智能体正在改变我们与技术的关系。通过自主执行从网络防御到科学发现和产品开发等复杂任务,这些系统正在开启一个生产力新时代。仅在美国,到 2030 年 AI 智能体就能创造 2.9 万亿美元的经济价值。
随着这些智能体能力越来越强,它们也需要更精密的安全保障。正因如此,我们制定了 AI 控制路线图:一个用于构建和管理我们在 Google 内部部署的先进 AI 的框架。这种“纵深防御”方法超越了传统的模型对齐,增加了一层关键的系统级安全,即使对齐不完美也能提供保障,有望成为整个行业的范本。
理解 AI 控制
我们的安全方法始于一个坚实的基础,融合了沙箱、端点安全和提示词注入防御等传统安全措施。在此基础上,AI 控制路线图将模型对齐(即训练 AI 使其天生安全且有用)作为主要防线。通过将内部智能体视为可能未对齐的,它提供了额外一层安全,即使对齐不完美也能提供保障。
可以把它想象成一位拥有双重控制装置的驾驶教练。教练信任学员,但随时准备在出现失误时接管方向盘或踩下刹车。类似地,我们的 AI 控制系统根据 AI 智能体验证过的行为授予权限,让我们能够通过受控的、渐进式的访问来建立信任。
我们的路线图建立在一个简单但谨慎的假设之上:如果一个能力极强的 AI 智能体与我们的目标不一致,并以意想不到的方式行动,该怎么办?为了解决这个问题,我们的计划聚焦于三个关键领域。
首先,遵循网络安全领域的最佳实践,我们为人工智能开发了一种新颖的威胁建模框架。该路线图将不受信任的AI智能体视为潜在的“内部威胁”——类似于公司会如何对待一名已经拥有办公室门禁权限、可能作乱的员工。通过借鉴行业标准的MITRE ATT&CK框架(一个基于真实世界观察、全球可访问的对手战术与技术知识库),我们将潜在攻击分解为更细粒度的战术与技术。这使我们能够有条不紊地追踪风险,在恶意行为造成损害之前发现它,并安全地进行演练,以检验我们的防御措施是否真正有效。
其次,我们制定了一项部署AI控制缓解措施的计划,以应对这些风险。
- 识别问题(检测):监控是AI控制的支柱。我们使用其他可信的AI系统作为“监督者”,持续审查工作智能体的推理过程、行动和计划,以判断其是否偏离正轨。
- 管理问题(预防与响应):如果监督者发现智能体试图做出有害行为,它可以在损害发生前介入并阻止该行动。
最后,为确保我们的系统功能正常,我们持续衡量三个关键指标的性能:覆盖率(被监控流量的比例)、召回率(被捕获的失调行为的比例)以及响应时间。
随着AI变得更智能,同步扩展安全措施
随着AI模型持续进步,我们的防御措施也必须同步加强。在我们的AI控制路线图中,我们将安全协议映射到AI能力在两个关键方面的可衡量里程碑:
- 规避检测的能力:目前,我们监控模型可见的思维链。然而,随着模型学会隐藏其推理过程——无论是通过监督感知(知道自己在被监控)还是不透明推理(不使用可见文本进行推理)——仅仅读取其语言化的推理将不再足够。我们将需要分析其行为,并可能检查模型的内部运作。
- 潜在危害能力:对于低风险且可逆的操作,我们可以依赖延迟审查记录并在问题发生后快速修复(异步响应)。对于特别高风险的操作,例如重大网络攻击,我们必须转向实时预防,在有害操作执行之前就加以阻止(同步响应)。换言之,我们的响应策略必须与威胁的严重程度相匹配。
《AI 控制路线图》根据已部署模型的能力推荐相应的安全措施。模型的检测规避能力决定了检测等级(D1-D4),而模型的攻击执行能力则决定了预防与响应等级(R1-R3)。
分析百万条智能体轨迹以指导实时监控
要构建这些系统,我们需要数据。我们的团队已经构建了一个异步监控系统的内部原型,该系统会审查编码智能体的运行轨迹,并将发现的问题上报以供人工审核。每个被标记的事件都会根据我们路线图中的威胁分类法进行分类。
我们已经分析了百万条编码智能体任务,这为我们优化安全协议提供了宝贵的见解,并使我们能够超越简单的关键词过滤,识别出高信号的行为模式。例如,这项研究对于为 Gemini Spark 智能体构建实时监控器至关重要,使我们能够实时响应新出现的问题,例如意外的数据删除。
需要指出的是,我们的数据显示,大多数被标记的事件并非源于恶意意图;相反,它们通常是由智能体对用户目标的误解或过度执行所导致。理解这些细微差别对于完善我们的安全协议至关重要。
保护智能体生态系统是共同的责任
《AI 控制路线图》是我们多层次智能体安全方法中的一个关键要素。通过将这些协议与我们的更广泛基础设施相结合,我们正在扩展内部安全能力,以安全管理我们最先进的 AI 模型。
此外,这种多层级的智能体安全方法应成为行业、政策制定者和学术界的共同优先事项。通过围绕最佳实践和标准协调生态系统,我们能够赋能网络防御者并构建社会韧性。正因如此,我们今天还发布了一份面向政策制定者的技术框架《智能体安全三层架构》。该文件详细阐述了我们需要如何在单个智能体层面、多智能体系统层面,以及赋能网络防御者并在更广泛的生态系统中构建韧性方面提升安全性。
我们计划在这些框架的基础上继续推进,以便在当下自信地部署强大的 AI,同时为未来持续构建安全基础。
在此阅读完整技术报告:
研究作者
Mary Phuong、Erik Jenner、Laurent Simon、Lewis Ho、Rohin Shah、Sebastian Farquhar 和 Scott Coull。
致谢
Four Flynn、Anca Dragan、Alan Cooney、Bilal Chughtai、Buck Shlegeris、Cody Wild、David Lindner、Julian Stastny、Kevin Klyman、Li Ding、Myriam Khan、Raluca Ada Popa、Roland Zimmermann、Ryan Greenblatt、Senthooran Rajamanoharan、Victoria Krakovna 和 Xerxes Dotiwalla。