内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
原文
HuggingFace Daily Papers(社区热门论文)
精选75

GPT-Red:通过大规模自对弈实现自动化红队测试

2026-07-28 08:00· 2天前
跳到正文
精选理由

OpenAI 用自对弈训练出 GPT-Red,攻击成功率超过人类红队,并直接用于加固 GPT-5.6。这是目前最大规模的安全训练实验,做对齐的值得逐段拆解,对抗训练的思路可能会被各家复用。

AI 摘要

OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。

正文 · AI 翻译

我们推出了 GPT-Red,这是一个经过训练的自动化红队智能体,旨在针对前沿大语言模型发现新颖的提示词注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们利用它对 GPT-5.6 进行了对抗性训练,这是迄今为止我们对提示词注入攻击鲁棒性最强的模型。

为了创建 GPT-Red,我们设计了一种可扩展的自对弈算法,要求该模型攻击一个由同时训练的防御者智能体组成的多样化群体。我们在逼真的红队测试环境中训练该模型,所使用的算力与我们一些规模最大的 RL 后训练运行相当,使其成为有史以来规模最大的单一大语言模型安全训练运行。

GPT-Red 在红队测试方面表现出色:它能可靠地攻破我们此前直至 GPT-5.5 的模型,比人类红队测试人员发现更多成功的攻击,并且能够泛化到未见过的环境、防御者模型以及测试框架。未来,我们预计随着每个新 GPT 模型鲁棒性的提升,这将反过来为更强大的红队智能体提供更好的学习信号,从而开启一个自我改进的飞轮效应。

智能体OpenAI论文/研究
精选75导出 Markdown

GPT-Red:通过大规模自对弈实现自动化红队测试

HuggingFace Daily Papers(社区热门论文)·2026-07-28 08:00·2天前
阅读原文· arxiv.org
精选理由

OpenAI 用自对弈训练出 GPT-Red,攻击成功率超过人类红队,并直接用于加固 GPT-5.6。这是目前最大规模的安全训练实验,做对齐的值得逐段拆解,对抗训练的思路可能会被各家复用。

AI 摘要

OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。

正文 · AI 翻译

我们推出了 GPT-Red,这是一个经过训练的自动化红队智能体,旨在针对前沿大语言模型发现新颖的提示词注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们利用它对 GPT-5.6 进行了对抗性训练,这是迄今为止我们对提示词注入攻击鲁棒性最强的模型。

为了创建 GPT-Red,我们设计了一种可扩展的自对弈算法,要求该模型攻击一个由同时训练的防御者智能体组成的多样化群体。我们在逼真的红队测试环境中训练该模型,所使用的算力与我们一些规模最大的 RL 后训练运行相当,使其成为有史以来规模最大的单一大语言模型安全训练运行。

GPT-Red 在红队测试方面表现出色:它能可靠地攻破我们此前直至 GPT-5.5 的模型,比人类红队测试人员发现更多成功的攻击,并且能够泛化到未见过的环境、防御者模型以及测试框架。未来,我们预计随着每个新 GPT 模型鲁棒性的提升,这将反过来为更强大的红队智能体提供更好的学习信号,从而开启一个自我改进的飞轮效应。

智能体OpenAI论文/研究
阅读原文
导出 Markdown
阅读原文
arxiv.org