# GPT-Red：通过大规模自对弈实现自动化红队测试

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-28 08:00
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms6x4iu90276rouqaq8hzfw7
- 原文链接：https://arxiv.org/abs/2607.26115

## 精选理由

OpenAI 用自对弈训练出 GPT-Red，攻击成功率超过人类红队，并直接用于加固 GPT-5.6。这是目前最大规模的安全训练实验，做对齐的值得逐段拆解，对抗训练的思路可能会被各家复用。

## AI 摘要

OpenAI 推出 GPT-Red，一个通过自对弈算法训练的自动化红队智能体，用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练，能可靠攻破 GPT-5.5 及更早模型，发现比人类红队更多的成功攻击，并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6，使其成为目前对提示注入最鲁棒的模型。

## 正文

我们推出了 GPT-Red，这是一个经过训练的自动化红队智能体，旨在针对前沿大语言模型发现新颖的提示词注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此，我们利用它对 GPT-5.6 进行了对抗性训练，这是迄今为止我们对提示词注入攻击鲁棒性最强的模型。

为了创建 GPT-Red，我们设计了一种可扩展的自对弈算法，要求该模型攻击一个由同时训练的防御者智能体组成的多样化群体。我们在逼真的红队测试环境中训练该模型，所使用的算力与我们一些规模最大的 RL 后训练运行相当，使其成为有史以来规模最大的单一大语言模型安全训练运行。

GPT-Red 在红队测试方面表现出色：它能可靠地攻破我们此前直至 GPT-5.5 的模型，比人类红队测试人员发现更多成功的攻击，并且能够泛化到未见过的环境、防御者模型以及测试框架。未来，我们预计随着每个新 GPT 模型鲁棒性的提升，这将反过来为更强大的红队智能体提供更好的学习信号，从而开启一个自我改进的飞轮效应。
