我们推出了 GPT-Red,这是一个经过训练的自动化红队智能体,旨在针对前沿大语言模型发现新颖的提示词注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们利用它对 GPT-5.6 进行了对抗性训练,这是迄今为止我们对提示词注入攻击鲁棒性最强的模型。
为了创建 GPT-Red,我们设计了一种可扩展的自对弈算法,要求该模型攻击一个由同时训练的防御者智能体组成的多样化群体。我们在逼真的红队测试环境中训练该模型,所使用的算力与我们一些规模最大的 RL 后训练运行相当,使其成为有史以来规模最大的单一大语言模型安全训练运行。
GPT-Red 在红队测试方面表现出色:它能可靠地攻破我们此前直至 GPT-5.5 的模型,比人类红队测试人员发现更多成功的攻击,并且能够泛化到未见过的环境、防御者模型以及测试框架。未来,我们预计随着每个新 GPT 模型鲁棒性的提升,这将反过来为更强大的红队智能体提供更好的学习信号,从而开启一个自我改进的飞轮效应。