# OpenAI 发布内部红队模型 GPT-Red，用于自动化网络攻击模拟

- 来源：IT之家（RSS）
- 发布时间：2026-07-16 11:38
- AIHOT 分数：60
- AIHOT 链接：https://aihot.virxact.com/items/cmrmysp0c03o7bijey0z0xnko
- 原文链接：https://www.ithome.com/0/977/443.htm

## AI 摘要

OpenAI 介绍了其内部使用的网络安全“红队”模型 GPT-Red，可自动化模拟网络攻击以提升产品模型的鲁棒性。过去半年，GPT-5.3 后的每个生产模型均使用了该模型训练，伪造思维链型攻击成功率从 GPT-5.1 的 95% 降至最新模型的不足 10%，GPT-5.6 Sol 在直接提示符注入攻击中失败率仅 0.05%。GPT-Red 采用自博弈强化学习训练，与防御型 LLM 同步对抗进化。

## 正文

IT之家 7 月 16 日消息，OpenAI 当地时间 15 日介绍了其内部使用的网络安全“红队”模型 GPT-Red。该模型可自动化地进行各种网络攻击模拟，帮助 OpenAI 提升对外模型产品的鲁棒性。

OpenAI 表示，其过去半年自 GPT-5.3 后的每个生产模型均将“红队”模型用于训练。伪造思维链型攻击的成功率已从 GPT-5.1 上的 95% 降低至最新模型上的不足 10%；最新的 GPT-5.6 Sol 在 GPT-Red 的直接提示符注入攻击中失败率仅有 0.05%。

GPT-Red 使用自博弈强化学习进行训练：其本身和一组不同的防御型 LLM 在广泛的红队场景上同时进行训练。GPT-Red 因成功诱发有效失败而获得奖励，而防御型模型则因抵抗攻击并完成其原始任务而获得奖励。随着防御型模型变得越来越强大，GPT-Red 被迫发现更强大、更多样化的攻击。

“红队”模型与产品模型相隔离。OpenAI 相信其已开启了良性的人工智能网络安全循环，可利用现有模型来增强未来模型的鲁棒性、一致性、可信度。
