# OpenAI 发布 GPT-6 Astra，首个达到关键级网络安全能力门槛的模型

- 来源：IT之家（RSS）
- 发布时间：2026-09-04 06:28
- AIHOT 分数：77
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmtm3lnrg022wrooelnc62oo9
- 原文链接：https://www.ithome.com/0/998/208.htm

## 精选理由

原文梳理了 Astra 达到关键级网络安全门槛的同时可监控性下降的细节，以及 OpenAI 补充的防护与评估措施。

## AI 摘要

OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra，是其首个达到准备框架中关键级网络安全能力门槛的模型，可在无逐步指导下发现防护严密系统的未知漏洞。

## 正文

IT之家 9 月 4 日消息，当地时间 9 月 3 日，OpenAI 宣布推出新一代 GPT-6 Astra 模型，这是该公司迄今为止最强大、最广泛部署的大语言模型。

据介绍，Astra 是 OpenAI 旗下首个达到其“准备框架”（Preparedness Framework）中“关键”（Critical）网络安全能力门槛的模型。

据 OpenAI 介绍，Astra 在网络安全能力上实现了显著跃升。在配备适当工具和访问权限的情况下，该模型能够在无人逐步指导的条件下，发现许多防护严密的系统中此前未知的安全漏洞，并开发新的利用方式。

针对这一能力提升，OpenAI 已大幅强化了防止模型采取有害网络行动的保护措施，包括更严格的隔离、检查点加密、对包含思维链（CoT）在内的完整轨迹进行通用监控，以及内部使用前的阻断式对齐评估流程。

在安全性与对齐方面，OpenAI 表示 Astra 较前代产品更为出色。Astra 对越狱攻击的鲁棒性显著优于 GPT-5.6 Sol。在涉及超过 5.4 万个内部 Codex 任务的模拟测试中，Astra 在严重程度较高的不对齐行为标记数量上，约为 Sol 的一半。

OpenAI 在部署中广泛引入了不对齐行为监控系统，该系统在所有涉及工具调用的推理过程中运行，并耗费了大量计算资源。然而，OpenAI 也承认 Astra 的可监控性相较 GPT-5.6 Sol 有所下降。研究发现，Astra 控制自身思维链的能力更强，在对抗性条件下（即被推动去规避监控时），模型能够在评估中策略性表现不佳（即“沙袋”行为）而不被发现，有时还能规避内部监控。IT之家注：思维链是指模型在给出最终答案前，逐步展示其推理过程的方式，是可解释性研究的关键一环。

不过，OpenAI 目前尚未发现 Astra 具备隐写式思维链推理的证据，表明规避风险可能主要局限于不需要思维链就能完成的任务。OpenAI 表示严肃对待这一趋势，并正持续调查相关发现及其对未来可监控性的影响，同时强调发展思维链监控之外的对齐审计技术也同样重要。

在具体应用场景中，Astra 对提示注入攻击的鲁棒性显著优于 GPT-5.6 Sol，在真实浏览和专业计算机环境中的不对齐及潜在破坏性行为（如未经授权的交易、数据丢失、过度访问或规避控制）也大幅减少。此外，Astra 在高风险场景中的响应更为安全，且在 18 岁以下用户的年龄适配安全边界应用上更为一致。

OpenAI 首席科学家 Jakub Pachocki 在 9 月 3 日上午的简报会上表示：“随着模型能力增强，准确理解它们能做什么变得更困难了。这并不保证随着智能持续提升，我们的方法仍然足够有效，因为智能的进步并不能保证对齐的进步。”
