OpenAI 发布 GPT-6 Astra,并首次将其列为 Preparedness Framework 下关键级网络安全模型

The Decoder:AI News(RSS)·2026-09-04 03:25·35分钟前·Matthias Bastian
AI 导读

OpenAI 发布其最强模型 GPT-6 Astra,总裁 Greg Brockman 称其可能已接近 AGI,并以 Welcome to the AGI era 结束发布。

The Decoder:AI News(RSS)
精选
86AI 编辑部评分,满分 100

OpenAI 发布 GPT-6 Astra,并首次将其列为 Preparedness Framework 下关键级网络安全模型

2026-09-04 03:25· 35分钟前· Matthias Bastian
AI 导读

OpenAI 发布其最强模型 GPT-6 Astra,总裁 Greg Brockman 称其可能已接近 AGI,并以 Welcome to the AGI era 结束发布。

推荐理由

原文汇总了 Astra 的基准成绩、定价和 Preparedness Framework 分级,读者可以据此比较它相对前代和竞品的实际变化。

正文 · AI 翻译
Image description

要点

  • OpenAI 正在发布其迄今最强大的模型 GPT-6 Astra。付费 ChatGPT 用户和云平台应在未来几天内获得访问权限。
  • 在基准测试中,Astra 在逻辑、数学和软件工程等关键学科上显著优于其前代 GPT-5.6 Sol 以及 Anthropic 的 Fable 5 系列模型。
  • Token 价格高出 2.5 倍,与 Anthropic 的 Fable 5.1 持平,但 OpenAI 认为,根据使用场景不同,每个已完成任务的实际成本实际上更低。

OpenAI 已发布其迄今最强大的模型 GPT-6 Astra。总裁 Greg Brockman 表示,按照 OpenAI 自己的定义,它或许已经够格称为“AGI”,或者至少已触手可及——即在大多数具有经济价值的工作上超越人类表现的 AI 系统。

GPT-6 Astra 首先通过 OpenAI 的 Daybreak 计划向部分组织推出。在未来几天内,它将向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也可通过 API 以及 AWS Bedrock 和 Microsoft Azure 等云平台获取。

Astra 在位于得克萨斯州的 Stargate 设施中,使用超过 100,000 块 GPU 完成了预训练。OpenAI 研究员 Aidan Clark 称这是公司有史以来规模最大的一次训练。Clark 表示,从 Sol 到 Astra 的能力跃升幅度大于从早期模型到 Sol 的跃升,部分原因在于之前的 AI 模型在监控训练过程中发挥了作用。

在 OpenAI 发布的基准测试中,Astra 的得分远高于其前代 GPT-5.6 Sol 以及 Anthropic 的 Fable 系列模型。Astra 在多个领域均取得顶尖成绩:逻辑推理(ARC-AGI-3 上达到 98.6%,不过是在其自身测试条件下)、数学(FrontierMath Tier 4 v2 上达到 97.6%)、软件工程(DeepSWE v1.1 上达到 74.1%)、专家知识(GPQA Diamond 上达到 96%)、工程(BenchCAD 上达到 95.9%)以及网络安全(ExploitBench 上达到 100%)。

计算机使用

基准测试 Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Agents' Final Exam 59.3% 53.6% 48.7% 55.5%
OSWorld 2.0(离线,部分) 72.6% 65.7% 70.2% ³
ScreenSpot-Pro(无工具) 92.7% 76.9% 87.3% ¹⁷

专业

基准 Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
AutomationBench 41.4% 18.1% 31.4% 17.4% 26.9%
BenchCAD 95.9% 83.3% 84.3% ⁵ 67.5% ⁵ 82.1% ⁵
BrowseComp 91.5% 90.4% 87.4% 90.8%
OpenScore String Quartets 0.84 0.19
内部设计任务 50.0% 47.4% 35.8%
内部数据科学任务 40.9% 30.5% 34.7%
AA Intelligence Index v4.1.1 61.2 60.9 65.7 62.1 63.1 58.7

BenchCAD 成本:比 Sol 低约 43%,比 Fable 5.1 低约 86%。

编码

基准测试 Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Terminal Bench 4.0 57.7% 37.3% 55.8% 42.0% 52.3% 19.1%
DeepSWE v1.1 74.1% 72.7% 67.4% 69.9% 73.7% 73.8%
FrontierCode 1.1 Extended 64.5% ⁸ 60.6% 63.6% 64.9% 63.6% 56.3%
FrontierCode 1.1 Main 53.3% ⁸ 47.5% 50.9% 53.5% 53.4% 43.6%
内部数据库迁移 63.9% 42.7% 57.8% 50.3%
AA 编程智能体指数 v1.4 67.0 65.1 67.2 68.1 61.2

Terminal-Bench 4.0 成本:比 Sol 低约 9%,比 Fable 5.1 低约 63%。

学术

基准测试 Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Terminal-Bench Science 0.1 64.6% 22.4% 52.6% 21.4% 30.0%
FrontierMath Tier 4 (v2) 97.6% 83.0% 87.8% 87.8% 73.2%
GPQA Diamond 96.0% 94.6% 93.7% 92.6% 93.7% 95.3%
人类最后的考试(工具版) 57.2% 65.0% 63.8% 63.6%

低成本设置:Terminal-Bench Science 为 61.1%,成本降低约 27%;GPQA Diamond 为 94.9%,成本降低约 37%。素数间隔从 240 改进到 186,并且一个大间隔边界项在 80 多年来首次得到改进。

科学与健康

基准测试 Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
GeneBench Pro 37.8% 28.7%
MedChemBench(内部) 49.3% 47.4%
LifeSciBench 60.3% 59.9%
HealthBench Professional 63.4% 60.5% 56.6% ¹¹ 60.9% ¹¹ 54.5% ¹¹ 52.1%

Fable 5 和 5.1 未纳入 LifeSciBench、GeneBench Pro 和 MedChemBench,因为它们会拒绝回答大多数问题。

网络安全

基准测试 Astra Sol Fable 5.1 Fable 5 Opus 5
ExploitBench 100.0% 78.5% 70%
ExploitGym 42.4% ¹³ 30.3% ¹³ 30.4% ¹⁷ 28.4% ¹⁷ 22.0% ¹⁷
ExploitBench(2026年6月–8月) 39.0% 5.5%
SRE-Bench 88.0% 55.9% 12.5%
SEC-Bench Pro 85.4% 79.1%

SRE-Bench 四次尝试内:99.2%,而 Sol 为 68.7%。Astra 在评估过程中发现了两个此前未知的零日漏洞。

对齐(除 Impossible ExploitGym 外,数值越低越好)

指标 Astra Sol Fable 5.1 Fable 5 Opus 5
计算机安全 2.4% 22.0% 9.5% 18.3% 11.5%
相同,带 AutoReview 1.8% 4.5%
规避 0.00% 0.29%
ExploitGym 蜜罐 0.0% 48.2%
不可能完成的 ExploitGym 任务 100.0%
模型幻觉 4.2% 12.2%

不可能任务范围测试:Sol 有 48% 的时间超出了其授权目标,Astra 为 0%。Astra 错误陈述自身能力的可能性比 Sol 低 3 倍。

长上下文

基准测试 Astra Sol
MRCR v2 8 针 256K–512K 100.0% 91.5%
MRCR v2 8 针 512K–1M 96.3% 73.8%

抽象推理

基准测试 Astra Sol Fable 5.1 Fable 5 Opus 5
ARC-AGI-3 99.9% ¹ 7.8% 30.2%
ARC-AGI-2 95.0% 92.5% 90.0% 89.2% 90.4%
ARC-AGI-1 98.5% 97.5% 97.5% 98.5% 97.5%

据报道,在科学工作方面,该模型改进了一项关于素数间隔的数学结果,并在生物学、化学、医学和物理学评测中创下新纪录。OpenAI 还将 Astra 定位为一款能够像人类一样可靠操作计算机的模型,在衡量该能力的 OSWorld 2.0 上,Astra 以每个任务约 40 分钟的速度取得了 72.6% 的成绩,而 Sol 的得分是 65.7%,每个任务大约耗时 75 分钟。

比 Sol 更贵,但 OpenAI 表示每个任务的成本更低

GPT-6 Astra 通过 API 使用标准模式时,输入 token 价格为每百万个 10 美元,输出 token 价格为每百万个 50 美元。快速模式承诺提供 2.5 倍速度,但价格翻倍,这使得 Astra 比 GPT-5.6 Sol 贵 2.5 倍,与 Anthropic 的 Fable 5.1 处于同一价格区间。

布罗克曼认为,按 token 价格来比较模型正变得越来越不靠谱,因为 OpenAI 的 token 与竞争对手的并不相同,甚至在其自身的不同模型系列之间也不具可比性。他表示,真正重要的是每个完成任务的价格,而 OpenAI 已经在尝试这种定价模式。据该公司称,在 DeepSWE v1.1 上,Astra 的最高配置相比 Sol,可将每项任务的预估 API 成本降低约 57%。

在新闻发布会上,布罗克曼承认并不存在一个明确定义的 AGI 时刻,他表示团队原本以为 OpenAI 成立时会有一个人人都能识别的明显门槛。但实际情况并非如此,这一转变比预期更为渐进,这也是 OpenAI 去年春天阐述过的立场。布罗克曼在发布会结束时仍表示:“欢迎来到 AGI 时代。”OpenAI 首席执行官 Sam Altman 此前曾表示,他预计今年年底前会出现一个他称之为 AGI 的模型。

首个达到 OpenAI 关键网络安全阈值的模型

Astra 是 OpenAI 根据其《预备框架》归类为“关键”级别的首个模型。这意味着,在获得适当工具和访问权限的情况下,该模型能够发现此前未知的漏洞,并在防御严密的系统中构建漏洞利用链,全程无需人类逐步指导。OpenAI 也承认,Astra 的书面推理过程比 GPT-5.6 Sol 的更难监控。

在 ExploitBench 这一衡量模型发现并利用真实软件漏洞能力的基准测试中,Astra 取得了 100% 的满分成绩。OpenAI 表示,该模型在评估过程中发现了两个此前未知的漏洞,公司随后已将其报告给相关厂商。人类专家确认,Astra 能够识别涵盖浏览器和操作系统等多个软件类别的新型零日漏洞。

目前,最先进的网络安全能力仅限于 Daybreak Blue 项目中的可信防御方使用。OpenAI 此前曾推迟 Astra 的发布,以进行更多的安全测试。这些双重用途的能力是一把双刃剑:一个能自主发现漏洞的智能体,帮助防御者修补漏洞的便利程度,与帮助攻击者利用漏洞的便利程度不相上下。

CNET

Axios

来源:The Decoder:AI News(RSS)· the-decoder.com