Chubby♨️@kimmonismus
76AI 编辑部评分,满分 100
2026-07-10 02:02· 20天前
跳到正文
AI 摘要

OpenAI 推出 GPT-5.6 Sol,在编码、浏览、安全、科学、长上下文及智能体任务上表现强劲。多个基准测试中,Sol 以更少 tokens、更短时间或更低成本接近或刷新 SOTA:Agents' Last Exam 达 52.7%(超越 GPT-5.5、Claude Fable 5 等),Terminal-Bench 2.1 上 Sol Ultra 达 91.9%(高于 Claude Mythos 5 的 88.0%),BrowseComp 达 92.2%,OSWorld 2.0 达 62.6%,Coding Agent Index 得分 80,SEC-Bench Pro 达 74.3%。同时发布 ChatGPT Work,可从文档、Slack、Notion、Microsoft 365 及 Google Drive 拉取上下文,生成演示文稿、文档、电子表格、仪表盘、可视化及交互式解释。

正文 · AI 翻译

Live for me. And obv I keep the Codex logo

GPT-5.6 来了,同时还有期待已久的超级应用。

长话短说

模型层面令人印象深刻,但也在意料之中:GPT-5.6 Sol 在编程、浏览、网络安全、科学、长上下文和智能体工作方面表现强劲。在多项评测中,OpenAI 声称它要么创造了新的 SOTA,要么在消耗更少 token、更短时间或更低预估成本的情况下非常接近 SOTA。不过,它在多个基准测试中甚至超越了 Fable 5,当然不是在所有方面(见下文)。

一些值得关注的数字:

• Agents' Last Exam:GPT-5.6 Sol 达到 52.7%,领先于 GPT-5.5、Claude Fable 5 和 Opus 4.8 • Terminal-Bench 2.1:Sol Ultra 达到 91.9%,高于 Claude Mythos 5 报告的 88.0% • BrowseComp:Sol Ultra 达到 92.2% • OSWorld 2.0:Sol 达到 62.6%,领先于 Opus 4.8 • Artificial Analysis Coding Agent Index:Sol 得分 80,领先于 Fable 5 • SEC-Bench Pro:Sol Ultra 达到 74.3%

但真正让这一切有趣的,是应用层:ChatGPT Work 可以从文档、Slack、Notion、Microsoft 365 和 Google Drive 中提取上下文,然后将这些混乱的上下文转化为实际输出:演示文稿、文档、电子表格、仪表盘、可视化图表和交互式解释。

Chubby♨️GPT-5.6 is here but also the long awayited Superapp the tl;dr The model side is impressive, but expected: GPT-5.6 Sol is strong across coding, browsing, cyber, ...
Chubby♨️ · @kimmonismus · X·2026-07-10 02:02·20天前
在 X 看原推· x.com
AI 摘要

OpenAI 推出 GPT-5.6 Sol,在编码、浏览、安全、科学、长上下文及智能体任务上表现强劲。多个基准测试中,Sol 以更少 tokens、更短时间或更低成本接近或刷新 SOTA:Agents' Last Exam 达 52.7%(超越 GPT-5.5、Claude Fable 5 等),Terminal-Bench 2.1 上 Sol Ultra 达 91.9%(高于 Claude Mythos 5 的 88.0%),BrowseComp 达 92.2%,OSWorld 2.0 达 62.6%,Coding Agent Index 得分 80,SEC-Bench Pro 达 74.3%。同时发布 ChatGPT Work,可从文档、Slack、Notion、Microsoft 365 及 Google Drive 拉取上下文,生成演示文稿、文档、电子表格、仪表盘、可视化及交互式解释。

正文 · AI 翻译

Live for me. And obv I keep the Codex logo

GPT-5.6 来了,同时还有期待已久的超级应用。

长话短说

模型层面令人印象深刻,但也在意料之中:GPT-5.6 Sol 在编程、浏览、网络安全、科学、长上下文和智能体工作方面表现强劲。在多项评测中,OpenAI 声称它要么创造了新的 SOTA,要么在消耗更少 token、更短时间或更低预估成本的情况下非常接近 SOTA。不过,它在多个基准测试中甚至超越了 Fable 5,当然不是在所有方面(见下文)。

一些值得关注的数字:

• Agents' Last Exam:GPT-5.6 Sol 达到 52.7%,领先于 GPT-5.5、Claude Fable 5 和 Opus 4.8 • Terminal-Bench 2.1:Sol Ultra 达到 91.9%,高于 Claude Mythos 5 报告的 88.0% • BrowseComp:Sol Ultra 达到 92.2% • OSWorld 2.0:Sol 达到 62.6%,领先于 Opus 4.8 • Artificial Analysis Coding Agent Index:Sol 得分 80,领先于 Fable 5 • SEC-Bench Pro:Sol Ultra 达到 74.3%

但真正让这一切有趣的,是应用层:ChatGPT Work 可以从文档、Slack、Notion、Microsoft 365 和 Google Drive 中提取上下文,然后将这些混乱的上下文转化为实际输出:演示文稿、文档、电子表格、仪表盘、可视化图表和交互式解释。

Chubby♨️GPT-5.6 is here but also the long awayited Superapp the tl;dr The model side is impressive, but expected: GPT-5.6 Sol is strong across coding, browsing, cyber, ...
在 X 查看原推x.com