# OpenAI 发布 GPT-5.6 Sol 及 ChatGPT Work

- 来源：Chubby♨️ (@kimmonismus)
- 发布时间：2026-07-10 02:02
- AIHOT 分数：76
- AIHOT 链接：https://aihot.virxact.com/items/cmrdu31g6076nih4bh9hcaggv
- 原文链接：https://x.com/kimmonismus/status/2075279334852448371

## AI 摘要

OpenAI 推出 GPT-5.6 Sol，在编码、浏览、安全、科学、长上下文及智能体任务上表现强劲。多个基准测试中，Sol 以更少 tokens、更短时间或更低成本接近或刷新 SOTA：Agents' Last Exam 达 52.7%（超越 GPT-5.5、Claude Fable 5 等），Terminal-Bench 2.1 上 Sol Ultra 达 91.9%（高于 Claude Mythos 5 的 88.0%），BrowseComp 达 92.2%，OSWorld 2.0 达 62.6%，Coding Agent Index 得分 80，SEC-Bench Pro 达 74.3%。同时发布 ChatGPT Work，可从文档、Slack、Notion、Microsoft 365 及 Google Drive 拉取上下文，生成演示文稿、文档、电子表格、仪表盘、可视化及交互式解释。

## 正文

Live for me. And obv I keep the Codex logo

GPT-5.6 来了，同时还有期待已久的超级应用。

长话短说

模型层面令人印象深刻，但也在意料之中：GPT-5.6 Sol 在编程、浏览、网络安全、科学、长上下文和智能体工作方面表现强劲。在多项评测中，OpenAI 声称它要么创造了新的 SOTA，要么在消耗更少 token、更短时间或更低预估成本的情况下非常接近 SOTA。不过，它在多个基准测试中甚至超越了 Fable 5，当然不是在所有方面（见下文）。

一些值得关注的数字：

• Agents' Last Exam：GPT-5.6 Sol 达到 52.7%，领先于 GPT-5.5、Claude Fable 5 和 Opus 4.8 • Terminal-Bench 2.1：Sol Ultra 达到 91.9%，高于 Claude Mythos 5 报告的 88.0% • BrowseComp：Sol Ultra 达到 92.2% • OSWorld 2.0：Sol 达到 62.6%，领先于 Opus 4.8 • Artificial Analysis Coding Agent Index：Sol 得分 80，领先于 Fable 5 • SEC-Bench Pro：Sol Ultra 达到 74.3%

但真正让这一切有趣的，是应用层：ChatGPT Work 可以从文档、Slack、Notion、Microsoft 365 和 Google Drive 中提取上下文，然后将这些混乱的上下文转化为实际输出：演示文稿、文档、电子表格、仪表盘、可视化图表和交互式解释。

### 引用推文

> Chubby♨️：GPT-5.6 is here but also the long awayited Superapp the tl;dr The model side is impressive, but expected: GPT-5.6 Sol is strong across coding, browsing, cyber, ...
