Live for me. And obv I keep the Codex logo
GPT-5.6 来了,同时还有期待已久的超级应用。
长话短说
模型层面令人印象深刻,但也在意料之中:GPT-5.6 Sol 在编程、浏览、网络安全、科学、长上下文和智能体工作方面表现强劲。在多项评测中,OpenAI 声称它要么创造了新的 SOTA,要么在消耗更少 token、更短时间或更低预估成本的情况下非常接近 SOTA。不过,它在多个基准测试中甚至超越了 Fable 5,当然不是在所有方面(见下文)。
一些值得关注的数字:
• Agents' Last Exam:GPT-5.6 Sol 达到 52.7%,领先于 GPT-5.5、Claude Fable 5 和 Opus 4.8 • Terminal-Bench 2.1:Sol Ultra 达到 91.9%,高于 Claude Mythos 5 报告的 88.0% • BrowseComp:Sol Ultra 达到 92.2% • OSWorld 2.0:Sol 达到 62.6%,领先于 Opus 4.8 • Artificial Analysis Coding Agent Index:Sol 得分 80,领先于 Fable 5 • SEC-Bench Pro:Sol Ultra 达到 74.3%
但真正让这一切有趣的,是应用层:ChatGPT Work 可以从文档、Slack、Notion、Microsoft 365 和 Google Drive 中提取上下文,然后将这些混乱的上下文转化为实际输出:演示文稿、文档、电子表格、仪表盘、可视化图表和交互式解释。