# OpenAI 发布 GPT-5.6 模型家族：Sol、Terra 与 Luna

- 来源：OpenAI：官网动态（RSS · 排除企业/客户案例）
- 发布时间：2026-07-29 08:00
- AIHOT 分数：77
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms6i9q2n044erohzw2w8750m
- 原文链接：https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency

## 精选理由

GPT-5.6不是一次常规升级，Sol以不到一半的成本超越Claude Fable 5，对API成本敏感的开发者是实质性利好，效率优化从底层内核到推理全栈都有体现。

## AI 摘要

OpenAI 发布 GPT-5.6 模型家族，旗舰款 Sol 开启最大推理时在 Artificial Analysis Coding Agent Index 上超越 Claude Fable 5，成本不到后者一半。Terra 智能持平 GPT-5.5 但价格减半，Luna 定价比 Sol 低 80%。该系列通过负载均衡、推测解码等全栈优化实现更高 token 效率。

## 正文

我们设计 GPT‑5.6 模型系列，旨在平衡用户使用我们模型完成各类任务时的能力与成本。我们的旗舰模型 GPT‑5.6 Sol 在启用最大推理能力时，在 Artificial Analysis 编程智能体指数上的表现优于 Claude Fable 5，而成本不到后者的一半。Terra 在智能基准测试中表现与 GPT‑5.5 相当，价格却只有一半；Luna 是我们最快且最经济的模型，定价比 Sol 低 80%。为了实现这些效率优势，我们的研究和技术团队在技术栈的每一个主要层面都进行了重大优化。这些改进涵盖了我们的模型、推理（即我们运行模型以生成输出的方式），以及我们的智能体框架——该框架同时被 Codex 和 ChatGPT Work 所使用。

过去四年间，随着我们的模型规模扩展到 10 亿活跃用户和超过 200 万家企业，效率一直是让智能惠及所有人的核心。我们的使命是确保通用人工智能造福全人类。这些年来，我们持续努力在技术栈中解锁更大的优化空间，从而在成本-智能曲线的每一个节点上提供性能最强的模型。通过 GPT‑5.6，我们实现了迄今为止最高的每 token 智能效率——该模型经过训练，能够在每个 token 上完成更多工作。在训练过程中，我们同时优化任务成功率和效率，引导模型在完成任务时走更直接的路径。

本文将目光投向模型本身之外，分享我们如何通过技术栈另外两个主要部分的进步来实现效率提升，包括：1）推理方面，通过优化负载均衡、推测解码、缓存和内核优化等流程，从相同硬件中获得更多输出；2）我们的智能体框架，包括更好地管理上下文膨胀、工具使用和重复工作。我们还将介绍 GPT‑5.6 Sol 在自主实现其中多项增益方面所发挥的作用。虽然任何单独的改进看起来可能有限，但这些成果相互叠加，使我们能够在智能与效率的前沿同时取得突破。

利用 GPT‑5.6 Sol 加速推理

在算力受限的世界里，模型需求的增长速度已超过算力供给，效率成为每个系统设计的核心。这一点在我们的推理栈中尤为突出——推理栈负责运行已训练的模型以生成回复。我们的首要目标是在保持用户所期望的智能水平、延迟、可用性和可靠性的前提下，用同样的硬件服务更多模型 token。

实现这一目标需要优化整个系统。一个模型单独运行时可能效率极高，但如果请求分配不均、硬件闲置或数据传输拖慢计算速度，其服务成本依然高昂。每一层的改进都会产生叠加效应，收益来自路由（请求发送到哪里）、调度（请求何时发送）、内核（在 GPU 上运行的软件）、缓存（保存并复用的计算结果）以及模型实现（GPU 代码的执行顺序）等方面的优化。GPT‑5.6 Sol in Codex 在这些优化中发挥了关键作用。

第一个重要示例是负载均衡。在全球层面，我们根据地理位置、可用容量和加速器类型（运行模型的 GPU 或专用芯片类型）等因素来路由请求。在集群内部，我们根据负载、上下文长度、缓存可用性及其他请求属性，将工作分配到各个模型实例。在每个实例内部，工作还需在加速器、模型子网络和计算核心之间高效分配。GPT‑5.6 Sol in Codex 帮助我们分析生产流量、识别之前被忽视的不均衡来源、测试新的路由策略，并持续调整这些启发式规则。仅这些负载均衡的改进就大幅降低了我们模型的服务成本。

我们还使用了 GPT‑5.6 Sol 来优化模型的前向传播过程：即把输入转换为下一个 token 预测的计算过程。即使单个操作速度很快，过多的内存移动、同步操作以及低效的数据布局仍可能导致 GPU 闲置。为避免这种情况，GPT‑5.6 Sol 找到了可以预计算、避免或并行化的工作。借助 Codex，GPT‑5.6 Sol 自主重写并优化了我们的生产级内核——即执行构成模型数学运算的核心代码。这之所以有效，部分原因在于我们训练了 GPT‑5.6，使其能够高效地编写和优化基于 Triton 和 Gluon 的内核，这两种开源 GPU 编程语言均由 OpenAI 维护。这些努力，加上 GPT‑5.6 Sol 带来的更广泛内核改进，使端到端服务成本降低了 20%。我们还大力投资了验证工具，例如开源工具 FpSan（浮点消毒器），以帮助验证 GPT‑5.6 Sol 所编写内核的正确性。

推测解码是提升速度和效率的另一个手段。该技术涉及在主模型旁运行一个较小的草稿（或称“推测器”）模型，由它提出多个 token，供主模型并行验证。当这些提议被接受时，系统只需一次主模型前向传播即可生成多个输出 token，从而减少昂贵的顺序计算量。GPT‑5.6 Sol 通过对其自身草稿模型的架构设计并运行数百次实验，测试了大小、结构和特性方面的变化，从而改进了该草稿模型。此外，GPT‑5.6 Sol 还启动并监控了推测器的训练过程，在出现硬件故障和训练不稳定等问题时自主进行干预。由此带来的改进使 token 生成效率提升了超过 15%。

在处理未缓存的输入 token 时，模型会通过一次计算密集型的传递来构建键值（KV）缓存；在生成输出时，则会反复读取并扩展该缓存。服务于推理的最佳配置——例如批处理、分片和 KV 管理——在很大程度上取决于工作负载：提示词和输出长度、批大小、缓存命中率、查询特征等。然而，此前配置空间过于庞大，无法进行系统调优，迫使工程师依赖宽泛的启发式规则。借助 Codex 中的 GPT‑5.6 Sol，我们能够分析生产工作负载、生成并评估候选配置，从而对引擎和模型针对每种场景的配置方式进行超优化。这使得一种全新级别的工作负载特定优化成为可能，能够从相同硬件中提取出更多有用的推理能力。

推理优化是一个持续的反馈循环。我们衡量生产行为，识别最大的差距，实施改进，并验证这些改进能够提升整个系统，而非仅仅优化某个孤立的基准测试。GPT‑5.6 Sol 和 Codex 加速了这一循环的每一个环节。这意味着我们的团队可以探索更多想法，更快地响应不断变化的工作负载，并构建一个延迟更低、容量更大、成本更低的推理栈，最终惠及用户。

我们的智能体编排如何简化重复性工作

ChatGPT Work 和 Codex 通过一系列模型请求和工具调用来完成复杂任务。在单次交互轮次中——从用户请求到最终响应——Codex 可能会检查源代码、搜索部署历史、读取事件报告、编辑文件并运行测试。每一步都可能需要一次请求。

准备上下文、传输数据、运行推理、调用工具以及启动进程，都需要时间和算力。如果一个任务需要 30 次模型请求，那么每次请求多花一秒钟，累积起来就相当可观。提升整体性能意味着减少整个系统中的重复性工作，而不仅仅是让模型变得更快。

一次用户交互轮次可能包含多次模型和工具的迭代。重复区域内的任何开销都可能被多次付出。

这些乘数指导了我们如何设计智能体编排层（agentic harness），这是一个用 Rust 编写的编排层，用于连接我们的模型、工具和用户环境。接下来，我们将介绍如何通过避免上下文膨胀、加载工具以及复用工作成果，让每次请求都更加高效。

避免上下文膨胀

随着智能体被授予更多工具、技能、插件和对话历史记录的访问权限，上下文窗口很容易膨胀。这会增加成本、分散模型注意力，并引发不必要的推理。编排层可以通过延迟发现机制来减少这种开销，该机制使得集成、自定义 MCP 工具、技能和插件仅在需要时才可被调用。编排层还能防止单个工具和 MCP 集成意外消耗上下文窗口。默认情况下，工具输出上限为 10,000 个 token，除非模型请求不同的限制。

保留精确前缀以实现提示词缓存

如前所述，智能体循环可以在单次交互中多次向 GPU 发送相同的指令、对话历史记录、工具定义和先前结果。处理这些重复输入的代价很高，因此提示词缓存会复用与先前处理过的提示词前缀相关的计算。为了保留该前缀，编排层将所有模型可见的历史记录视为仅追加：新消息、工具结果和环境更新都添加在末尾，而不是插入到更早的上下文中。工具也以确定的顺序呈现，而运行时设置（如审批策略）则在执行期间应用，而非嵌入到工具定义中。这种设计选择有助于 Codex 和 ChatGPT Work 实现较高的整体提示词缓存命中率。

增量传输改变了网络传输的内容；提示词缓存改变了模型可能避免重新计算的内容。宽度是概念性的，额外的压缩层未在图中显示。

跨越智能曲线的效率

GPT-5.6 带来的效率提升，是多年来在研究、推理以及智能体框架等全栈领域持续改进的成果。GPT-5.6 在实现其中许多改进方面所发挥的作用，让我们对优化步伐将加速的前景感到乐观。我们将继续在诸如内核优化等领域进行更大程度的优化，同时对我们整个技术栈进行基础性改进。我们期待将这些持续进行的底层改进，以更广泛可用、更具成本效益的智能形式，回馈给我们的用户和客户。

特别感谢技术团队成员 Matthew Ferrari、Philippe Tillet、Ahmed Ibrahim、Joe Gershenson 和 Steve Coffey 对本文的贡献。

Matthew Ferrari、Phil Tillet、Ahmed Ibrahim、Joe Gershenson、Steve Coffey
