IT之家(RSS)
57AI 编辑部评分,满分 100

OpenAI 部署 GPT-5.6 Sol 优化自身推理性能,端到端服务成本最多降低 20%

2026-07-30 14:06· 13天前
AI 导读

OpenAI 通过 GPT-5.6 Sol 模型优化 GPT-5.6 系列自身的 AI 推理链路,使端到端服务成本最多降低 20%。该模型利用 Codex 分析生产流量、识别负载失衡并自主改写 GPU 内核,同时优化推测性解码,使 token 生成效率提升超过 15%。OpenAI 还使用开源工具 FpSan 验证 GPT-5.6 Sol 编写内核的正确性。

IT之家 7 月 30 日消息,OpenAI 公司昨日(7 月 29 日)发布博文,宣布通过 GPT-5.6 Sol 模型,来优化 GPT-5.6 系列模型本身 AI 推理链路,端到端服务成本最多降低 20%。

OpenAI 于 7 月 9 日推出其最强 AI 模型 GPT-5.6 系列,在后续的架构优化过程中,官方团队利用 GPT-5.6 Sol 模型来优化自身运行效率,降低计算成本、提高 GPU 利用效率。

OpenAI 公司称,系统会按地域、可用容量和加速器类型分配请求;集群内部还会参考负载、上下文长度、缓存可用性等因素分发任务。GPT‑5.6 Sol 通过 Codex 分析生产流量、识别负载失衡来源、测试路由策略并调整启发式规则。

在模型前向传播环节,GPT‑5.6 Sol 识别可预计算、可避免或可并行的工作,并通过 Codex 自主改写和优化生产环境中的 GPU 内核。IT之家附上相关截图如下:

团队让 GPT-5.6 Sol 模型学习 Triton 和 Gluon 两种编程语言,让模型据此优化推理引擎内核,使生产环境 GPU 内核带来的端到端服务成本最多降低 20%。

OpenAI 还使用开源工具 FpSan(浮点数清理器)验证 GPT‑5.6 Sol 编写内核的正确性。

OpenAI 还让 GPT-5.6 Sol 优化推测性解码(speculative decoding)。这项推理加速技术由较小的草稿模型预测下一个 token,再由主模型验证或修正预测结果。OpenAI 在 2026 年 7 月 29 日的公开帖文中称,改进后 token 生成效率提升超过 15%。

来源:IT之家(RSS) · ithome.com

OpenAI 部署 GPT-5.6 Sol 优化自身推理性能,端到端服务成本最多降低 20%

IT之家(RSS)·2026-07-30 14:06·13天前
AI 导读

OpenAI 通过 GPT-5.6 Sol 模型优化 GPT-5.6 系列自身的 AI 推理链路,使端到端服务成本最多降低 20%。该模型利用 Codex 分析生产流量、识别负载失衡并自主改写 GPU 内核,同时优化推测性解码,使 token 生成效率提升超过 15%。OpenAI 还使用开源工具 FpSan 验证 GPT-5.6 Sol 编写内核的正确性。

IT之家 7 月 30 日消息,OpenAI 公司昨日(7 月 29 日)发布博文,宣布通过 GPT-5.6 Sol 模型,来优化 GPT-5.6 系列模型本身 AI 推理链路,端到端服务成本最多降低 20%。

OpenAI 于 7 月 9 日推出其最强 AI 模型 GPT-5.6 系列,在后续的架构优化过程中,官方团队利用 GPT-5.6 Sol 模型来优化自身运行效率,降低计算成本、提高 GPU 利用效率。

OpenAI 公司称,系统会按地域、可用容量和加速器类型分配请求;集群内部还会参考负载、上下文长度、缓存可用性等因素分发任务。GPT‑5.6 Sol 通过 Codex 分析生产流量、识别负载失衡来源、测试路由策略并调整启发式规则。

在模型前向传播环节,GPT‑5.6 Sol 识别可预计算、可避免或可并行的工作,并通过 Codex 自主改写和优化生产环境中的 GPU 内核。IT之家附上相关截图如下:

团队让 GPT-5.6 Sol 模型学习 Triton 和 Gluon 两种编程语言,让模型据此优化推理引擎内核,使生产环境 GPU 内核带来的端到端服务成本最多降低 20%。

OpenAI 还使用开源工具 FpSan(浮点数清理器)验证 GPT‑5.6 Sol 编写内核的正确性。

OpenAI 还让 GPT-5.6 Sol 优化推测性解码(speculative decoding)。这项推理加速技术由较小的草稿模型预测下一个 token,再由主模型验证或修正预测结果。OpenAI 在 2026 年 7 月 29 日的公开帖文中称,改进后 token 生成效率提升超过 15%。

来源:IT之家(RSS)· ithome.com