# OpenAI 更新 2.1 系列 GPT Realtime AI 模型，p95 延迟至少降低 25%

- 来源：IT之家（RSS）
- 发布时间：2026-07-08 14:24
- AIHOT 分数：53
- AIHOT 链接：https://aihot.virxact.com/items/cmrbqumg206f0ihl1x0mw8e6n
- 原文链接：https://www.ithome.com/0/974/021.htm

## AI 摘要

OpenAI 7 月 7 日发布 gpt-realtime-2.1 和 gpt-realtime-2.1-mini 两款 Realtime 模型，通过优化缓存使 p95 延迟至少下降 25%。gpt-realtime-2.1-mini 支持实时音频与文本输入、工具调用与函数调用，可在执行前内部推理。gpt-realtime-2.1 增强字母数字识别、静音噪声处理、中断处理、指令遵循及可配置推理强度（minimal/low/medium/high/xhigh 五档，默认 low）。价格方面，2.1 文本输入每百万 tokens 4 美元，音频输入 32 美元，输出 64 美元；mini 对应价格更低。

## 正文

IT之家 7 月 8 日消息，OpenAI 昨日（7 月 7 日）发布公告，宣布在其 API 调用中，新增 gpt-realtime-2.1 和 gpt-realtime-2.1-mini 两款模型，官方表示 p95 延迟至少下降 25%。

IT之家注：p95 延迟（Percentile 95 Delay）是衡量系统速度的重要指标，表明系统 95% 的请求都比这个时间快。

这两款模型主要面向低延迟语音智能体与多模态交互，OpenAI 官方表示通过优化缓存机制，Realtime 语音模型的 p95 延迟至少下降 25%。

在调用价格方面，上述两款模型的费用如下：

gpt-realtime-2.1

文本：

每 100 万 Tokens 输入费用为 4 美元，缓存输入为 0.40 美元

每 100 万 Tokens 输出费用为 24 美元

音频：

每 100 万 Tokens 输入费用为 32 美元，缓存输入为 0.40 美元

每 100 万 Tokens 输出费用为 64 美元

图片：

每 100 万 Tokens 输入费用为 5 美元，缓存输入为 0.50 美元

gpt-realtime-2.1-mini 模型

文本：

每 100 万 Tokens 输入费用为 0.6 美元，缓存输入为 0.06 美元

每 100 万 Tokens 输出费用为 2.4 美元

音频：

每 100 万 Tokens 输入费用为 10 美元，缓存输入为 0.30 美元

每 100 万 Tokens 输出费用为 20 美元

图片：

每 100 万 Tokens 输入费用为 0.8 美元，缓存输入为 0.08 美元

能力方面，gpt-realtime-2.1-mini 支持实时音频与文本输入，也支持工具调用（Tool Use）与函数调用（Function Calling）。

报道显示，该模型可在执行动作前先完成内部推理，并通过口头前置说明保持对话连续。gpt-realtime-2.1 则进一步增强字母数字识别、静音与噪声处理、中断处理、指令遵循和可配置推理强度方面。

推理强度支持 minimal、low、medium、high、xhigh 5 档。默认档位为 low，OpenAI 建议生产环境语音代理先从低档开始。
