# Response Caching：相同请求零成本

- 来源：OpenRouter：Announcements（RSS）
- 作者：Brian Thomas
- 发布时间：2026-05-01 02:00
- AIHOT 分数：59
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmor004i8006nslix34g3z3e2
- 原文链接：https://openrouter.ai/announcements/response-caching

## 精选理由

OpenRouter 这次更新的响应缓存，直接让相同请求免费用，对频繁调用的场景是个省钱加速的好功能，用过 API 的人都能立刻明白它的价值。

## AI 摘要

新推出的 Response Caching 头部实现了 API 请求的缓存机制，完全相同的请求可获得缓存响应，响应时间大幅缩短至微乎其微的水平，且不会产生额外成本。该功能通过自动识别并复用已生成的响应，显著提升了重复请求的处理效率。

## 正文

它的作用 将响应时间从秒级降至毫秒级 通过请求头或预设配置启用 在大多数生成端点现已可用

您现在可以在聊天补全、响应、消息或嵌入向量请求中添加 `X-OpenRouter-Cache: true`，以开始缓存完全相同的调用。首次调用会访问模型提供商并按正常标准计费。此后每次完全相同的调用都会在极短时间内返回相同响应，且不产生任何模型 token 费用。

它的作用

响应缓存位于模型提供商之前。当您发送启用缓存的请求时，OpenRouter 会将请求体、模型、API 密钥和流式模式哈希成一个缓存键。如果之前有过完全相同的请求且尚未过期，则立即返回缓存的响应。无需调用提供商，不消耗模型 token，不产生费用。

流式和非流式请求均可使用。缓存的流式响应会通过相同管道重放，因此您的客户端代码无需更改。文本、图像、音频、文档和工具调用均可正常缓存。多模态输入（base64 图像、音频片段、文件附件）也会包含在缓存键哈希中。一个注意事项：因内部处理而被卸载的极大多模态负载不适用缓存。标准大小的请求可以正常缓存。

响应缓存与提示词缓存是分开的。提示词缓存（许多提供商原生支持）可在消息共享共同前缀时降低提示词部分的成本。而响应缓存则完全绕过提供商，直接从 OpenRouter 的边缘缓存返回完整响应。

将响应时间从秒级降至毫秒级

缓存的响应在 80-300 毫秒内返回，其中大部分时间是序列化和网络传输。缓存查找本身平均耗时 4 毫秒。作为对比，一个典型的未缓存请求发送给 Gemini 2.5 Flash 大约需要 1.3 秒，Kimi K2.6 需要 4.6 秒，GPT-5.5 需要 9.1 秒。缓存命中按零计费：不产生提示词 token、补全 token，无任何费用。

通过请求头或预设配置启用

在您希望启用缓存的每个 API 调用中添加 `X-OpenRouter-Cache: true` 请求头：

curl https://openrouter.ai/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -H "X-OpenRouter-Cache: true" \ -d '{ "model": "google/gemini-2.5-flash", "messages": [{"role": "user", "content": "What is the meaning of life?"}] }'

预设。通过在预设配置中设置 `cache_enabled: true`，可为使用特定预设的所有请求启用缓存。单个请求无需添加标头。

您可以通过 `X-OpenRouter-Cache-TTL` 控制响应的缓存时长（1 秒至 24 小时，默认 5 分钟）。需要全新响应？发送 `X-OpenRouter-Cache-Clear: true` 即可清除该特定请求的缓存。

响应标头会告知您缓存状态：`X-OpenRouter-Cache-Status: HIT` 或 `MISS`，外加 `X-OpenRouter-Cache-Age` 和 `X-OpenRouter-Cache-TTL`，让您精确了解缓存运行情况。

最适用的场景

智能体重试。当智能体工作流中途失败时，您可以从头开始重试。已缓存的步骤会即时返回且不产生费用，因此您只需为新的工作付费。

测试套件。反复运行基于大语言模型的测试，无需消耗模型 token。首次运行填充缓存后，后续运行将具有确定性和免费性。

重复上下文处理。如果您的应用向同一模型发送相同的提示词（相同的系统提示词、相同的用户输入、相同的参数），则只有首次调用会产生费用。

现已适用于大多数生成端点

缓存范围限定在您的 API 密钥内。不同的密钥（即使属于同一账户）不会共享缓存条目。

该功能适用于 `/chat/completions`、`/responses`、`/messages` 和 `/embeddings` 端点。其他端点——旧版 `/completions`、`/audio/speech`（TTS）、`/audio/transcriptions`（STT）、`/rerank` 以及视频生成——暂不支持。该功能目前处于测试阶段，我们正在观察其表现，之后才会锁定 API 接口。

缓存命中不计入提供商速率限制（因为请求从未到达提供商），并且在您的活动日志中会显示缓存指示器，便于监控。

完整详情请参阅文档。
