OpenRouter:Announcements(RSS)
精选
60AI 编辑部评分,满分 100

Gemini 2.5 Flash API:定价、快速入门与提供商对比

2026-06-10 00:00· 68天前· OpenRouter
AI 导读

Gemini 2.5 Flash API 的定价与快速入门指南,指导用户配置 thinking budgets、比较不同提供商,并在 5 分钟内完成首次 API 调用。

推荐理由

Gemini 2.5 Flash 最值得关注的是 thinking budget,这篇教程把怎么用、怎么省都讲清楚了,但对早已熟悉文档的开发者来说新东西有限。

正文 · AI 翻译
Gemini 2.5 Flash API - Pricing, Quickstart & Provider Comparison
  • 什么是 Gemini 2.5 Flash?
  • Gemini 2.5 Flash API 定价
  • API 快速入门:5 分钟内完成首次请求
  • 思考预算:控制推理质量与成本
  • 跨提供商性能
  • Gemini 2.5 Flash vs Flash Lite vs Pro
  • 技术规格
  • 常见问题解答

什么是 Gemini 2.5 Flash?

Gemini 2.5 Flash 是谷歌面向需要推理能力的高并发、低延迟任务所推出的主力模型。它是首款内置思考能力的 Flash 级模型,具备一种可随时开启或关闭的混合推理模式。这一特性使其与 2.0 Flash 有本质区别,值得将其与成本高得多的模型进行对比评估。

关键能力

Gemini 2.5 Flash 支持以下输入类型:文本、代码、图像、音频、视频和文档。对于文档输入,在生产环境中有两项限制:每个文档的最大文件大小为 50MB(超过此限制的文件必须在提交前拆分为小于 50MB 的多个片段)。支持的文档 MIME 类型仅限于 `application/pdf` 和 `text/plain`。

它不支持的功能包括:音频生成、图像生成以及 Live API。如果你需要图像生成,请使用 Gemini 2.5 Flash Image,这是一个独立的模型。

“思考”在实际中意味着什么

思考预算是一个参数,用于控制模型在生成回复之前执行多少内部推理。这在推理过程中内置于模型架构中。将预算设置为 0 会完全禁用该功能,从而产生最快、最便宜的输出。将其设置为 -1 则启用动态模式,模型会根据提示词的复杂程度自动调整推理深度。在谷歌的直接 API 上,-1 是默认值。通过 OpenRouter 使用时,思考功能默认关闭,除非你明确请求开启(请参阅下文“通过 OpenRouter 配置”)。较高的固定预算会提高复杂任务的输出质量,但代价是增加延迟和 token 消耗,并按输出速率计费。

Gemini 2.5 Flash API 定价

下表展示了三种访问方式下每百万 token 的已验证费率。所有定价数据均来自 ai.google.dev/gemini-api/docs/pricing 和 openrouter.ai/google/gemini-2.5-flash。请根据撰写当日的实时页面验证 OpenRouter 和 Vertex AI 的数据;费率会随时更新,恕不另行通知。

验证日期:2026 年 5 月

提供商输入 $/1M输出 $/1M(含思考过程)缓存读取缓存存储音频输入
Google AI Studio(付费版)$0.30$2.50$0.03$1.00/M/小时$1.00
Vertex AI请参阅 Vertex AI 定价请参阅 Vertex AI 定价请参阅 Vertex AI 定价请参阅 Vertex AI 定价请参阅 Vertex AI 定价
OpenRouter$0.30$2.50$0.03请通过实时页面验证$1.00

截至 2026 年 5 月,Google AI Studio 的付费版和 OpenRouter 在文本输入和输出方面采用相同的每 token 费率。每个 token 的价格相同。两者的区别在于 API 调用周围所封装的服务。

OpenRouter 位于你的代码和 3 个 Google 提供商(AI Studio、Vertex Global、Vertex)之间。如果其中一个出现故障,你的请求会自动路由到健康的提供商。无需更改代码。

你的集成方案并非绑定在 Gemini 上。更改模型字符串,你就可以调用 Claude、GPT-4o、Llama 或 300 多个模型中的任何一个。使用相同的 base URL、相同的 SDK、相同的 API 密钥。无需重写客户端,即可在数秒内切换模型。

计费整合到一个仪表板:一张发票,一个 API 密钥,涵盖所有模型和提供商。无需再分别管理 Google、Anthropic 和 OpenAI 的独立账户。

对于将产品推向生产环境的团队,OpenRouter 提供了企业级控制功能(资源调配、按密钥设置消费限额、使用分析、团队管理)。防护栏和内容过滤可按请求进行配置,因此你可以强制执行安全策略,而无需构建自己的审核堆栈。提示词日志记录和可观测性功能已内置在仪表板中,用于调试生产流量。

OpenRouter 对按需付费(PAYG)的积分购买收取 5.5% 的平台费。这涵盖了上述的故障转移、路由、计费和工具。Google AI Studio 是直接路径,没有中间费用,但你需要自行处理故障转移、模型可移植性和跨提供商计费。Vertex AI 的定价不同;在将其纳入生产成本估算之前,请查看 Vertex AI 定价页面以了解当前费率。

关于各服务商提供的实时 Gemini 2.5 Flash 定价与可用性,包括实时缓存费率及各服务商的有效定价,请参见 OpenRouter 模型页面。关于可降低重复上下文成本的缓存策略,请参见缓存定价详情。

思考模型 token 计费

思考模型 token 按与输出 token 相同的费率计费。预算为 0 时,无思考成本。在最大预算(24,576 个 token)下,思考开销可能超过可见回复本身的成本。要估算特定工作负载的成本,请将预期的思考模型 token 数量乘以输出费率,并将其添加到标准输出 token 成本中。

免费使用选项

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和回复将被用于改进 Google 的产品;完整的数据使用政策请参见服务条款。如果您的使用场景涉及用户数据,或要求数据不得用于模型训练,则必须使用付费套餐。

OpenRouter 的免费套餐不包含 Gemini 2.5 Flash。需要至少 5 美元的信用余额。

Vertex AI 为新的 Google Cloud 账户提供 300 美元的试用额度,可用于评估期间的 Gemini 2.5 Flash 使用。

API 快速入门:5 分钟内发出首次请求

OpenRouter 路径无需 Google Cloud 账户,且兼容任何 OpenAI 兼容的 SDK。Google 直连路径需要 Google 账户和 google-genai SDK。更多 SDK 示例及配置选项,请参见 OpenRouter 快速入门指南。

步骤 1:获取您的 API 密钥

OpenRouter 路径:获取您的 OpenRouter API 密钥。无需 Google Cloud 账户。

Google 直连路径:在 aistudio.google.com/apikey 获取密钥。

步骤 2:设置基础 URL(OpenRouter 路径)

OpenRouter 基础 URL 为 https://openrouter.ai/api/v1。以下三个代码示例均使用此端点。

步骤 3:发出您的首次请求

cURL:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer <your-openrouter-key>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemini-2.5-flash",
    "messages": [{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
  }'

Python(OpenAI SDK):

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
)

print(response.choices[0].message.content)

TypeScript(OpenAI SDK):

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://openrouter.ai/api/v1",
  apiKey: "<your-openrouter-key>",
});

const response = await client.chat.completions.create({
  model: "google/gemini-2.5-flash",
  messages: [{ role: "user", content: "Explain the difference between attention mechanisms in transformers." }],
});

console.log(response.choices[0].message.content);

Google 直连路径

如果您已有 Google AI Studio API 密钥,并希望采用无中间服务的直连路径:

from google import genai

client = genai.Client(api_key="<your-google-api-key>")

response = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="Explain the difference between attention mechanisms in transformers.",
)

print(response.text)

直接路径使用 google-genai SDK,该 SDK 与 OpenAI 不兼容。从 OpenRouter 切换到直接路径需要同时更改客户端库和请求结构。直接路径上不存在供应商故障转移。

思考预算:控制推理质量与成本

思考预算是你使用此模型时最重要的配置决策。设置不当,要么为不需要的推理支付过多费用,要么在需要推理的任务上牺牲准确性。完整的参数参考,请参阅配置思考预算。

预算级别与权衡

在请求配置中设置 `thinkingBudget` 参数。其范围是 0 到 24,576 个模型 token。

预算为 0:禁用思考。响应最快,成本最低,无推理开销。适用于结构化推理非必需的高并发分类、信息提取和摘要任务。

预算为 -1(动态):模型根据提示词复杂度自动选择推理深度。这是 Google 直接 API 的默认设置。通过 OpenRouter,你必须显式地将 `max_tokens` 设置为 -1 才能启用动态模式;省略推理配置则会禁用思考。推荐用于大多数需要推理的工作负载;它能在简单提示词上避免支付高额推理费用,同时在任务需要时启用深度推理。

预算为 1,024 到 8,192:中等至重度推理。适用于多步骤分析、结构化编码任务和研究型问题。

预算为 24,576(最大值):最大推理深度,最高成本。适用于复杂数学、科学问题和硬编码挑战,在这些场景下,准确性足以证明高开销的合理性。

关键约束

如果你在编写第一个请求之前不了解以下两个约束,它们将在生产环境中导致错误:

  1. `thinkingBudget` 和 `thinkingLevel` 不能在同一请求中使用。`thinkingBudget` 适用于 Gemini 2.5 系列模型。`thinkingLevel` 适用于 Gemini 3 系列模型。同时使用两者会返回 400 错误。

  2. 结构化 JSON 输出和搜索接地(Search Grounding)是互斥的。你不能在同一请求中同时启用两者。

通过 OpenRouter 进行配置

使用带有 `reasoning` 键的 `extra_body` 参数,通过 OpenRouter 的 API 设置思考预算:

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Solve this step by step: if f(x) = 3x^2 + 2x - 5, find all roots."}],
    extra_body={"reasoning": {"max_tokens": 8192}}
)

print(response.choices[0].message.content)

要完全禁用思考功能,将 max_tokens 设为 0。要使用动态模式,将 max_tokens 设为 -1。

跨提供商性能

OpenRouter 通过三家 Google 提供商路由 Gemini 2.5 Flash,并实时追踪每家提供商的吞吐量、首 token 时间(TTFT)、端到端延迟和正常运行时间。各提供商之间的差异足以影响对延迟敏感型工作负载的提供商选择。

以下所有数据均需在 openrouter.ai/google/gemini-2.5-flash 页面进行实时验证。

各提供商性能

来源:OpenRouter 实时模型页面。

提供商平均吞吐量平均 TTFT平均端到端延迟正常运行时间
Google Vertex(全球)~75 tok/s~0.63s在实时页面验证在实时页面验证
Google AI Studio在实时页面验证在实时页面验证在实时页面验证在实时页面验证
Google Vertex在实时页面验证在实时页面验证在实时页面验证在实时页面验证

在近期数据中,Vertex Global 提供商显示出最高的吞吐量。AI Studio 历来拥有最佳的正常运行时间。Standard Vertex 是三者中延迟最高的。当您通过 OpenRouter 路由而未指定提供商时,它会根据实时信号自动将流量分配到最健康的选项。

如需了解 Gemini 2.5 Flash 的实时定价和正常运行时间,请参阅 OpenRouter 模型页面。

Gemini 2.5 Flash 对比 Flash Lite 对比 Pro

根据您的工作负载需求进行选择:

对于大多数智能体和推理工作负载,请使用 Gemini 2.5 Flash。当您需要思考能力但又不想产生 Pro 级别的成本时,这是默认推荐。

对于不需要思考功能且每次请求成本是主要限制条件的高容量分类、提取或翻译任务,请使用 Gemini 2.5 Flash Lite。Flash Lite 默认禁用思考功能。

对于复杂推理任务,当准确性足以证明其比 Flash 高出 5 到 10 倍的成本溢价是合理时,请使用 Gemini 2.5 Pro:前沿数学、硬编码挑战以及多步骤科学分析。

技术规格

下表是 Gemini 2.5 Flash 的权威参考。如需权威版本,请参阅 Google AI for Developers 模型页面(更新于 2026-04-01)和 Vertex AI 文档(更新于 2026-04-03)。

属性
模型 IDgemini-2.5-flash
OpenRouter 模型字符串google/gemini-2.5-flash
上下文窗口1,048,576 个模型 token
最大输出65,536 个模型 token
输入类型文本、图像、视频、音频、代码、文档(仅限 PDF 和纯文本,最大 50MB)
输出类型文本
思考预算范围0 到 24,576 个模型 token(默认值:动态 / -1)
知识截止日期2025 年 1 月
正式发布2025 年 6 月 17 日
停用时间2026 年 10 月 16 日
支持的功能函数调用、结构化输出、代码执行、搜索接地、批量 API、上下文缓存(隐式和显式)、文件搜索、URL 上下文
不支持音频生成、图像生成、实时 API、thinkingLevel 参数

弃用通知:Gemini 2.5 Flash 计划于 2026 年 10 月 16 日在 Vertex AI 上停用。如果您正在构建的生产用例会延续到该日期之后,请规划迁移到后续模型,并关注 ai.google.dev/gemini-api/docs/models 上的更新。

常见问题解答

Gemini 2.5 Flash 可以免费使用吗?

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和响应会被用于改进 Google 的产品;在将用户数据与之结合使用前,请先查阅服务条款。OpenRouter 不将 Gemini 2.5 Flash 包含在其免费套餐中;需要至少 5 美元的信用余额。Vertex AI 为新的 Google Cloud 账户提供 300 美元的试用额度。

Gemini 2.5 Flash 中的思考预算是什么?

thinkingBudget 参数(范围:0 到 24,576 个模型 token,或 -1 表示动态)控制模型在响应前进行多少内部推理。预算为 0 时禁用思考:速度最快、成本最低。预算为 -1 时启用动态模式:模型会根据提示词复杂度自动调整。在 Google 的直接 API 上,-1 是默认值。通过 OpenRouter 使用时,除非您明确请求,否则思考功能是关闭的(例如,使用 extra_body={"reasoning": {"max_tokens": -1}} 启用动态模式,或设置任何正数预算)。较高的固定预算可以提升复杂任务上的输出质量,但会增加延迟和成本,并按输出 token 费率计费。

Gemini 2.5 Flash 与 GPT-4o 相比如何?

Flash 支持 100 万 token 的上下文窗口,而 GPT-4o 为 12.8 万 token,并且包含 GPT-4o 所不具备的可配置思考功能。Flash 的每 token 定价更低。GPT-4o 拥有更广泛的第三方生态系统支持和更长的生产环境运行记录。本指南未发布两者在相同评测上的直接基准对比;请使用 OpenRouter 排行榜获取当前的第三方评测数据。

我能否使用 Gemini 2.5 Flash 进行图像生成?

不能。Gemini 2.5 Flash 仅输出文本。支持图像输入;该模型可以处理和理解图像。如需图像生成,请使用 Gemini 2.5 Flash Image,这是一个独立的模型,拥有自己的定价。

OpenRouter 上有哪些提供商提供 Gemini 2.5 Flash 服务?

三家:Google AI Studio、Google Vertex Global 和 Google Vertex。OpenRouter 会根据实时吞吐量和运行时间数据,自动路由到状态最佳的提供商。您可以使用 OpenRouter 的提供商路由控制功能,固定使用特定提供商。

Gemini 2.5 Flash 和 Flash Lite 有什么区别?

Flash 包含可配置思考功能(预算范围为 0 到 24,576)和更高质量的输出。Flash Lite 针对超低延迟和成本进行了优化,默认禁用思考功能(但可以启用)。当推理能力至关重要时,请使用 Flash;当每请求成本是主要限制因素的高吞吐量任务中,请使用 Lite。

来源:OpenRouter:Announcements(RSS) · openrouter.ai

事件后续 · 1查看事件全部 →

Gemini 2.5 Flash API:定价、快速入门与提供商对比

OpenRouter:Announcements(RSS)·2026-06-10 00:00·68天前·OpenRouter
AI 导读

Gemini 2.5 Flash API 的定价与快速入门指南,指导用户配置 thinking budgets、比较不同提供商,并在 5 分钟内完成首次 API 调用。

正文 · AI 翻译
Gemini 2.5 Flash API - Pricing, Quickstart & Provider Comparison
  • 什么是 Gemini 2.5 Flash?
  • Gemini 2.5 Flash API 定价
  • API 快速入门:5 分钟内完成首次请求
  • 思考预算:控制推理质量与成本
  • 跨提供商性能
  • Gemini 2.5 Flash vs Flash Lite vs Pro
  • 技术规格
  • 常见问题解答

什么是 Gemini 2.5 Flash?

Gemini 2.5 Flash 是谷歌面向需要推理能力的高并发、低延迟任务所推出的主力模型。它是首款内置思考能力的 Flash 级模型,具备一种可随时开启或关闭的混合推理模式。这一特性使其与 2.0 Flash 有本质区别,值得将其与成本高得多的模型进行对比评估。

关键能力

Gemini 2.5 Flash 支持以下输入类型:文本、代码、图像、音频、视频和文档。对于文档输入,在生产环境中有两项限制:每个文档的最大文件大小为 50MB(超过此限制的文件必须在提交前拆分为小于 50MB 的多个片段)。支持的文档 MIME 类型仅限于 `application/pdf` 和 `text/plain`。

它不支持的功能包括:音频生成、图像生成以及 Live API。如果你需要图像生成,请使用 Gemini 2.5 Flash Image,这是一个独立的模型。

“思考”在实际中意味着什么

思考预算是一个参数,用于控制模型在生成回复之前执行多少内部推理。这在推理过程中内置于模型架构中。将预算设置为 0 会完全禁用该功能,从而产生最快、最便宜的输出。将其设置为 -1 则启用动态模式,模型会根据提示词的复杂程度自动调整推理深度。在谷歌的直接 API 上,-1 是默认值。通过 OpenRouter 使用时,思考功能默认关闭,除非你明确请求开启(请参阅下文“通过 OpenRouter 配置”)。较高的固定预算会提高复杂任务的输出质量,但代价是增加延迟和 token 消耗,并按输出速率计费。

Gemini 2.5 Flash API 定价

下表展示了三种访问方式下每百万 token 的已验证费率。所有定价数据均来自 ai.google.dev/gemini-api/docs/pricing 和 openrouter.ai/google/gemini-2.5-flash。请根据撰写当日的实时页面验证 OpenRouter 和 Vertex AI 的数据;费率会随时更新,恕不另行通知。

验证日期:2026 年 5 月

提供商输入 $/1M输出 $/1M(含思考过程)缓存读取缓存存储音频输入
Google AI Studio(付费版)$0.30$2.50$0.03$1.00/M/小时$1.00
Vertex AI请参阅 Vertex AI 定价请参阅 Vertex AI 定价请参阅 Vertex AI 定价请参阅 Vertex AI 定价请参阅 Vertex AI 定价
OpenRouter$0.30$2.50$0.03请通过实时页面验证$1.00

截至 2026 年 5 月,Google AI Studio 的付费版和 OpenRouter 在文本输入和输出方面采用相同的每 token 费率。每个 token 的价格相同。两者的区别在于 API 调用周围所封装的服务。

OpenRouter 位于你的代码和 3 个 Google 提供商(AI Studio、Vertex Global、Vertex)之间。如果其中一个出现故障,你的请求会自动路由到健康的提供商。无需更改代码。

你的集成方案并非绑定在 Gemini 上。更改模型字符串,你就可以调用 Claude、GPT-4o、Llama 或 300 多个模型中的任何一个。使用相同的 base URL、相同的 SDK、相同的 API 密钥。无需重写客户端,即可在数秒内切换模型。

计费整合到一个仪表板:一张发票,一个 API 密钥,涵盖所有模型和提供商。无需再分别管理 Google、Anthropic 和 OpenAI 的独立账户。

对于将产品推向生产环境的团队,OpenRouter 提供了企业级控制功能(资源调配、按密钥设置消费限额、使用分析、团队管理)。防护栏和内容过滤可按请求进行配置,因此你可以强制执行安全策略,而无需构建自己的审核堆栈。提示词日志记录和可观测性功能已内置在仪表板中,用于调试生产流量。

OpenRouter 对按需付费(PAYG)的积分购买收取 5.5% 的平台费。这涵盖了上述的故障转移、路由、计费和工具。Google AI Studio 是直接路径,没有中间费用,但你需要自行处理故障转移、模型可移植性和跨提供商计费。Vertex AI 的定价不同;在将其纳入生产成本估算之前,请查看 Vertex AI 定价页面以了解当前费率。

关于各服务商提供的实时 Gemini 2.5 Flash 定价与可用性,包括实时缓存费率及各服务商的有效定价,请参见 OpenRouter 模型页面。关于可降低重复上下文成本的缓存策略,请参见缓存定价详情。

思考模型 token 计费

思考模型 token 按与输出 token 相同的费率计费。预算为 0 时,无思考成本。在最大预算(24,576 个 token)下,思考开销可能超过可见回复本身的成本。要估算特定工作负载的成本,请将预期的思考模型 token 数量乘以输出费率,并将其添加到标准输出 token 成本中。

免费使用选项

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和回复将被用于改进 Google 的产品;完整的数据使用政策请参见服务条款。如果您的使用场景涉及用户数据,或要求数据不得用于模型训练,则必须使用付费套餐。

OpenRouter 的免费套餐不包含 Gemini 2.5 Flash。需要至少 5 美元的信用余额。

Vertex AI 为新的 Google Cloud 账户提供 300 美元的试用额度,可用于评估期间的 Gemini 2.5 Flash 使用。

API 快速入门:5 分钟内发出首次请求

OpenRouter 路径无需 Google Cloud 账户,且兼容任何 OpenAI 兼容的 SDK。Google 直连路径需要 Google 账户和 google-genai SDK。更多 SDK 示例及配置选项,请参见 OpenRouter 快速入门指南。

步骤 1:获取您的 API 密钥

OpenRouter 路径:获取您的 OpenRouter API 密钥。无需 Google Cloud 账户。

Google 直连路径:在 aistudio.google.com/apikey 获取密钥。

步骤 2:设置基础 URL(OpenRouter 路径)

OpenRouter 基础 URL 为 https://openrouter.ai/api/v1。以下三个代码示例均使用此端点。

步骤 3:发出您的首次请求

cURL:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer <your-openrouter-key>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemini-2.5-flash",
    "messages": [{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
  }'

Python(OpenAI SDK):

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
)

print(response.choices[0].message.content)

TypeScript(OpenAI SDK):

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://openrouter.ai/api/v1",
  apiKey: "<your-openrouter-key>",
});

const response = await client.chat.completions.create({
  model: "google/gemini-2.5-flash",
  messages: [{ role: "user", content: "Explain the difference between attention mechanisms in transformers." }],
});

console.log(response.choices[0].message.content);

Google 直连路径

如果您已有 Google AI Studio API 密钥,并希望采用无中间服务的直连路径:

from google import genai

client = genai.Client(api_key="<your-google-api-key>")

response = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="Explain the difference between attention mechanisms in transformers.",
)

print(response.text)

直接路径使用 google-genai SDK,该 SDK 与 OpenAI 不兼容。从 OpenRouter 切换到直接路径需要同时更改客户端库和请求结构。直接路径上不存在供应商故障转移。

思考预算:控制推理质量与成本

思考预算是你使用此模型时最重要的配置决策。设置不当,要么为不需要的推理支付过多费用,要么在需要推理的任务上牺牲准确性。完整的参数参考,请参阅配置思考预算。

预算级别与权衡

在请求配置中设置 `thinkingBudget` 参数。其范围是 0 到 24,576 个模型 token。

预算为 0:禁用思考。响应最快,成本最低,无推理开销。适用于结构化推理非必需的高并发分类、信息提取和摘要任务。

预算为 -1(动态):模型根据提示词复杂度自动选择推理深度。这是 Google 直接 API 的默认设置。通过 OpenRouter,你必须显式地将 `max_tokens` 设置为 -1 才能启用动态模式;省略推理配置则会禁用思考。推荐用于大多数需要推理的工作负载;它能在简单提示词上避免支付高额推理费用,同时在任务需要时启用深度推理。

预算为 1,024 到 8,192:中等至重度推理。适用于多步骤分析、结构化编码任务和研究型问题。

预算为 24,576(最大值):最大推理深度,最高成本。适用于复杂数学、科学问题和硬编码挑战,在这些场景下,准确性足以证明高开销的合理性。

关键约束

如果你在编写第一个请求之前不了解以下两个约束,它们将在生产环境中导致错误:

  1. `thinkingBudget` 和 `thinkingLevel` 不能在同一请求中使用。`thinkingBudget` 适用于 Gemini 2.5 系列模型。`thinkingLevel` 适用于 Gemini 3 系列模型。同时使用两者会返回 400 错误。

  2. 结构化 JSON 输出和搜索接地(Search Grounding)是互斥的。你不能在同一请求中同时启用两者。

通过 OpenRouter 进行配置

使用带有 `reasoning` 键的 `extra_body` 参数,通过 OpenRouter 的 API 设置思考预算:

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Solve this step by step: if f(x) = 3x^2 + 2x - 5, find all roots."}],
    extra_body={"reasoning": {"max_tokens": 8192}}
)

print(response.choices[0].message.content)

要完全禁用思考功能,将 max_tokens 设为 0。要使用动态模式,将 max_tokens 设为 -1。

跨提供商性能

OpenRouter 通过三家 Google 提供商路由 Gemini 2.5 Flash,并实时追踪每家提供商的吞吐量、首 token 时间(TTFT)、端到端延迟和正常运行时间。各提供商之间的差异足以影响对延迟敏感型工作负载的提供商选择。

以下所有数据均需在 openrouter.ai/google/gemini-2.5-flash 页面进行实时验证。

各提供商性能

来源:OpenRouter 实时模型页面。

提供商平均吞吐量平均 TTFT平均端到端延迟正常运行时间
Google Vertex(全球)~75 tok/s~0.63s在实时页面验证在实时页面验证
Google AI Studio在实时页面验证在实时页面验证在实时页面验证在实时页面验证
Google Vertex在实时页面验证在实时页面验证在实时页面验证在实时页面验证

在近期数据中,Vertex Global 提供商显示出最高的吞吐量。AI Studio 历来拥有最佳的正常运行时间。Standard Vertex 是三者中延迟最高的。当您通过 OpenRouter 路由而未指定提供商时,它会根据实时信号自动将流量分配到最健康的选项。

如需了解 Gemini 2.5 Flash 的实时定价和正常运行时间,请参阅 OpenRouter 模型页面。

Gemini 2.5 Flash 对比 Flash Lite 对比 Pro

根据您的工作负载需求进行选择:

对于大多数智能体和推理工作负载,请使用 Gemini 2.5 Flash。当您需要思考能力但又不想产生 Pro 级别的成本时,这是默认推荐。

对于不需要思考功能且每次请求成本是主要限制条件的高容量分类、提取或翻译任务,请使用 Gemini 2.5 Flash Lite。Flash Lite 默认禁用思考功能。

对于复杂推理任务,当准确性足以证明其比 Flash 高出 5 到 10 倍的成本溢价是合理时,请使用 Gemini 2.5 Pro:前沿数学、硬编码挑战以及多步骤科学分析。

技术规格

下表是 Gemini 2.5 Flash 的权威参考。如需权威版本,请参阅 Google AI for Developers 模型页面(更新于 2026-04-01)和 Vertex AI 文档(更新于 2026-04-03)。

属性
模型 IDgemini-2.5-flash
OpenRouter 模型字符串google/gemini-2.5-flash
上下文窗口1,048,576 个模型 token
最大输出65,536 个模型 token
输入类型文本、图像、视频、音频、代码、文档(仅限 PDF 和纯文本,最大 50MB)
输出类型文本
思考预算范围0 到 24,576 个模型 token(默认值:动态 / -1)
知识截止日期2025 年 1 月
正式发布2025 年 6 月 17 日
停用时间2026 年 10 月 16 日
支持的功能函数调用、结构化输出、代码执行、搜索接地、批量 API、上下文缓存(隐式和显式)、文件搜索、URL 上下文
不支持音频生成、图像生成、实时 API、thinkingLevel 参数

弃用通知:Gemini 2.5 Flash 计划于 2026 年 10 月 16 日在 Vertex AI 上停用。如果您正在构建的生产用例会延续到该日期之后,请规划迁移到后续模型,并关注 ai.google.dev/gemini-api/docs/models 上的更新。

常见问题解答

Gemini 2.5 Flash 可以免费使用吗?

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和响应会被用于改进 Google 的产品;在将用户数据与之结合使用前,请先查阅服务条款。OpenRouter 不将 Gemini 2.5 Flash 包含在其免费套餐中;需要至少 5 美元的信用余额。Vertex AI 为新的 Google Cloud 账户提供 300 美元的试用额度。

Gemini 2.5 Flash 中的思考预算是什么?

thinkingBudget 参数(范围:0 到 24,576 个模型 token,或 -1 表示动态)控制模型在响应前进行多少内部推理。预算为 0 时禁用思考:速度最快、成本最低。预算为 -1 时启用动态模式:模型会根据提示词复杂度自动调整。在 Google 的直接 API 上,-1 是默认值。通过 OpenRouter 使用时,除非您明确请求,否则思考功能是关闭的(例如,使用 extra_body={"reasoning": {"max_tokens": -1}} 启用动态模式,或设置任何正数预算)。较高的固定预算可以提升复杂任务上的输出质量,但会增加延迟和成本,并按输出 token 费率计费。

Gemini 2.5 Flash 与 GPT-4o 相比如何?

Flash 支持 100 万 token 的上下文窗口,而 GPT-4o 为 12.8 万 token,并且包含 GPT-4o 所不具备的可配置思考功能。Flash 的每 token 定价更低。GPT-4o 拥有更广泛的第三方生态系统支持和更长的生产环境运行记录。本指南未发布两者在相同评测上的直接基准对比;请使用 OpenRouter 排行榜获取当前的第三方评测数据。

我能否使用 Gemini 2.5 Flash 进行图像生成?

不能。Gemini 2.5 Flash 仅输出文本。支持图像输入;该模型可以处理和理解图像。如需图像生成,请使用 Gemini 2.5 Flash Image,这是一个独立的模型,拥有自己的定价。

OpenRouter 上有哪些提供商提供 Gemini 2.5 Flash 服务?

三家:Google AI Studio、Google Vertex Global 和 Google Vertex。OpenRouter 会根据实时吞吐量和运行时间数据,自动路由到状态最佳的提供商。您可以使用 OpenRouter 的提供商路由控制功能,固定使用特定提供商。

Gemini 2.5 Flash 和 Flash Lite 有什么区别?

Flash 包含可配置思考功能(预算范围为 0 到 24,576)和更高质量的输出。Flash Lite 针对超低延迟和成本进行了优化,默认禁用思考功能(但可以启用)。当推理能力至关重要时,请使用 Flash;当每请求成本是主要限制因素的高吞吐量任务中,请使用 Lite。

来源:OpenRouter:Announcements(RSS)· openrouter.ai

事件后续 · 1查看事件全部 →