OpenRouter:Announcements(RSS)
精选
64AI 编辑部评分,满分 100

Gemini 2.5 Flash API - 定价、快速入门与提供商比较

2026-06-10 00:00· 68天前
AI 导读

Gemini 2.5 Flash API 支持配置思考预算(thinking budgets),用户可跨提供商进行比较,并在5分钟内完成首次API调用。

推荐理由

这是 OpenRouter 上接入 Gemini 2.5 Flash 的保姆级指南,把三家 Google 提供商的延迟和定价差异摆在明面上,需要做模型选型和成本估算的开发者可以直接抄里面的 quickstart 代码。

正文 · AI 翻译

Gemini 2.5 Flash 是什么?

Gemini 2.5 Flash 是谷歌面向需要推理能力的高吞吐量、延迟敏感型任务所推出的主力模型。它是首款具备内置思考能力的 Flash 系列模型,其混合推理模式可随意开启或关闭。这一特性使其与 2.0 Flash 有本质区别,值得将其与成本高得多的模型进行对比评估。

核心能力

Gemini 2.5 Flash 支持以下输入类型:文本、代码、图像、音频、视频和文档。对于文档输入,在生产环境中有两项限制:每个文档的最大文件大小为 50MB(超出此限制的文件必须在提交前拆分为小于 50MB 的多个部分)。支持的文档 MIME 类型仅限于 `application/pdf` 和 `text/plain`。

不支持的功能:音频生成、图像生成以及 Live API。如果您需要图像生成功能,请使用 Gemini 2.5 Flash Image,这是一个独立的模型。

“思考”在实际应用中的含义

思考预算是一个参数,用于控制在生成回复之前模型执行多少内部推理。这在推理过程中内置于模型架构中。将预算设置为 0 会完全禁用此功能,从而产生最快、最便宜的输出。将其设置为 -1 则会启用动态模式,模型会根据提示词的复杂度自动调整推理深度。在谷歌的官方 API 上,-1 是默认值。通过 OpenRouter 使用时,思考功能默认关闭,除非您明确请求开启(请参阅下方的“通过 OpenRouter 配置”部分)。更高的固定预算会提升复杂任务的输出质量,但代价是增加延迟和 token 消耗,并按输出速率计费。

Gemini 2.5 Flash API 定价

下表显示了三种访问方式下经过验证的每百万 token 费率。所有定价数据均来自 `ai.google.dev/gemini-api/docs/pricing` 和 `openrouter.ai/google/gemini-2.5-flash`。请对照撰写本文当天的实时页面验证 OpenRouter 和 Vertex AI 的数据;费率会随时更新,恕不另行通知。

验证日期:2026 年 5 月

提供商 输入 $/1M 输出 $/1M(含思考) 缓存读取 缓存存储 音频输入
Google AI Studio(付费版) $0.30 $2.50 $0.03 $1.00/M/小时 $1.00
Vertex AI 请参阅 Vertex AI 定价 请参阅 Vertex AI 定价 请参阅 Vertex AI 定价 查看 Vertex AI 定价 查看 Vertex AI 定价
OpenRouter 0.30 美元 2.50 美元 0.03 美元 在实时页面验证 1.00 美元

截至 2026 年 5 月,Google AI Studio 的付费套餐与 OpenRouter 在文本输入和输出的每个模型 token 费率上保持一致。每个模型 token 的价格相同。两者的区别在于 API 调用所附带的周边服务。

OpenRouter 位于你的代码与 3 家 Google 服务提供商(AI Studio、Vertex Global、Vertex)之间。如果其中一家出现故障,你的请求会自动路由到正常运行的提供商,无需修改代码。

你的集成方案并非与 Gemini 绑定。更改模型字符串,即可调用 Claude、GPT-4o、Llama 或 300 多个模型中的任意一个。使用相同的 Base URL、相同的 SDK、相同的 API 密钥。无需重写客户端,即可在数秒内切换模型。

计费整合到一个控制面板:一张账单、一个 API 密钥,涵盖所有模型和提供商。无需再分别管理 Google、Anthropic 和 OpenAI 的独立账户。

对于投入生产环境的团队,OpenRouter 提供了企业级控制功能(资源调配、按密钥设置消费限额、使用情况分析、团队管理)。护栏和内容过滤可按请求进行配置,因此你无需自建审核模块即可实施安全策略。提示词日志记录和可观测性功能内置于控制面板中,用于调试生产流量。

OpenRouter 对按需付费(PAYG)的积分购买收取 5.5% 的平台费。这笔费用涵盖了上述的故障转移、路由、计费和工具。Google AI Studio 是直接路径,没有中间商费用,但你需要自行处理故障转移、模型可移植性和跨提供商计费。Vertex AI 的定价有所不同;在将其纳入生产成本估算之前,请查看 Vertex AI 定价页面了解当前费率。

如需了解 Gemini 2.5 Flash 在各提供商处的实时定价和运行状态,包括实时缓存费率和各提供商的有效定价,请查看 OpenRouter 模型页面。如需了解可降低重复上下文成本的缓存策略,请查看缓存定价详情。

思考模型 token 计费

思考模型 token 的计费费率与输出 token 相同。预算为 0 时,无思考成本。在最大预算(24,576 个 token)下,思考开销可能超过可见回复本身的成本。要估算特定工作负载的成本,请将预期的思考 token 数乘以输出费率,并将其加至标准输出 token 成本中。

免费使用选项

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和回复会被用于改进 Google 的产品;完整的数据使用政策请参阅服务条款。如果您的使用场景涉及用户数据,或要求数据不得用于模型训练,则必须使用付费套餐。

OpenRouter 的免费套餐不包含 Gemini 2.5 Flash。需要至少 5 美元的信用余额。

Vertex AI 为新 Google Cloud 账户提供 300 美元的试用额度,可用于评估期间的 Gemini 2.5 Flash 使用。

API 快速入门:5 分钟内发出首个请求

OpenRouter 路径无需 Google Cloud 账户,且兼容任何 OpenAI 兼容的 SDK。Google 直连路径需要 Google 账户和 google-genai SDK。有关更多 SDK 示例和配置选项,请参阅 OpenRouter 快速入门指南。

步骤 1:获取您的 API 密钥

OpenRouter 路径:获取您的 OpenRouter API 密钥。无需 Google Cloud 账户。

Google 直连路径:在 aistudio.google.com/apikey 获取密钥。

步骤 2:设置基础 URL(OpenRouter 路径)

OpenRouter 基础 URL 为 https://openrouter.ai/api/v1。以下三个代码示例均使用此端点。

步骤 3:发出您的首个请求

cURL:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer <your-openrouter-key>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemini-2.5-flash",
    "messages": [{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
  }'

Python(OpenAI SDK):

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
)

print(response.choices[0].message.content)

TypeScript(OpenAI SDK):

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://openrouter.ai/api/v1",
  apiKey: "<your-openrouter-key>",
});

const response = await client.chat.completions.create({
  model: "google/gemini-2.5-flash",
  messages: [{ role: "user", content: "Explain the difference between attention mechanisms in transformers." }],
});

console.log(response.choices[0].message.content);

Google 直连路径

如果您已有 Google AI Studio API 密钥,并希望使用无中间方的直连路径:

from google import genai

client = genai.Client(api_key="<your-google-api-key>")

response = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="Explain the difference between attention mechanisms in transformers.",
)

print(response.text)

直连路径使用 google-genai SDK,该 SDK 不兼容 OpenAI。从 OpenRouter 切换到直连路径需要同时更改您的客户端库和请求结构。直连路径上不存在提供商故障切换。

思考预算:控制推理质量与成本

思考预算是使用此模型时最重要的配置决策。设置不当,要么为不需要的推理能力多付费用,要么在需要推理的任务上牺牲准确性。完整参数参考,请参阅配置思考预算。

预算级别与权衡

在请求配置中设置 `thinkingBudget` 参数。取值范围为 0 到 24,576 个模型 token。

预算 0:禁用思考。响应最快,成本最低,无推理开销。适用于无需结构化推理的高并发分类、信息提取和摘要任务。

预算 -1(动态):模型根据提示词复杂度自动选择推理深度。这是 Google 官方 API 的默认设置。通过 OpenRouter,您必须显式地将 `max_tokens` 设置为 -1 才能启用动态模式;省略推理配置则会禁用思考。推荐用于大多数需要推理的工作负载;它能在简单提示词上避免支付高额推理费用,同时在任务需要时启用深度推理。

预算 1,024 到 8,192:中等至重度推理。适用于多步骤分析、结构化编码任务和研究型问题。

预算 24,576(最大值):最大推理深度,最高成本。适用于复杂数学、科学问题和硬编码挑战,在这些场景下准确性足以证明开销的合理性。

关键约束

如果您在编写第一个请求前不了解以下两个约束,它们会在生产环境中产生错误:

  1. `thinkingBudget` 和 `thinkingLevel` 不能在同一请求中使用。`thinkingBudget` 用于 Gemini 2.5 系列模型。`thinkingLevel` 用于 Gemini 3 系列模型。同时使用两者会返回 400 错误。

  2. 结构化 JSON 输出和搜索接地功能互斥。您无法在同一请求中同时启用两者。

通过 OpenRouter 进行配置

使用带有 `reasoning` 键的 `extra_body` 参数,通过 OpenRouter 的 API 设置思考预算:

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Solve this step by step: if f(x) = 3x^2 + 2x - 5, find all roots."}],
    extra_body={"reasoning": {"max_tokens": 8192}}
)

print(response.choices[0].message.content)

要完全禁用思考,请将 `max_tokens` 设置为 0。要使用动态模式,请将 `max_tokens` 设置为 -1。

跨提供商性能

OpenRouter 将 Gemini 2.5 Flash 路由至三家 Google 提供商,并实时追踪每家提供商的吞吐量、首 token 延迟(TTFT)、端到端延迟及运行时间。各提供商之间的差异显著,足以影响对延迟敏感型工作负载的提供商选择。

以下所有数据均需在 openrouter.ai/google/gemini-2.5-flash 页面进行实时验证。

各提供商性能表现

来源:OpenRouter 实时模型页面。

提供商 平均吞吐量 平均首 token 延迟 平均端到端延迟 运行时间
Google Vertex(全球) 约 75 tok/s 约 0.63 秒 请在实时页面验证 请在实时页面验证
Google AI Studio 请在实时页面验证 请在实时页面验证 请在实时页面验证 请在实时页面验证
Google Vertex 请在实时页面验证 请在实时页面验证 请在实时页面验证 请在实时页面验证

根据近期数据,Vertex 全球提供商展现出最高的吞吐量。AI Studio 在历史上表现出最佳运行时间。标准 Vertex 在三个提供商中延迟最高。当您通过 OpenRouter 路由而未指定提供商时,系统会根据实时信号自动将流量分配至状态最佳的选项。

如需了解 Gemini 2.5 Flash 的实时定价和运行时间,请参阅 OpenRouter 模型页面。

Gemini 2.5 Flash 对比 Flash Lite 对比 Pro

根据您的工作负载需求进行选择:

对于大多数智能体和推理工作负载,请使用 Gemini 2.5 Flash。当您需要思考能力但又不想承担 Pro 级别的成本时,这是默认推荐选项。

对于不需要思考能力且每次请求成本是主要限制条件的高容量分类、提取或翻译任务,请使用 Gemini 2.5 Flash Lite。Flash Lite 默认禁用思考功能。

对于复杂的推理任务,当准确性足以证明其比 Flash 高出 5 到 10 倍的成本溢价时,请使用 Gemini 2.5 Pro:前沿数学、硬编码挑战以及多步骤科学分析。

技术规格

下表是 Gemini 2.5 Flash 的权威参考。如需官方版本,请参阅 Google AI for Developers 模型页面(更新于 2026-04-01)和 Vertex AI 文档(更新于 2026-04-03)。

属性
模型 ID gemini-2.5-flash
OpenRouter 模型字符串 google/gemini-2.5-flash
上下文窗口 1,048,576 个 token
最大输出 65,536 个 token
输入类型 文本、图像、视频、音频、代码、文档(仅限 PDF 和纯文本格式,最大 50MB)
输出类型 文本
思考预算范围 0 至 24,576 个模型 token(默认值:动态 / -1)
知识截止日期 2025 年 1 月
正式发布 2025 年 6 月 17 日
停止服务 2026 年 10 月 16 日
支持的功能 函数调用、结构化输出、代码执行、搜索接地、批量 API、上下文缓存(隐式和显式)、文件搜索、URL 上下文
不支持 音频生成、图像生成、实时 API、thinkingLevel 参数

弃用通知:Gemini 2.5 Flash 计划于 2026 年 10 月 16 日在 Vertex AI 上停止服务。如果您正在构建的生产用例会延续到该日期之后,请规划迁移至后续模型,并关注 ai.google.dev/gemini-api/docs/models 上的更新。

常见问题解答

Gemini 2.5 Flash 可以免费使用吗?

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和响应会被用于改进 Google 的产品;在将其用于用户数据之前,请先查阅服务条款。OpenRouter 不将 Gemini 2.5 Flash 纳入其免费套餐;需要至少 5 美元的信用余额。Vertex AI 为新的 Google Cloud 账户提供 300 美元的试用信用额度。

Gemini 2.5 Flash 中的思考预算是什么?

thinkingBudget 参数(范围:0 到 24,576 个模型 token,或 -1 表示动态)控制模型在响应前执行多少内部推理。预算为 0 时禁用思考:速度最快且成本最低。预算为 -1 时启用动态模式:模型会根据提示词复杂度自动调整。在 Google 的直接 API 上,-1 是默认值。通过 OpenRouter 使用时,除非您明确请求(例如,使用 extra_body={"reasoning": {"max_tokens": -1}} 表示动态模式,或任何正数预算),否则思考功能处于关闭状态。较高的固定预算可以提升复杂任务上的输出质量,但会增加延迟和成本,并按输出 token 费率计费。

Gemini 2.5 Flash 与 GPT-4o 相比如何?

Flash 支持 100 万 token 的上下文窗口,而 GPT-4o 为 12.8 万,并且包含 GPT-4o 所不具备的可配置思考功能。Flash 的每 token 定价更低。GPT-4o 拥有更广泛的第三方生态系统支持和更长的生产记录。本指南未公布两者在相同评测上的直接基准对比;请使用 OpenRouter 排行榜获取当前的第三方评测数据。

我可以使用 Gemini 2.5 Flash 生成图像吗?

不可以。Gemini 2.5 Flash 仅输出文本。支持图像输入;该模型可以处理图像并对其进行推理。如需生成图像,请使用 Gemini 2.5 Flash Image,这是一个独立的模型,有其自己的定价。

在 OpenRouter 上,哪些提供商提供 Gemini 2.5 Flash 服务?

三家:Google AI Studio、Google Vertex Global 和 Google Vertex。OpenRouter 会根据实时吞吐量和运行时间数据,自动路由到运行最健康的提供商。您可以使用 OpenRouter 的提供商路由控制功能,固定使用特定提供商。

Gemini 2.5 Flash 和 Flash Lite 有什么区别?

Flash 包含可配置的思考功能(预算范围 0 到 24,576)和更高质量的输出。Flash Lite 针对超低延迟和成本进行了优化,默认情况下禁用思考功能(但可以启用)。当推理能力至关重要时,请使用 Flash;当每请求成本是主要限制因素的高量任务时,请使用 Lite。

来源:OpenRouter:Announcements(RSS) · openrouter.ai

同一事件 · 1

Gemini 2.5 Flash API - 定价、快速入门与提供商比较

OpenRouter:Announcements(RSS)·2026-06-10 00:00·68天前
AI 导读

Gemini 2.5 Flash API 支持配置思考预算(thinking budgets),用户可跨提供商进行比较,并在5分钟内完成首次API调用。

正文 · AI 翻译

Gemini 2.5 Flash 是什么?

Gemini 2.5 Flash 是谷歌面向需要推理能力的高吞吐量、延迟敏感型任务所推出的主力模型。它是首款具备内置思考能力的 Flash 系列模型,其混合推理模式可随意开启或关闭。这一特性使其与 2.0 Flash 有本质区别,值得将其与成本高得多的模型进行对比评估。

核心能力

Gemini 2.5 Flash 支持以下输入类型:文本、代码、图像、音频、视频和文档。对于文档输入,在生产环境中有两项限制:每个文档的最大文件大小为 50MB(超出此限制的文件必须在提交前拆分为小于 50MB 的多个部分)。支持的文档 MIME 类型仅限于 `application/pdf` 和 `text/plain`。

不支持的功能:音频生成、图像生成以及 Live API。如果您需要图像生成功能,请使用 Gemini 2.5 Flash Image,这是一个独立的模型。

“思考”在实际应用中的含义

思考预算是一个参数,用于控制在生成回复之前模型执行多少内部推理。这在推理过程中内置于模型架构中。将预算设置为 0 会完全禁用此功能,从而产生最快、最便宜的输出。将其设置为 -1 则会启用动态模式,模型会根据提示词的复杂度自动调整推理深度。在谷歌的官方 API 上,-1 是默认值。通过 OpenRouter 使用时,思考功能默认关闭,除非您明确请求开启(请参阅下方的“通过 OpenRouter 配置”部分)。更高的固定预算会提升复杂任务的输出质量,但代价是增加延迟和 token 消耗,并按输出速率计费。

Gemini 2.5 Flash API 定价

下表显示了三种访问方式下经过验证的每百万 token 费率。所有定价数据均来自 `ai.google.dev/gemini-api/docs/pricing` 和 `openrouter.ai/google/gemini-2.5-flash`。请对照撰写本文当天的实时页面验证 OpenRouter 和 Vertex AI 的数据;费率会随时更新,恕不另行通知。

验证日期:2026 年 5 月

提供商 输入 $/1M 输出 $/1M(含思考) 缓存读取 缓存存储 音频输入
Google AI Studio(付费版) $0.30 $2.50 $0.03 $1.00/M/小时 $1.00
Vertex AI 请参阅 Vertex AI 定价 请参阅 Vertex AI 定价 请参阅 Vertex AI 定价 查看 Vertex AI 定价 查看 Vertex AI 定价
OpenRouter 0.30 美元 2.50 美元 0.03 美元 在实时页面验证 1.00 美元

截至 2026 年 5 月,Google AI Studio 的付费套餐与 OpenRouter 在文本输入和输出的每个模型 token 费率上保持一致。每个模型 token 的价格相同。两者的区别在于 API 调用所附带的周边服务。

OpenRouter 位于你的代码与 3 家 Google 服务提供商(AI Studio、Vertex Global、Vertex)之间。如果其中一家出现故障,你的请求会自动路由到正常运行的提供商,无需修改代码。

你的集成方案并非与 Gemini 绑定。更改模型字符串,即可调用 Claude、GPT-4o、Llama 或 300 多个模型中的任意一个。使用相同的 Base URL、相同的 SDK、相同的 API 密钥。无需重写客户端,即可在数秒内切换模型。

计费整合到一个控制面板:一张账单、一个 API 密钥,涵盖所有模型和提供商。无需再分别管理 Google、Anthropic 和 OpenAI 的独立账户。

对于投入生产环境的团队,OpenRouter 提供了企业级控制功能(资源调配、按密钥设置消费限额、使用情况分析、团队管理)。护栏和内容过滤可按请求进行配置,因此你无需自建审核模块即可实施安全策略。提示词日志记录和可观测性功能内置于控制面板中,用于调试生产流量。

OpenRouter 对按需付费(PAYG)的积分购买收取 5.5% 的平台费。这笔费用涵盖了上述的故障转移、路由、计费和工具。Google AI Studio 是直接路径,没有中间商费用,但你需要自行处理故障转移、模型可移植性和跨提供商计费。Vertex AI 的定价有所不同;在将其纳入生产成本估算之前,请查看 Vertex AI 定价页面了解当前费率。

如需了解 Gemini 2.5 Flash 在各提供商处的实时定价和运行状态,包括实时缓存费率和各提供商的有效定价,请查看 OpenRouter 模型页面。如需了解可降低重复上下文成本的缓存策略,请查看缓存定价详情。

思考模型 token 计费

思考模型 token 的计费费率与输出 token 相同。预算为 0 时,无思考成本。在最大预算(24,576 个 token)下,思考开销可能超过可见回复本身的成本。要估算特定工作负载的成本,请将预期的思考 token 数乘以输出费率,并将其加至标准输出 token 成本中。

免费使用选项

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和回复会被用于改进 Google 的产品;完整的数据使用政策请参阅服务条款。如果您的使用场景涉及用户数据,或要求数据不得用于模型训练,则必须使用付费套餐。

OpenRouter 的免费套餐不包含 Gemini 2.5 Flash。需要至少 5 美元的信用余额。

Vertex AI 为新 Google Cloud 账户提供 300 美元的试用额度,可用于评估期间的 Gemini 2.5 Flash 使用。

API 快速入门:5 分钟内发出首个请求

OpenRouter 路径无需 Google Cloud 账户,且兼容任何 OpenAI 兼容的 SDK。Google 直连路径需要 Google 账户和 google-genai SDK。有关更多 SDK 示例和配置选项,请参阅 OpenRouter 快速入门指南。

步骤 1:获取您的 API 密钥

OpenRouter 路径:获取您的 OpenRouter API 密钥。无需 Google Cloud 账户。

Google 直连路径:在 aistudio.google.com/apikey 获取密钥。

步骤 2:设置基础 URL(OpenRouter 路径)

OpenRouter 基础 URL 为 https://openrouter.ai/api/v1。以下三个代码示例均使用此端点。

步骤 3:发出您的首个请求

cURL:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer <your-openrouter-key>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemini-2.5-flash",
    "messages": [{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
  }'

Python(OpenAI SDK):

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
)

print(response.choices[0].message.content)

TypeScript(OpenAI SDK):

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://openrouter.ai/api/v1",
  apiKey: "<your-openrouter-key>",
});

const response = await client.chat.completions.create({
  model: "google/gemini-2.5-flash",
  messages: [{ role: "user", content: "Explain the difference between attention mechanisms in transformers." }],
});

console.log(response.choices[0].message.content);

Google 直连路径

如果您已有 Google AI Studio API 密钥,并希望使用无中间方的直连路径:

from google import genai

client = genai.Client(api_key="<your-google-api-key>")

response = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="Explain the difference between attention mechanisms in transformers.",
)

print(response.text)

直连路径使用 google-genai SDK,该 SDK 不兼容 OpenAI。从 OpenRouter 切换到直连路径需要同时更改您的客户端库和请求结构。直连路径上不存在提供商故障切换。

思考预算:控制推理质量与成本

思考预算是使用此模型时最重要的配置决策。设置不当,要么为不需要的推理能力多付费用,要么在需要推理的任务上牺牲准确性。完整参数参考,请参阅配置思考预算。

预算级别与权衡

在请求配置中设置 `thinkingBudget` 参数。取值范围为 0 到 24,576 个模型 token。

预算 0:禁用思考。响应最快,成本最低,无推理开销。适用于无需结构化推理的高并发分类、信息提取和摘要任务。

预算 -1(动态):模型根据提示词复杂度自动选择推理深度。这是 Google 官方 API 的默认设置。通过 OpenRouter,您必须显式地将 `max_tokens` 设置为 -1 才能启用动态模式;省略推理配置则会禁用思考。推荐用于大多数需要推理的工作负载;它能在简单提示词上避免支付高额推理费用,同时在任务需要时启用深度推理。

预算 1,024 到 8,192:中等至重度推理。适用于多步骤分析、结构化编码任务和研究型问题。

预算 24,576(最大值):最大推理深度,最高成本。适用于复杂数学、科学问题和硬编码挑战,在这些场景下准确性足以证明开销的合理性。

关键约束

如果您在编写第一个请求前不了解以下两个约束,它们会在生产环境中产生错误:

  1. `thinkingBudget` 和 `thinkingLevel` 不能在同一请求中使用。`thinkingBudget` 用于 Gemini 2.5 系列模型。`thinkingLevel` 用于 Gemini 3 系列模型。同时使用两者会返回 400 错误。

  2. 结构化 JSON 输出和搜索接地功能互斥。您无法在同一请求中同时启用两者。

通过 OpenRouter 进行配置

使用带有 `reasoning` 键的 `extra_body` 参数,通过 OpenRouter 的 API 设置思考预算:

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Solve this step by step: if f(x) = 3x^2 + 2x - 5, find all roots."}],
    extra_body={"reasoning": {"max_tokens": 8192}}
)

print(response.choices[0].message.content)

要完全禁用思考,请将 `max_tokens` 设置为 0。要使用动态模式,请将 `max_tokens` 设置为 -1。

跨提供商性能

OpenRouter 将 Gemini 2.5 Flash 路由至三家 Google 提供商,并实时追踪每家提供商的吞吐量、首 token 延迟(TTFT)、端到端延迟及运行时间。各提供商之间的差异显著,足以影响对延迟敏感型工作负载的提供商选择。

以下所有数据均需在 openrouter.ai/google/gemini-2.5-flash 页面进行实时验证。

各提供商性能表现

来源:OpenRouter 实时模型页面。

提供商 平均吞吐量 平均首 token 延迟 平均端到端延迟 运行时间
Google Vertex(全球) 约 75 tok/s 约 0.63 秒 请在实时页面验证 请在实时页面验证
Google AI Studio 请在实时页面验证 请在实时页面验证 请在实时页面验证 请在实时页面验证
Google Vertex 请在实时页面验证 请在实时页面验证 请在实时页面验证 请在实时页面验证

根据近期数据,Vertex 全球提供商展现出最高的吞吐量。AI Studio 在历史上表现出最佳运行时间。标准 Vertex 在三个提供商中延迟最高。当您通过 OpenRouter 路由而未指定提供商时,系统会根据实时信号自动将流量分配至状态最佳的选项。

如需了解 Gemini 2.5 Flash 的实时定价和运行时间,请参阅 OpenRouter 模型页面。

Gemini 2.5 Flash 对比 Flash Lite 对比 Pro

根据您的工作负载需求进行选择:

对于大多数智能体和推理工作负载,请使用 Gemini 2.5 Flash。当您需要思考能力但又不想承担 Pro 级别的成本时,这是默认推荐选项。

对于不需要思考能力且每次请求成本是主要限制条件的高容量分类、提取或翻译任务,请使用 Gemini 2.5 Flash Lite。Flash Lite 默认禁用思考功能。

对于复杂的推理任务,当准确性足以证明其比 Flash 高出 5 到 10 倍的成本溢价时,请使用 Gemini 2.5 Pro:前沿数学、硬编码挑战以及多步骤科学分析。

技术规格

下表是 Gemini 2.5 Flash 的权威参考。如需官方版本,请参阅 Google AI for Developers 模型页面(更新于 2026-04-01)和 Vertex AI 文档(更新于 2026-04-03)。

属性
模型 ID gemini-2.5-flash
OpenRouter 模型字符串 google/gemini-2.5-flash
上下文窗口 1,048,576 个 token
最大输出 65,536 个 token
输入类型 文本、图像、视频、音频、代码、文档(仅限 PDF 和纯文本格式,最大 50MB)
输出类型 文本
思考预算范围 0 至 24,576 个模型 token(默认值:动态 / -1)
知识截止日期 2025 年 1 月
正式发布 2025 年 6 月 17 日
停止服务 2026 年 10 月 16 日
支持的功能 函数调用、结构化输出、代码执行、搜索接地、批量 API、上下文缓存(隐式和显式)、文件搜索、URL 上下文
不支持 音频生成、图像生成、实时 API、thinkingLevel 参数

弃用通知:Gemini 2.5 Flash 计划于 2026 年 10 月 16 日在 Vertex AI 上停止服务。如果您正在构建的生产用例会延续到该日期之后,请规划迁移至后续模型,并关注 ai.google.dev/gemini-api/docs/models 上的更新。

常见问题解答

Gemini 2.5 Flash 可以免费使用吗?

Google AI Studio 提供带有速率限制的免费套餐。在免费套餐中,您的提示词和响应会被用于改进 Google 的产品;在将其用于用户数据之前,请先查阅服务条款。OpenRouter 不将 Gemini 2.5 Flash 纳入其免费套餐;需要至少 5 美元的信用余额。Vertex AI 为新的 Google Cloud 账户提供 300 美元的试用信用额度。

Gemini 2.5 Flash 中的思考预算是什么?

thinkingBudget 参数(范围:0 到 24,576 个模型 token,或 -1 表示动态)控制模型在响应前执行多少内部推理。预算为 0 时禁用思考:速度最快且成本最低。预算为 -1 时启用动态模式:模型会根据提示词复杂度自动调整。在 Google 的直接 API 上,-1 是默认值。通过 OpenRouter 使用时,除非您明确请求(例如,使用 extra_body={"reasoning": {"max_tokens": -1}} 表示动态模式,或任何正数预算),否则思考功能处于关闭状态。较高的固定预算可以提升复杂任务上的输出质量,但会增加延迟和成本,并按输出 token 费率计费。

Gemini 2.5 Flash 与 GPT-4o 相比如何?

Flash 支持 100 万 token 的上下文窗口,而 GPT-4o 为 12.8 万,并且包含 GPT-4o 所不具备的可配置思考功能。Flash 的每 token 定价更低。GPT-4o 拥有更广泛的第三方生态系统支持和更长的生产记录。本指南未公布两者在相同评测上的直接基准对比;请使用 OpenRouter 排行榜获取当前的第三方评测数据。

我可以使用 Gemini 2.5 Flash 生成图像吗?

不可以。Gemini 2.5 Flash 仅输出文本。支持图像输入;该模型可以处理图像并对其进行推理。如需生成图像,请使用 Gemini 2.5 Flash Image,这是一个独立的模型,有其自己的定价。

在 OpenRouter 上,哪些提供商提供 Gemini 2.5 Flash 服务?

三家:Google AI Studio、Google Vertex Global 和 Google Vertex。OpenRouter 会根据实时吞吐量和运行时间数据,自动路由到运行最健康的提供商。您可以使用 OpenRouter 的提供商路由控制功能,固定使用特定提供商。

Gemini 2.5 Flash 和 Flash Lite 有什么区别?

Flash 包含可配置的思考功能(预算范围 0 到 24,576)和更高质量的输出。Flash Lite 针对超低延迟和成本进行了优化,默认情况下禁用思考功能(但可以启用)。当推理能力至关重要时,请使用 Flash;当每请求成本是主要限制因素的高量任务时,请使用 Lite。

来源:OpenRouter:Announcements(RSS)· openrouter.ai

同一事件 · 1