我们最新的 Gemini 模型提供了构建大规模 AI 智能体所需的效率、低延迟和可靠性。
Tulsee Doshi
产品管理高级总监,代表 Gemini 团队
构建生产级 AI 智能体的开发者和客户需要更高的模型 token 效率、更低的延迟和更可靠的性能。我们的 Flash 系列模型旨在满足效率与质量的最佳平衡点,从而支持智能体工作流的规模化扩展。在 Gemini 3.5 Flash 的基础上,我们推出了新的 Gemini 模型:
- 3.6 Flash:我们的主力模型,在编程、知识工作和多模态性能方面表现更佳。根据 Artificial Analysis Index,与 3.5 Flash 相比,其输出 token 使用量减少了 17%,而在 Datacurve 的 DeepSWE 等某些基准测试中,我们观察到降幅高达 65%,同时每个输出 token 的成本也更低。
- 3.5 Flash-Lite:我们最快、最具成本效益的 3.5 级别模型,根据 Artificial Analysis Index,每秒可输出 350 个 token,并且在智能体工作流中的表现也显著优于之前的 Flash-Lite 版本。
- CodeMender 中的 3.5 Flash Cyber:成功的网络安全应用需要将模型与智能体基础设施进行精心编排。我们推出了一款新型、高效、专注于网络安全的专用模型,并将其与我们的 CodeMender 代码安全智能体相结合,可在前沿领域提供具有竞争力的性能。
除了今天的发布内容,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,我们计划在其准备就绪后尽快广泛推出。与此同时,我们的团队已经在专注于构建下一代模型。我们已经启动了迄今为止最雄心勃勃的预训练任务,即 Gemini 4,并对取得的进展感到兴奋。
3.6 Flash:比 3.5 Flash 更高效、质量更高
Gemini 3.6 Flash 直接基于开发者和客户对 3.5 Flash 的反馈构建而成。3.6 Flash 不仅在编程和知识工作方面实现了显著提升,同时还大幅提高了模型 token 效率。例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 消耗的输出 token 比 3.5 Flash 少 17%。此外,它完成多步骤工作流所需的推理步骤和工具调用也更少。
这种增强的效率还伴随着比 3.5 Flash 更低的价格。输入 token 每百万个 1.50 美元,输出 token 每百万个 7.50 美元,3.6 Flash 降低了每个智能体任务的总成本,使得构建和运行智能体更具成本效益。
在 OSWorld 验证任务(API)中,3.6 Flash 相比 3.5 Flash 展现出更好的 token 效率和更低的冗余度。
尽管效率更高,3.6 Flash 在各类使用场景中相比 3.5 Flash 仍实现了性能提升:
- 3.6 Flash 在 DeepSWE 中(49% 对比 37%)以更少的非必要代码编辑和更少的执行循环实现了更高精度,并在 MLE Bench(63.9% 对比 49.7%)中展现出机器学习研究方面的显著改进。
- 它在 OSWorld-Verified(83.0% 对比 78.4%)中改进了计算机使用能力。计算机使用现在通过 Gemini API 和 Gemini Enterprise 成为内置的客户端工具。
- 它在知识工作方面优于 3.5 Flash,如 GDPval-AA v2(1421 对比 1349)等基准测试所示。Hebbia 和 Harvey 等客户发现它在多模态任务(如文档解析、图表和数据分析以及报告起草)中尤其出色。
在 AIS 上使用托管智能体的 3.6 Flash,比 3.5 Flash 能更高效、更准确地解析和分析金融数据及记录(AIS)。
在 AGY 上使用多智能体编排的 3.6 Flash,执行代码迁移时延迟更低、质量高于 3.5 Flash(AGY)。
3.6 Flash 使用画布(Gemini 应用)帮助开发用于 3D 工作流的照片纹理提取器。
3.6 Flash 利用 AGY 和 tldraw 离线编辑器,凭借其强大的视觉理解能力构建交互式主题工作室(AGY)。
客户报告称,3.6 Flash 在成本和质量上均向前迈进了一步,在复杂工作流和基于知识的任务中平衡了 token 效率、准确性和速度:
以安全为本构建
3.6 Flash 在化学、生物、放射性和核(CBRN)以及网络攻击滥用领域,配备了增强的前沿安全防护措施。这些防护措施使模型对越狱攻击的抵抗力大幅提升。同时,该模型经过训练,能最大限度减少对有益用途的拒绝。
更多信息,请参阅 3.6 Flash 模型卡。
3.5 Flash-Lite:专为规模化智能体工作流而构建
除了 Flash 之外,我们还发布了 Gemini 3.5 Flash-Lite,它专为低延迟任务以及高吞吐量对开发者工作流至关重要的任务而设计,例如智能体搜索和文档处理。
3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根据 Artificial Analysis 的测量,其运行速度为 350 输出 token/秒。定价为每 100 万输入 token 0.3 美元,每 100 万输出 token 2.5 美元,并且质量显著优于 3.1 Flash-Lite,为运行高吞吐量生产流量的开发者和客户提供了强大的性价比。
3.5 Flash-Lite 执行高容量任务时的延迟低于 3.5 Flash。
3.5 Flash-Lite 能够高效地扩展智能体系统。在各个思考层级上,该模型均显著优于 3.1 Flash-Lite。根据工作负载的不同,开发者可以配置模型,在最低和低思考层级下优先执行低延迟、低成本的高容量任务,或者启用更高的思考层级来处理多步骤子智能体工作负载。该模型现在还内置了计算机使用能力,以可靠地支持跨平台的这些智能体任务。
它在编码和智能体任务方面有显著提升,如 Terminal-Bench 2.1 所示(54% 对比 31%);在长上下文方面,如 GDM-MRCR v2 所示(72.2% 对比 60.1%);以及在真实世界任务执行方面,如 GDPval-AA v2 所示(1140 对比 642)。
事实上,在许多智能体和编码评测中,3.5 Flash-Lite 甚至优于 3 Flash,包括在 SWE-Bench Pro(54.2% 对比 49.6%)和 OSWorld-Verified(74.0% 对比 65.1%)上,使其成为 2.5 和 3 Flash 工作负载中更快、能力更强的选择。
3.5 Flash-Lite 从海量电商数据集中提取产品特征并进行综合。
与作为主智能体的 3.6 Flash 协同工作,3.5 Flash-Lite 能即时生成 25 个独特、可直接探索的网页设计概念。
3.5 Flash-Lite 凭借其多模态理解能力,可以规模化地处理收据翻译和摘要任务。
3.5 Flash-Lite 通过即时生成并迭代多个选项来构建一个游戏。
3.5 Flash-Lite 的早期客户正强调其在规模化智能体工作流和数据处理任务时,速度、智能与成本效益的独特组合。
有关该模型的更多信息,请参阅 3.5 Flash-Lite 模型卡。
CodeMender 中的 3.5 Flash Cyber:高效发现并修复漏洞
AI 模型已能比当前系统修复漏洞的速度更快地发现安全漏洞。应对这一日益增长的威胁,需要一种既高效又强大的软件安全方法。
Flash 的性能与效率使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber 基于 3.5 Flash 构建,并针对发现和修复网络安全漏洞进行了微调,其每 token 价格低于更大规模的模型。
在 CodeMender(它使用多个 3.5 Flash Cyber 智能体协同工作以生成一份综合报告)中,3.5 Flash Cyber 在热门基准测试 CyberGym 上达到了前沿水平的竞争力。
鉴于该技术的双重用途性质,我们在部署 3.5 Flash Cyber 时采取了审慎的方法。该模型将很快通过 CodeMender 以有限访问试点项目的形式,独家提供给政府和受信任的合作伙伴。这将使一线防御者能够在关键漏洞被利用之前抢先发现并修复它们,同时降低更广泛滥用的风险。
3.6 Flash 和 3.5 Flash-Lite:立即开始使用
3.6 Flash 和 3.5 Flash-Lite 即日起可用:
- 面向 Gemini API 中的开发者,可通过 Google AI Studio 和 Android Studio 使用。3.6 Flash 也可在 Google Antigravity 中使用。请参阅开发者指南开始使用。
- 面向 Gemini Enterprise Agent Platform 中的企业用户。3.6 Flash 也可在 Gemini Enterprise 应用中使用。
- 面向所有人,可通过 Gemini 应用使用。3.5 Flash-Lite 也正在 Google 搜索中逐步推出。
当您开始使用 3.6 Flash 和 3.5 Flash-Lite 进行构建时,我们欢迎您提供反馈,以帮助改进未来的 Gemini 模型,并期待很快发布 3.5 Pro。