Gemini 3.1 Flash TTS:下一代表现力AI语音技术

Google Blog:AI(RSS)·2026-04-15 23:00·136天前·Vilobh Meshram
AI 导读

Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

Google Blog:AI(RSS)
精选
70AI 编辑部评分,满分 100

Gemini 3.1 Flash TTS:下一代表现力AI语音技术

2026-04-15 23:00· 136天前· Vilobh Meshram
AI 导读

Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

推荐理由

Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

正文 · AI 翻译

我们最新的音频模型引入了精细的音频标签,让你能够精确控制 AI 语音,从而实现富有表现力的音频生成。

总体摘要

Gemini 3.1 Flash TTS 现已推出,为你带来更出色的 AI 语音质量和控制能力。现在,你可以使用音频标签在超过 70 种语言中调整语音风格和语速。在 Google AI Studio、Vertex AI 和 Google Vids 中试用它,并且所有音频都通过 SynthID 添加了水印,以防止错误信息传播。

要点列表

“Gemini 3.1 Flash TTS” 是一款新的 AI 语音模型,具有更好的可控性、表现力和质量。

该模型提升了语音质量,使其听起来比之前的版本更自然。

音频标签让你能够使用自然语言指令控制语音风格、语速和表达方式。

开发者可以使用 Google AI Studio 微调语音并导出设置,以便一致使用。

Gemini 3.1 Flash TTS 支持 70 多种语言,并使用 SynthID 水印技术来标识 AI 生成的音频。

基础解释

Gemini 3.1 Flash TTS 是一种新的人工智能,能让计算机语音听起来更真实。它允许人们通过在文本中使用特殊指令来改变 AI 的说话方式。这个 AI 能说超过 70 种语言,并会在音频中添加隐藏水印。这有助于人们识别出这是 AI 生成的,而非真人声音。

总体摘要

要点列表

基础解释

今天,我们推出 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,提供了更强的可控性、表现力和质量——赋能开发者、企业和日常用户构建下一代 AI 语音应用。

从今天开始,3.1 Flash TTS 将逐步推出:

面向开发者,通过 Gemini API 和 Google AI Studio 提供预览版

面向企业,在 Vertex AI 上提供预览版

面向 Workspace 用户,通过 Google Vids 提供

提升的语音质量和可控性

我们提升了 Gemini 3.1 Flash TTS 的整体语音质量,使其成为迄今为止最自然、最具表现力的模型。在 Artificial Analysis TTS 排行榜(一个收集了数千份盲测人类偏好的基准测试)上,3.1 Flash TTS 取得了令人瞩目的 1,211 Elo 评分。

Artificial Analysis 已将 Gemini 3.1 Flash TTS 定位在其“最具吸引力象限”中,因其在高品质语音生成与低成本之间实现了理想平衡。该模型凭借原生多说话人对话、支持 70 多种语言以及通过自然语言实现精细创意控制而进一步脱颖而出。

全新音频标签,实现更具表现力的语音生成

3.1 Flash TTS 还引入了音频标签——一种控制语音风格、语速和表达方式的直观方法。通过将自然语言指令直接嵌入文本输入,你可以以更高的精细度引导 AI 语音输出。

你可以在 Google AI Studio 中开始尝试这些音频标签以及其他开发者体验更新,通过可配置的控制项让开发者坐上“导演椅”:

场景指导:通过定义环境并提供具体的对话指令来设定舞台。这种世界观构建语境有助于角色保持“入戏”,并在多轮对话中自然地相互回应。

说话人级别特异性:使用独特的音频配置文件为角色配音,然后指定导演笔记来切换语速、语气和口音。通过使用行内标签,说话人可以从这些高级设置中切换,在句子中间改变表达方式。

无缝导出:一旦表演达到完美,这些精确参数可以导出为 Gemini API 代码,确保在不同项目和平台上保持一致且可辨识的声音。

借助这些新配置,开发者可以提升特定场景的精确度,打造令人难忘的角色和沉浸式音频体验。

立即在 Google AI Studio Playground 中开始使用高保真语音生成。

为全球规模而构建

Gemini 3.1 Flash TTS 在 70 多种语言中提供高保真语音和更精确的控制。这些核心优化将先进的风格、语速和口音控制引入主要市场——帮助开发者在全球范围内为用户打造本地化、富有表现力的语音体验。

早期开发者和企业测试人员已经看到了 3.1 Flash TTS 的影响,他们对其出色的可控性和表现力赞不绝口。他们告诉我们,音频标签提供了一种全新的创作精度,能将简单的文本转化为高保真的人声演绎。

使用 SynthID 添加水印

Gemini 3.1 Flash TTS 生成的所有音频均使用 SynthID 添加水印。这种不可察觉的水印直接嵌入音频输出中,能够可靠地检测 AI 生成的内容,从而帮助防止虚假信息传播。如需了解更多关于我们在安全与责任方面的做法,可以查阅模型卡片。

来源:Google Blog:AI(RSS)· blog.google