# 阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS

- 来源：IT之家（RSS）
- 发布时间：2026-07-20 16:55
- AIHOT 分数：68
- AIHOT 链接：https://aihot.virxact.com/items/cmrt1lhtq0fifbitl3fdq8ykc
- 原文链接：https://www.ithome.com/0/979/128.htm

## AI 摘要

阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS，包含首包延时300ms级别的Flash版本和面向高质量生成的Plus版本，后者在Artificial Analysis榜单夺冠。新模型支持文本嵌入[gasp]等标签调控语气，音频输出提升至48KHz，覆盖16种语言及20种方言，现已全面开放。

## 正文

IT之家 7 月 20 日消息，阿里千问今日发布语音合成大模型 Qwen-Audio-3.0-TTS，包含面向实时交互的 Flash 版本（首包延时 300ms 级别）和面向高质量生成的 Plus 版本。

官方表示，新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升，让合成语音从“能说话”走向“会表达”。在全球第三方权威榜单 Artificial Analysis，Qwen-Audio-3.0-TTS-Plus 斩获冠军。

据介绍，Qwen-Audio-3.0-TTS 支持在文本中嵌入结构化标签，用户可直接在文本里嵌入 [gasp]（抽气）、[giggles]（轻笑）、[angry]（愤怒）这类标记，直接对语气、情绪和 breath 类细节进行精准调控。

此外，该模型配套开箱即用的精品音色库，将模型在多语种、多方言、指令控制和细粒度表达上的能力沉淀为可直接调用的音色资源，将陆续上架指令风格音色、20 种方言音色、细粒度控制音色以及 14+ 小语种音色。并将音频输出从提升 24KHz 到 48KHz，相当于从电话和普通语音助手的品质提升到录音棚、影视配音的规格，单次语音合成可达 3 分钟。

面向全球多语种场景，Qwen-Audio-3.0-TTS-Plus 进行了专项优化，覆盖中、英、日、韩、德等 16 种语言，新增阿拉伯、越南、马来、菲律宾语；并支持广东、重庆、东北、陕西、上海、四川、云南等 20 种方言。

Qwen-Audio-3.0-TTS 现已全面开放，IT之家附链接：

Plus 版本：https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus

Flash 版本：https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash
