# Qwen-Audio-3.0-TTS 发布：从"能说话"到"会表达"

- 来源：公众号：通义实验室（千问）
- 作者：通义实验室
- 发布时间：2026-07-20 16:54
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsdu3gxy014srofzykvf6pkj
- 原文链接：https://mp.weixin.qq.com/s?__biz=MzkxMTYyMTAzNA%3D%3D&mid=2247501821&idx=1&sn=48ad8d176a6373940bf5c60b2cbb6b7a

## 精选理由

从「能说话」到「会表达」，区别在于用自然语言指令和标签精确控制情绪与细节，这为需要多语种和方言的商业场景降低了声音设计门槛。

## AI 摘要

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型，含 Flash 与 Plus 两个版本，首包延迟约 300ms。模型支持 16 种语言和 20 种方言，Plus 版在 Artificial Analysis 榜单夺冠，平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性，音频输出提升至 48K，单次合成最长 3 分钟。

## 正文

公众号正文需在微信内阅读，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
